InSpatio World 1.5, Sol Refiner ve PixelUMM Nedir?
5 dk okuma
Bu hafta görüntü ve video tarafında üç araştırma çalışması öne çıktı: InSpatio World 1.5, Nvidia'nın SoL-Refiner'ı (videoda "Sol Refiner") ve PixelUMM. Biri tek bir görselden sahnenin içinde gezen video üretiyor, biri düşük çözünürlüklü videoyu tek adımda 4K'ya çıkarıyor, üçüncüsü ise görüntü üretiminin temel mimarisini sorguluyor.
Bu yazı, YouTube'daki AI Search kanalının haftalık yapay zekâ haberleri videosunun ilgili bölümlerini özetleyip üç projenin kendi sayfalarındaki bilgilerle genişletiyor; videonun bağlantısı en sonda. Bu bir haber ve derleme yazısıdır; araçları ben denemedim. Rakamlar araştırmacıların kendi ölçümleri.
InSpatio World 1.5 nedir?
InSpatio World, bir görseli ve bir kamera yolunu alıp o yol boyunca sahnede gezen bir video üretiyor. Sürüm 1.0, tek bir videodan orijinal kamera görüşünün ötesinde bir dünya kurma fikriyle çıkmıştı. 1.5, girdi seçeneklerini ve görüş açısı aralığını genişletiyor:
- Girdi: Tek bir görsel, bir görsel seti, bir panorama ya da bir video. Birden çok görsel tutarlılığı artırıyor.
- Gerçek zamanlı sahne gezintisi: Tek bir görselden başlayıp sahneyi geniş bir açı aralığından keşfedebiliyorsunuz; orijinal görüntüde gizli kalan alanlar ortaya çıkıyor ve yeni görünen alanlar kaynak görselin gerçekçiliği ve stiliyle tutarlı kalıyor.
- Dinamik dünyalarda sonraki görüşü tahmin etme: Video girdisiyle hareketli sahnede görüş noktasını özgürce değiştirebilir ve olayın hangi anında bakacağınıza siz karar verebilirsiniz. Videoya göre kaynak videodaki hareket de sahneye taşınıyor.
- Bullet-time (kamerayla zamanı donduran efekt): Birden çok senkron görselden başlayıp nesnenin etrafında bir kamera yolu tasarlayarak akıcı bir bullet-time sahnesi kurabiliyorsunuz.
Sayfa, kamera sert biçimde hareket ederken bile öznenin kimliğinin, mekânsal yapının ve sahne ayrıntılarının korunduğunu belirtiyor. Canlı demo, kod, Hugging Face ve ModelScope bağlantıları yayında; kod açık kaynak. Videoya göre model Wan 2.1'in 1,3 milyar parametreli sürümüne dayanıyor ve 6 GB'tan küçük; yani çoğu tüketici ekran kartına sığabilir. Sunucu, MiniMax H3 yerine bu temelin seçilmesine şaştığını söylüyor. Proje sayfası: inspatio.github.io/inspatio-world-1.5.
Kimler için? Sinematografi ve görsel efekt, sürükleyici deneyimler, mekânsal ve gömülü zekâ araştırmaları (robotlar için dinamik ortam modelleme) sayfada sayılan kullanım alanları.
SoL-Refiner nedir?
SoL-Refiner, "Speed-of-Light One-Step Refinement for High-Resolution Video" (yüksek çözünürlüklü video için ışık hızında tek adımlı iyileştirme). Nvidia Research'ün Efficient AI ekibi ve Singapur laboratuvarının çalışması. Fikir şu: yüksek çözünürlüklü video üretimi pahalı, çünkü hesaplama uzay-zaman jetonlarının sayısıyla hızla artıyor. Önce düşük çözünürlükte bir taslak üretip sonra bir iyileştirici (refiner) uygulamak pratik bir yol; ama klasik çok adımlı iyileştirme ikinci bir örnekleme darboğazı getiriyor. SoL-Refiner, farklı üretici modellerin düşük çözünürlüklü çıktısını tek bir hedef çözünürlük adımıyla 4K videoya çeviriyor.
Eğitim tarifi üç parçadan oluşuyor: yüksek çözünürlükte sürekli eğitim, kare tabanlı pekiştirmeli öğrenme ile ince ayar ve tek adımlı dağılım eşleştirme distilasyonu. Videoya göre LTX Refiner'dan türetilmiş.
SoL-Refiner ölçümleri
Sayfadaki hız ölçümleri (araştırmacıların kendi ölçümü):
| Üretici model | Doğrudan üretim | Taslak + tek adım iyileştirme | Hızlanma |
|---|---|---|---|
| MiniMax H3 (5 sn, 1344×768, 24 kare/sn, GB200) | 152,3 sn | 5,64 sn | 27,03× |
| Wan (1280×720, 81 kare, H100) | 272,69 sn | 78,71 sn | 3,46× |
| Cosmos-Nano (35 adım, 189 kare, H100) | (35 adımlı doğrudan) | Tek adım iyileştirmeyle | 2,81× |
| SANA-Video (81 kare, H100) | 20,04 sn | 12,54 sn | 1,60× |
MiniMax H3 örneğinde iki GPU'lu bir hat kullanılıyor: birinci aşama 896×512'de 4,06 sn, iyileştirici 1,56 sn. Sayfa ayrıca 2K'da rekabetçi sonuç aldığını ve 4K'da LTX-2.3'e göre raporlanan iki ölçütü de iyileştirdiğini belirtiyor.
Videodaki sunucunun asıl eleştirisi ise sadakat: SoL-Refiner çok daha keskin sonuç veriyor ama videoda gösterilen örneklerde ayrıntıları kayda değer ölçüde değiştiriyor; ahırın detayları büyütmeden sonra farklı. Sayfadaki "iyileştirici kapalı/açık" karşılaştırmaları, yüz, saç, kumaş ve doku gibi ayrıntılarda artış gösteriyor. Ürün, yüz ya da metin gibi ayrıntının önemli olduğu işlerde çıktıyı orijinalle karşılaştırmanız gerekir. Kod yayınlandı. Proje sayfası: nvlabs.github.io/Sana/Sol-Refiner.
PixelUMM nedir?
PixelUMM, görsel ve videoyu hem anlayan hem üreten birleşik bir model; Nvidia ve Waterloo Üniversitesi araştırmacılarının çalışması. Ayırt edici yanı mimari: VAE de görüntü kodlayıcı da yok. Tek bir yalnızca-çözücü (decoder-only) Transformer ham pikselleri okuyup yazıyor. Görseller 16×16'lık yamalara, videolar 4 karelik tüplere bölünüyor. Omurga Qwen3-8B; anlama ve üretim için ayrı "uzman" katmanlar var ve hepsi metin, temiz piksel ve gürültülü piksel arasında tek bir öz-dikkati paylaşıyor.
Çoğu görsel ve video modeli içeriği, VAE ile sıkıştırılmış bir "gizli uzay"da (latent space) üretir ve sonra pikselleri geri çözer. PixelUMM bu adımı atıyor. Videodaki sunucu bunu "kodlayıcı yok" diye anlatıyor; sayfaya göre doğrusu hem VAE'nin hem görüntü kodlayıcının olmaması.
Sayfanın açıkça yazdığı sınırlama: doğrusal piksel çıkış başlığı, pürüzsüz bölgelerde (gökyüzü gibi) ızgaraya hizalı hafif yama izleri bırakabiliyor; bu izler yüksek sınıflandırıcısız yönlendirme değerinde (CFG ~6) belirginleşiyor. Evrişimli başlıklar bunu azaltıyor ama yayımlanan model, bütün demolar ve sayfadaki videolar varsayılan doğrusal başlıkla üretilmiş; evrişimli başlığa geçmek ek eğitim gerektiriyor. Sayfada 1,7 milyar ve 8 milyar parametreli sürümler ve piksel uzayı ile VAE uzayı eğitimi karşılaştırması da var.
Videodaki yargı net: kalite ve tutarlılık öncü modellere yetişmiyor. Ama bu, yeni bir mimarinin araştırma önizlemesi; kod ve model yayınlandı, kaynak dosyaların çoğu izin veren Apache 2 lisansı altında. Proje sayfası: nv-tlabs.github.io/PixelUMM.
Üçü bir arada
| InSpatio World 1.5 | SoL-Refiner | PixelUMM | |
|---|---|---|---|
| Ne yapıyor | Görselden/videodan kamera yolu boyunca sahnede gezinme | Düşük çözünürlüklü videoyu tek adımda 4K'ya çıkarma | Piksel uzayında görsel ve video anlama ve üretme |
| Temel | Wan 2.1 1.3B tabanlı (videoya göre) | Farklı üreticilerle çalışan iyileştirici | Qwen3-8B omurgalı Transformer |
| Güçlü yan | Çok girdili, tutarlı gezinti | MiniMax H3'te 27× uçtan uca hızlanma | VAE'siz mimari |
| Zayıf yan | Sayfada belirtilmiyor | Ayrıntıları değiştiriyor | Öncü modellerin gerisinde, yama izleri |
Hızlandırma tarafı için aynı haftanın DMAD ve PDMD yazısına, açık kaynak video modeli kurmak için LTX 2.5 nasıl kurulur rehberine bakabilirsiniz.
Sık Sorulan Sorular
InSpatio World 1.5 hangi girdileri kabul ediyor?
Tek görsel, görsel seti, panorama ya da video.
SoL-Refiner videoyu sadık biçimde büyütüyor mu?
Hayır. Çok daha keskin sonuç veriyor ama ayrıntıları değiştiriyor; videodaki örneklerde fark görülüyor. Sayfadaki hız ölçümleri ise MiniMax H3'te 27 kata varan uçtan uca hızlanma gösteriyor.
PixelUMM'in farkı ne?
VAE ve görüntü kodlayıcı olmadan, tek bir Transformer ile doğrudan piksel uzayında çalışıyor. Kalitesi henüz öncü modelleri yakalamıyor.
Üçü de açık mı?
Videoya göre üçünün de kodu yayınlandı. PixelUMM'in kaynak dosyalarının çoğu Apache 2 lisansında; diğerlerinin lisansı için proje sayfalarına bakın.
Kaynak
- AI Search, Gemini 4, GPT 6.1, Dots, Claude Sonnet 5.5, Ideogram 4.5, Flux 3: AI NEWS (YouTube, 4 Ekim 2026): InSpatio World 1.5, Sol Refiner ve PixelUMM bölümleri.
- InSpatio, InSpatio-World 1.5: proje sayfası.
- Nvidia Research, SoL-Refiner: proje sayfası ve ölçümler.
- Nvidia ve Waterloo Üniversitesi, PixelUMM: proje sayfası.
İlgili Yazılar
DMAD ve PDMD: 4 Adımda Yapay Zekâ Video Üretimi
ByteDance'in DMAD ve PDMD yöntemleri MiniMax H3'ü 4 adımda çalıştırıyor. PDMD, VideoGen-Eval'de 50 adımlı öğretmen modelin toplam skorunu geçiyor.
Comfy Agent Nedir? ComfyUI'da Düğümleri Ajan Kuruyor
Comfy Agent, ComfyUI'a gömülü ajan: istediğinizi yazıyorsunuz, iş akışını planlıyor, kuruyor ve çalıştırıyor. Şimdilik Comfy Cloud'da, ücretsiz denenebiliyor.
LTX 2.5 Nedir? Bedava Açık Kaynak Yapay Zeka Video Üretici
LTX 2.5, sesli video üreten 22 milyar parametreli açık ağırlıklı bir model. Ne yaptığı, lisansı, neden bedava sayıldığı ve kimler için uygun olduğu burada.