İçeriğe geç / Skip to content / Zum Inhalt

Was sind InSpatio World 1.5, Sol Refiner und PixelUMM?

Ahmet Balaman

6 Min. Lesezeit

KI-VideoInSpatio World 1.5Sol RefinerPixelUMMNvidiaVideo-Upscaling
Was sind InSpatio World 1.5, Sol Refiner und PixelUMM?

Drei Forschungsarbeiten fielen diese Woche bei Bild und Video auf: InSpatio World 1.5, Nvidias SoL-Refiner (im Video „Sol Refiner" genannt) und PixelUMM. Eine macht aus einem einzelnen Bild ein Video, das durch die Szene wandert, eine skaliert niedrig aufgelöstes Video in einem Schritt auf 4K, und die dritte stellt die Grundarchitektur der Bilderzeugung in Frage.

Dieser Artikel fasst die betreffenden Abschnitte des wöchentlichen KI-News-Videos des YouTube-Kanals AI Search zusammen und erweitert sie um Angaben von den Seiten der drei Projekte; der Link zum Video steht am Ende. Das ist eine Nachrichtenzusammenstellung, ich habe die Werkzeuge nicht getestet. Die Zahlen sind die eigenen Messungen der Forschenden.

Was ist InSpatio World 1.5?

InSpatio World nimmt ein Bild und einen Kamerapfad und erzeugt ein Video, das entlang dieses Pfads durch die Szene wandert. Version 1.0 erschien mit der Idee, aus einem einzelnen Video eine Welt jenseits der ursprünglichen Kameraansicht aufzubauen. 1.5 erweitert die Eingabeoptionen und den Bereich der Blickwinkel:

  • Eingabe: Ein einzelnes Bild, ein Bildsatz, ein Panorama oder ein Video. Mehrere Bilder erhöhen die Konsistenz.
  • Szenenerkundung in Echtzeit: Ausgehend von einem einzelnen Bild können Sie die Szene aus einem weiten Bereich von Blickwinkeln erkunden; im Originalbild verdeckte Bereiche werden sichtbar, und neu sichtbare Bereiche bleiben mit Realismus und Stil des Quellbilds konsistent.
  • Vorhersage der nächsten Ansicht in dynamischen Welten: Mit Videoeingabe können Sie den Blickpunkt frei durch eine bewegte Szene führen und selbst wählen, wann Sie das Geschehen betrachten. Laut Video wird auch die Bewegung des Quellvideos in die Szene übernommen.
  • Bullet Time (Effekt der Kamera, die um eingefrorene Zeit kreist): Ausgehend von mehreren synchronisierten Bildern können Sie einen Kamerapfad um das Motiv entwerfen und eine flüssige Bullet-Time-Sequenz bauen.

Die Seite hält fest, dass Identität des Motivs, räumliche Struktur und Szenendetails auch bei starker Kamerabewegung erhalten bleiben. Eine Live-Demo, Code, Hugging Face und ModelScope sind verfügbar; der Code ist Open Source. Laut Video basiert das Modell auf der Version von Wan 2.1 mit 1,3 Milliarden Parametern und ist kleiner als 6 GB, passt also auf die meisten Consumer-Grafikkarten. Der Moderator zeigt sich überrascht, dass diese Basis statt MiniMax H3 gewählt wurde. Projektseite: inspatio.github.io/inspatio-world-1.5.

Für wen? Kinematografie und visuelle Effekte, immersive Erlebnisse sowie Forschung zu räumlicher und verkörperter Intelligenz (dynamische Umgebungsmodellierung für Roboter) sind die auf der Seite genannten Einsatzfelder.

Was ist SoL-Refiner?

SoL-Refiner steht für „Speed-of-Light One-Step Refinement for High-Resolution Video" (einstufige Verfeinerung in Lichtgeschwindigkeit für hochaufgelöstes Video). Es ist eine Arbeit des Efficient-AI-Teams von Nvidia Research und des Labors in Singapur. Die Idee: Hochaufgelöste Videoerzeugung ist teuer, weil der Rechenaufwand mit der Zahl der raumzeitlichen Tokens schnell wächst. Erst einen niedrig aufgelösten Entwurf zu erzeugen und dann einen Refiner anzuwenden, ist ein praktischer Weg; die klassische mehrstufige Verfeinerung bringt aber einen zweiten Sampling-Engpass mit. SoL-Refiner wandelt die niedrig aufgelöste Ausgabe verschiedener Generatormodelle mit einem einzigen Schritt in Zielauflösung in 4K-Video um.

Das Trainingsrezept besteht aus drei Teilen: kontinuierliches Training in hoher Auflösung, Nachtraining per bildbasiertem Reinforcement Learning und einstufige Distribution-Matching-Destillation. Laut Video ist es vom LTX Refiner abgeleitet.

Messwerte von SoL-Refiner

Tempomessungen auf der Seite (eigene Messungen der Forschenden):

Generator Direkte Erzeugung Entwurf + einstufige Verfeinerung Beschleunigung
MiniMax H3 (5 s, 1344×768, 24 fps, GB200) 152,3 s 5,64 s 27,03-fach
Wan (1280×720, 81 Bilder, H100) 272,69 s 78,71 s 3,46-fach
Cosmos-Nano (35 Schritte, 189 Bilder, H100) (35 Schritte direkt) Mit einstufiger Verfeinerung 2,81-fach
SANA-Video (81 Bilder, H100) 20,04 s 12,54 s 1,60-fach

Das MiniMax-H3-Beispiel nutzt eine Pipeline mit zwei GPUs: Stufe eins braucht bei 896×512 4,06 s, der Refiner 1,56 s. Die Seite hält außerdem fest, dass es bei 2K konkurrenzfähig ist und bei 4K zwei berichtete Kennzahlen gegenüber LTX-2.3 verbessert.

Die Hauptkritik des Moderators im Video betrifft die Treue: SoL-Refiner liefert viel schärfere Ergebnisse, verändert aber in den gezeigten Beispielen die Details spürbar; die Details einer Scheune sehen nach dem Hochskalieren anders aus. Die „Refiner aus/an"-Vergleiche der Seite zeigen Zugewinne bei Details wie Gesichtern, Haaren, Stoff und Textur. Wo Details wichtig sind, etwa bei Produkt, Gesicht oder Text, müssen Sie das Ergebnis mit dem Original vergleichen. Der Code ist veröffentlicht. Projektseite: nvlabs.github.io/Sana/Sol-Refiner.

Was ist PixelUMM?

PixelUMM ist ein einheitliches Modell, das Bilder und Videos sowohl versteht als auch erzeugt; es ist eine Arbeit von Forschenden von Nvidia und der University of Waterloo. Das Besondere ist die Architektur: kein VAE und kein Vision-Encoder. Ein einzelner Decoder-only-Transformer liest und schreibt rohe Pixel. Bilder werden in 16×16-Patches, Videos in 4-Bilder-Röhren zerlegt. Das Rückgrat ist Qwen3-8B; es gibt getrennte „Experten"-Schichten für Verstehen und Erzeugung, und alle teilen sich eine Selbstaufmerksamkeit über Text, saubere Pixel und verrauschte Pixel.

Die meisten Bild- und Videomodelle erzeugen Inhalte in einem per VAE komprimierten „Latent Space" und dekodieren sie dann zurück in Pixel. PixelUMM lässt diesen Schritt weg. Der Moderator im Video beschreibt das als „kein Encoder"; laut Seite ist korrekt, dass es weder einen VAE noch einen Vision-Encoder gibt.

Eine Einschränkung, die die Seite offen nennt: Der lineare Pixel-Ausgabekopf kann in glatten Bereichen (etwa Himmel) schwache, am Raster ausgerichtete Patch-Artefakte hinterlassen, die bei hohem Classifier-Free-Guidance (etwa CFG 6) deutlicher werden. Faltungsköpfe verringern das, aber das veröffentlichte Modell, alle Demos und die Videos auf der Seite wurden mit den linearen Standardköpfen erzeugt; der Wechsel auf einen Faltungskopf erfordert weiteres Training. Auf der Seite finden sich außerdem Versionen mit 1,7 und 8 Milliarden Parametern und ein Vergleich von Training im Pixelraum und im VAE-Raum.

Das Urteil des Videos ist klar: Qualität und Konsistenz erreichen Spitzenmodelle nicht. Aber es ist eine Forschungsvorschau auf eine neue Architektur; Code und Modell sind veröffentlicht, die meisten Quelldateien stehen unter der freizügigen Apache-2-Lizenz. Projektseite: nv-tlabs.github.io/PixelUMM.

Alle drei im Überblick

InSpatio World 1.5 SoL-Refiner PixelUMM
Was es tut Szenenerkundung entlang eines Kamerapfads aus Bild oder Video Skaliert niedrig aufgelöstes Video in einem Schritt auf 4K Bild- und Videoverständnis und -erzeugung im Pixelraum
Basis Auf Wan 2.1 1.3B basierend (laut Video) Refiner, der mit verschiedenen Generatoren arbeitet Transformer mit Qwen3-8B-Rückgrat
Stärke Mehrere Eingaben, konsistente Erkundung 27-fache Ende-zu-Ende-Beschleunigung bei MiniMax H3 VAE-freie Architektur
Schwäche Auf der Seite nicht genannt Verändert Details Hinter Spitzenmodellen, Patch-Artefakte

Zur Beschleunigung siehe den DMAD-und-PDMD-Artikel derselben Woche; zur Installation eines offenen Videomodells gibt es die Anleitung LTX 2.5 installieren.

Häufig gestellte Fragen

Welche Eingaben akzeptiert InSpatio World 1.5?

Ein einzelnes Bild, einen Bildsatz, ein Panorama oder ein Video.

Skaliert SoL-Refiner Video originalgetreu hoch?

Nein. Es liefert viel schärfere Ergebnisse, verändert aber Details; der Unterschied ist in den Beispielen des Videos sichtbar. Die Tempomessungen auf der Seite zeigen bis zu 27-fache Ende-zu-Ende-Beschleunigung bei MiniMax H3.

Was ist bei PixelUMM anders?

Es arbeitet mit einem einzigen Transformer direkt im Pixelraum, ohne VAE und ohne Vision-Encoder. Seine Qualität erreicht Spitzenmodelle noch nicht.

Sind alle drei offen?

Laut Video ist bei allen dreien der Code veröffentlicht. Die meisten Quelldateien von PixelUMM stehen unter Apache 2; zu den Lizenzen der anderen siehe die Projektseiten.

Quelle

Kommentare