DMAD und PDMD: KI-Video in 4 Schritten erzeugen
6 Min. Lesezeit

ByteDance hat diese Woche zwei Methoden veröffentlicht, die die Video- und Bilderzeugung beschleunigen: DMAD und PDMD. Beide verfolgen dasselbe Ziel: ein Videomodell wie MiniMax H3 in nur 4 statt Dutzenden Schritten laufen zu lassen. Mit weniger Schritten sinkt die Erzeugungszeit direkt. Der auffälligste Befund dieses Artikels: In der Messung auf PDMDs Projektseite schlägt das 4-Schritte-Modell das 50-Schritte-Lehrermodell beim Gesamtwert.
Dieser Artikel fasst die betreffenden Abschnitte des wöchentlichen KI-News-Videos des YouTube-Kanals AI Search zusammen und erweitert sie um die Messwerte auf den Seiten der beiden Projekte; der Link zum Video steht am Ende. Das ist eine Nachrichtenzusammenstellung, ich habe die Methoden nicht getestet. Die Zahlen sind die eigenen Messungen der Forschenden, keine unabhängigen Reproduktionen.
Was ist Destillation, und warum 4 Schritte?
Diffusionsbasierte Videomodelle bauen ein Bild Schritt für Schritt aus Rauschen auf. Für gute Qualität sind oft Dutzende Schritte nötig; auf PDMDs Seite nutzt das Lehrermodell 50 „Netzwerkauswertungen" (NFE). Destillation bringt einem „Schüler"-Modell, das in wenigen Schritten läuft, das Verhalten eines großen, langsamen „Lehrer"-Modells bei. Ziel ist, die Schrittzahl zu senken und die Qualität zu erhalten. DMAD und PDMD drücken sie auf 4 Schritte; PDMD zeigt außerdem 2-Schritte-Beispiele.
Was ist DMAD?
DMAD steht für „Distribution Matching as Adversarial Distillation" (Verteilungsabgleich als adversariale Destillation); es ist eine Arbeit von Forschenden der Texas A&M University und von ByteDance. So funktioniert es:
- Rauschen durchläuft den Schüler mit wenigen Schritten und erzeugt ein Sample.
- Samples von Lehrer, Schüler und aus echten Daten werden jeweils verrauscht und von zwei Diskriminator-Köpfen klassifiziert, die sich ein gemeinsames Backbone teilen.
- Abstandsbasierte Gewichte bestimmen, wie der Schüler aktualisiert wird.
Ergebnisse auf der Seite:
- Einschritt-Bilder (ImageNet 64×64): FID 1,04.
- Text zu Bild (SDXL, 4 Schritte, COCO-10K): FID 14,47.
- Text zu Video (Wan2.1-T2V-14B, 4 Schritte): VBench 85,15.
- Menschliche Präferenz (MiniMax-H3, gegen rCM): 84,6 % ohne Unentschieden.
Dieselbe Architektur funktioniert nicht nur bei MiniMax, sondern auch bei Video- und Bildmodellen wie Wan2.1 und SDXL. Code, Modelle und eine Demo sind veröffentlicht. Laut Video laden Sie zur Nutzung das MiniMax-Basismodell herunter und fügen LoRA-Dateien von je etwa 1,4 GB hinzu. Projektseite: yzmblog.github.io/projects/DMAD.
Was ist PDMD?
PDMD ist „Projected Distribution Matching Distillation"; eine Arbeit von ByteDance und der UC San Diego. Der Name ähnelt DMAD, die Idee ist aber eine andere: eine einzeilige Projektion filtert den Trainingsfehler des Schülers.
Das Problem: Ein Kritiker findet den Unterschied zwischen Schüler und Lehrer und korrigiert den Schüler, ist aber nicht perfekt, und seine eigenen Fehler gelangen in den Schüler. PDMD entfernt die Komponente des Trainingssignals, die parallel zur Fehlerschätzung des Kritikers liegt (im Video: „projects it away"). Laut Seite ändert sich sonst nichts: kein zusätzlicher Verlust, kein zusätzliches Netz, kein zusätzlicher Modelldurchlauf. Der auf der Seite gezeigte Code ist tatsächlich eine Zeile:
r = x0_critic - x0_student
d = d - (d * r).sum() / r.pow(2).sum() * rMesswerte von PDMD
VideoGen-Eval (387 Prompts, 544p, MiniMax-H3-33B, Gesamtwert):
| Methode | Schritte (NFE) | Gesamt | Dynamik |
|---|---|---|---|
| MiniMax-H3-33B Lehrer | 50 | 82,41 | 66,67 |
| Nicht destilliertes Modell | 4 | 79,48 | 44,44 |
| H3 Turbo LoRA | 4 | 81,57 | 54,78 |
| DMD2 | 4 | 82,27 | 59,95 |
| DMD | 4 | 82,76 | 61,76 |
| rCM | 4 | 81,18 | 58,40 |
| AnyFlow | 4 | 81,97 | 64,60 |
| PDMD | 4 | 83,17 | 71,83 |
Bei VBench mit Wan2.1-T2V-1.3B liegt PDMD mit einem Gesamtwert von 83,73 ebenfalls vorn, vor dem Lehrer (83,06) und den anderen 4-Schritte-Methoden; der Dynamikwert beträgt 89,72. Die Seite hält fest, dass sich DMD und PDMD nur durch die Projektion unterscheiden, der Gewinn kommt also direkt aus dieser einen Zeile. Auf der Seite gibt es außerdem eine Nutzerstudie und qualitative Vergleiche.
Die Ausgabebeispiele wurden mit MiniMax-H3-33B in 1344×768 erzeugt, 345 Bilder bei 24 fps (etwa 14 Sekunden), jeweils mit vier Netzwerkauswertungen. Die Gewichte sind auf Hugging Face veröffentlicht. Laut Video gibt es zwei Optionen: das vollständige Modell mit etwa 66 GB (läuft in 4 Schritten) oder ein LoRA mit etwa 1,4 GB, aufgesetzt auf ein kleineres, quantisiertes MiniMax-Modell. Projektseite: pdmd2026.github.io.
DMAD und PDMD im Vergleich
| DMAD | PDMD | |
|---|---|---|
| Forschende | Texas A&M, ByteDance | UC San Diego, ByteDance |
| Ziel | Erzeugung in 4 Schritten | Erzeugung in 4 (und 2) Schritten |
| Idee | Zwei Diskriminator-Köpfe, gemeinsames Backbone | Eine Zeile, die den Kritikerfehler aus dem Trainingssignal entfernt |
| Gezeigte Modelle | MiniMax-H3, Wan2.1, SDXL, EDM | MiniMax-H3-33B, Wan2.1-T2V-1.3B |
| Veröffentlicht | Code, Modelle, Demo; LoRA (~1,4 GB) | Code, Gewichte; volles Modell ( |
Was bedeutet das in der Praxis?
Von 50 auf 4 Schritte ist auf derselben Hardware theoretisch eine Rechenersparnis um fast das Zehnfache möglich, die tatsächliche Zeit hängt aber von den übrigen Komponenten des Modells und der Hardware ab. Die Seiten nennen keine Wanduhrzeiten, daher gebe ich keinen genauen Tempofaktor an. Zu beachten:
- Die Messwerte beruhen auf den eigenen Benchmarks der Forschenden; vergleichen Sie beide Einstellungen mit Ihren eigenen Prompts nebeneinander.
- Beschleunigte Modelle verlieren oft etwas Detail oder Vielfalt gegenüber dem Modell mit voller Schrittzahl; PDMDs hoher Dynamikwert deutet darauf hin, dass es das Problem steifer Bewegung verringert, aber auch das ist seine eigene Messung.
- Der LoRA-Weg ist der günstigste Weg, Tempo zu gewinnen, ohne ein großes Modell neu herunterzuladen.
Zu einem weiteren Weg, die Videoerzeugung zu verkürzen, siehe den Artikel zu InSpatio World 1.5, Sol Refiner und PixelUMM derselben Woche. Zur Installation eines offenen Videomodells gibt es LTX 2.5 installieren und LTX-2.5-Systemanforderungen; für den Aufbau von Workflows mit einem Agenten in ComfyUI hilft der Comfy-Agent-Artikel.
Häufig gestellte Fragen
Wozu dienen DMAD und PDMD?
Sie beschleunigen die Erzeugung, indem ein Videomodell in 4 Schritten läuft. Beide sind Destillationsmethoden.
Ist PDMD wirklich besser als das 50-Schritte-Modell?
In der VideoGen-Eval-Messung auf PDMDs Seite liegt der Gesamtwert des 4-Schritte-PDMD (83,17) über dem des 50-Schritte-Lehrers MiniMax-H3 (82,41). Das ist die eigene Messung der Forschenden; es bedeutet keine Überlegenheit in jedem Vergleich.
Bei welchen Modellen funktionieren sie?
Die Seiten zeigen MiniMax-H3, Wan2.1 und (bei DMAD) SDXL. Die Architektur von DMAD lässt sich auch auf andere Video- und Bildmodelle anwenden.
Wie groß sind die LoRA-Dateien?
Laut Video je etwa 1,4 GB. PDMDs volles Modell ist etwa 66 GB groß.
Was ist der Unterschied zwischen DMAD und PDMD?
DMAD nutzt den Lehrer-Schüler-Abstand mit zwei Diskriminator-Köpfen. PDMD entfernt den Fehler des Kritikers per einzeiliger Projektion aus dem Trainingssignal.
Quelle
- AI Search, Gemini 4, GPT 6.1, Dots, Claude Sonnet 5.5, Ideogram 4.5, Flux 3: AI NEWS (YouTube, 4. Oktober 2026): die Abschnitte zu DMAD und PDMD, Dateigrößen.
- DMAD, Distribution Matching as Adversarial Distillation for Fast Visual Generation: Methode, Ergebnisse, Code.
- PDMD, Projected Distribution Matching Distillation: Methode, Messtabellen, Gewichte.
Verwandte Artikel
Was sind InSpatio World 1.5, Sol Refiner und PixelUMM?
InSpatio World 1.5 macht aus einem Bild Video durch die Szene, Nvidias SoL-Refiner skaliert in einem Schritt auf 4K, PixelUMM kommt ohne VAE aus.
Was ist Comfy Agent? Ein Agent, der ComfyUI-Nodes baut
Comfy Agent ist ein in ComfyUI eingebauter Agent: Sie beschreiben, er plant, baut und startet den Workflow. Vorerst nur Cloud, kostenlos testbar.
Was ist LTX 2.5? Kostenloser Open-Source KI-Videogenerator
LTX 2.5 erzeugt Video mit Ton, hat 22 Milliarden Parameter und offene Gewichte. Was es kann, wie die Lizenz aussieht und für wen es sich eignet.