DMAD ve PDMD: 4 Adımda Yapay Zekâ Video Üretimi
5 dk okuma

ByteDance bu hafta video ve görsel üretimini hızlandıran iki yöntem yayınladı: DMAD ve PDMD. İkisi de aynı hedefe gidiyor: MiniMax H3 gibi bir video modelini onlarca adım yerine yalnızca 4 adımda çalıştırmak. Adım sayısı düşünce üretim süresi de doğrudan kısalıyor. Bu yazının en dikkat çekici bulgusu şu: PDMD'nin proje sayfasındaki ölçümde 4 adımlı model, 50 adımlı öğretmen modelin toplam skorunu geçiyor.
Bu yazı, YouTube'daki AI Search kanalının haftalık yapay zekâ haberleri videosunun ilgili bölümlerini özetleyip iki projenin kendi sayfalarındaki ölçümlerle genişletiyor; videonun bağlantısı en sonda. Bu bir haber ve derleme yazısıdır; yöntemleri ben denemedim. Rakamlar araştırmacıların kendi ölçümleri; bağımsız yeniden üretim değil.
Distilasyon nedir, neden 4 adım?
Difüzyon tabanlı video modelleri görüntüyü gürültüden adım adım kurar. Kaliteli sonuç için çoğu zaman onlarca adım gerekir; PDMD sayfasında öğretmen model 50 "ağ değerlendirmesi" (NFE) kullanıyor. Distilasyon, büyük ve yavaş bir "öğretmen" modelin davranışını az adımda çalışan bir "öğrenci" modele öğretme yöntemi. Amaç, kaliteyi koruyarak adım sayısını düşürmek. DMAD ve PDMD bunu 4 adıma indiriyor; PDMD bir de 2 adımlı örnekler gösteriyor.
DMAD nedir?
DMAD, "Distribution Matching as Adversarial Distillation" (dağılım eşleştirmeyi çekişmeli distilasyon olarak ele alma) anlamına geliyor; Texas A&M Üniversitesi ve ByteDance araştırmacılarının çalışması. Nasıl çalıştığı:
- Gürültü, az adımlı öğrenci modelden geçerek bir örnek üretiyor.
- Öğretmenin, öğrencinin ve gerçek örneklerin her biri gürültülenip iki ayırıcı başlıkla (discriminator heads) sınıflandırılıyor; iki başlık tek bir ortak gövdeyi paylaşıyor.
- Aradaki farka dayalı ağırlıklar, öğrencinin nasıl güncelleneceğini belirliyor.
Sayfadaki sonuçlar:
- Tek adımlı görsel (ImageNet 64×64): FID 1,04.
- Metinden görsele (SDXL, 4 adım, COCO-10K): FID 14,47.
- Metinden videoya (Wan2.1-T2V-14B, 4 adım): VBench 85,15.
- İnsan tercihi (MiniMax-H3, rCM'e karşı): Beraberlikler hariç %84,6.
Aynı mimari yalnızca MiniMax'ta değil; Wan2.1 ve SDXL gibi video ve görsel modellerinde de çalışıyor. Kod, modeller ve demo yayınlandı. Videoya göre kullanmak için temel MiniMax modelini indirip üzerine her biri yaklaşık 1,4 GB olan LoRA dosyalarını ekliyorsunuz. Proje sayfası: yzmblog.github.io/projects/DMAD.
PDMD nedir?
PDMD, "Projected Distribution Matching Distillation"; ByteDance ve UC San Diego'nun çalışması. Adı DMAD'e benziyor ama farklı bir fikir: tek satırlık bir izdüşüm, öğrencinin eğitim hatasını süzüyor.
Sorun şu: Eleştirmen (critic) öğrenciyle öğretmenin farkını bulup öğrenciyi düzeltir; ama eleştirmen kusursuz değildir ve kendi hataları öğrenciye geçer. PDMD, eğitim sinyalinin eleştirmenin hata tahminine paralel olan bileşenini çıkarıyor (videodaki ifadeyle "projects it away"). Sayfaya göre başka hiçbir şey değişmiyor: ek kayıp fonksiyonu yok, ek ağ yok, ek model geçişi yok. Sayfada gösterilen kod da gerçekten tek satır:
r = x0_critic - x0_student
d = d - (d * r).sum() / r.pow(2).sum() * rPDMD ölçümleri
VideoGen-Eval (387 istem, 544p, MiniMax-H3-33B, toplam skor):
| Yöntem | Adım (NFE) | Toplam | Dinamik |
|---|---|---|---|
| MiniMax-H3-33B öğretmen | 50 | 82,41 | 66,67 |
| Damıtılmamış model | 4 | 79,48 | 44,44 |
| H3 Turbo LoRA | 4 | 81,57 | 54,78 |
| DMD2 | 4 | 82,27 | 59,95 |
| DMD | 4 | 82,76 | 61,76 |
| rCM | 4 | 81,18 | 58,40 |
| AnyFlow | 4 | 81,97 | 64,60 |
| PDMD | 4 | 83,17 | 71,83 |
Wan2.1-T2V-1.3B üzerinde VBench'te de PDMD 83,73 toplam skorla öğretmenin (83,06) ve diğer 4 adımlı yöntemlerin önünde; dinamik skor 89,72. Sayfa, DMD ile PDMD'nin yalnızca izdüşüm bakımından farklı olduğunu belirtiyor; yani kazanç doğrudan bu tek satırdan geliyor. Sayfada ayrıca kullanıcı çalışması ve nitel karşılaştırmalar var.
Çıktı örnekleri MiniMax-H3-33B ile 1344×768 çözünürlükte, 24 kare/sn'de 345 kare (yaklaşık 14 saniye), her biri dört ağ değerlendirmesiyle üretilmiş. Ağırlıklar Hugging Face'te yayınlandı. Videoya göre iki seçenek var: yaklaşık 66 GB'lık tam model (4 adımda çalışıyor) ya da daha küçük, nicemlenmiş bir MiniMax modelinin üstüne takılan yaklaşık 1,4 GB'lık LoRA. Proje sayfası: pdmd2026.github.io.
DMAD ve PDMD yan yana
| DMAD | PDMD | |
|---|---|---|
| Araştırmacılar | Texas A&M, ByteDance | UC San Diego, ByteDance |
| Hedef | 4 adımda üretim | 4 adımda (ve 2 adımda) üretim |
| Fikir | İki ayırıcı başlık, ortak gövde | Eleştirmen hatasını eğitim sinyalinden çıkaran tek satır |
| Gösterilen modeller | MiniMax-H3, Wan2.1, SDXL, EDM | MiniMax-H3-33B, Wan2.1-T2V-1.3B |
| Yayınlanan | Kod, modeller, demo; LoRA (~1,4 GB) | Kod, ağırlıklar; tam model ( |
Pratikte ne anlama geliyor?
Adım sayısı 50'den 4'e inince aynı donanımda kabaca on kata yakın bir hesaplama tasarrufu teorik olarak mümkün; ama gerçek süre, modelin diğer bileşenlerine ve donanıma bağlı. Sayfalar duvar saati süresi vermiyor, bu yüzden kesin bir hız çarpanı yazmıyorum. Dikkat edilecek noktalar:
- Ölçümler araştırmacıların kendi kıyaslarına dayanıyor; kendi istemlerinizle iki ayarı yan yana deneyin.
- Hızlandırılmış modeller çoğu zaman tam adımlı modele göre ayrıntı ya da çeşitlilik kaybedebilir; PDMD'nin dinamik skorunun yüksek olması, hareketin donuklaşma sorununu azalttığını düşündürüyor, ama bu da kendi ölçümü.
- LoRA yolu, büyük bir modeli baştan indirmeden hız kazanmanın en ucuz yolu.
Video süresini kısaltmanın bir başka yolu için aynı haftanın InSpatio World 1.5, Sol Refiner ve PixelUMM yazısına bakın. Yerelde açık kaynak video modeli kurmak için LTX 2.5 nasıl kurulur ve LTX 2.5 gereksinimleri yazıları var; ComfyUI'da iş akışlarını ajanla kurmak için Comfy Agent yazısı faydalı olur.
Sık Sorulan Sorular
DMAD ve PDMD ne işe yarıyor?
Video modelini 4 adımda çalıştırarak üretimi hızlandırıyor. İkisi de damıtma (distilasyon) yöntemi.
PDMD gerçekten 50 adımlı modelden iyi mi?
PDMD sayfasındaki VideoGen-Eval ölçümünde 4 adımlı PDMD'nin toplam skoru (83,17), 50 adımlı MiniMax-H3 öğretmenin skorunu (82,41) geçiyor. Bu, araştırmacıların kendi ölçümü; her kıyasta üstünlük anlamına gelmez.
Hangi modellerde çalışıyor?
Sayfalarda MiniMax-H3, Wan2.1 ve (DMAD'de) SDXL gösteriliyor. DMAD mimarisi başka video ve görsel modellerine de uygulanabiliyor.
LoRA dosyaları ne kadar büyük?
Videoya göre her biri yaklaşık 1,4 GB. PDMD'nin tam modeli yaklaşık 66 GB.
DMAD ile PDMD arasındaki fark ne?
DMAD, iki ayırıcı başlıkla öğrenci ile öğretmen arasındaki farkı kullanıyor. PDMD ise eleştirmen hatasını eğitim sinyalinden tek satırlık bir izdüşümle çıkarıyor.
Kaynak
- AI Search, Gemini 4, GPT 6.1, Dots, Claude Sonnet 5.5, Ideogram 4.5, Flux 3: AI NEWS (YouTube, 4 Ekim 2026): DMAD ve PDMD bölümleri, dosya boyutları.
- DMAD, Distribution Matching as Adversarial Distillation for Fast Visual Generation: yöntem, sonuçlar, kod.
- PDMD, Projected Distribution Matching Distillation: yöntem, ölçüm tabloları, ağırlıklar.
İlgili Yazılar
InSpatio World 1.5, Sol Refiner ve PixelUMM Nedir?
InSpatio World 1.5 görselden sahnede gezen video üretiyor, Nvidia SoL-Refiner videoyu tek adımda 4K'ya çıkarıyor, PixelUMM VAE'siz çalışıyor.
Comfy Agent Nedir? ComfyUI'da Düğümleri Ajan Kuruyor
Comfy Agent, ComfyUI'a gömülü ajan: istediğinizi yazıyorsunuz, iş akışını planlıyor, kuruyor ve çalıştırıyor. Şimdilik Comfy Cloud'da, ücretsiz denenebiliyor.
LTX 2.5 Nedir? Bedava Açık Kaynak Yapay Zeka Video Üretici
LTX 2.5, sesli video üreten 22 milyar parametreli açık ağırlıklı bir model. Ne yaptığı, lisansı, neden bedava sayıldığı ve kimler için uygun olduğu burada.