İçeriğe geç / Skip to content / Zum Inhalt

LTX 2.5 Anforderungen und Tempo: Wie viel VRAM?

Ahmet Balaman

7 Min. Lesezeit

KI-VideoLTX 2.5VRAMGrafikkarteWenig VRAMRTX 5090
LTX 2.5 Anforderungen und Tempo: Wie viel VRAM?

Das offizielle Minimum für LTX 2.5 ist eine NVIDIA-Grafikkarte mit 32 GB VRAM. Die Community betreibt das Modell auch auf kleineren Karten, aber das ist kein offiziell unterstützter Weg und es ist langsam. Wie schnell ist dieses Modell, das als "schnellster lokaler KI-Videogenerator" bezeichnet wird, tatsächlich, und wie lange warten Sie auf welcher Karte? In diesem Artikel trage ich das mit Zahlen und Quellen zusammen.

Dritter Teil der Serie. Lesen Sie vorher Was ist LTX 2.5 und die Installationsanleitung.

Dieser Artikel ist eine Zusammenstellung; die Zeiten habe ich nicht selbst gemessen. Die Zahlen stammen aus der LTX-Dokumentation, aus einer NVIDIA-Meldung und aus Community-Berichten; die Quelle steht jeweils dabei. Die Quellen stehen am Ende.

Offizielle Anforderungen

Laut ComfyUI-Seite von LTX:

Posten Wert
Grafikkarte CUDA-kompatibel, 32 GB VRAM oder mehr
Freier Speicherplatz Über 100 GB (Modelle und Cache)
Python 3.12 oder neuer

Der Low-VRAM-Leitfaden von LTX nennt zusätzlich 32 GB Arbeitsspeicher, CUDA 13.2 oder neuer, Python 3.10 oder neuer und PyTorch 2.7. Die Model-Card empfiehlt dagegen CUDA 12.7 oder neuer. CUDA- und Python-Versionen sind also zwischen den Quellen nicht einheitlich; prüfen Sie vor der Installation die README im Repository.

Als empfohlene Konfiguration nennt der Leitfaden eine A100 (80 GB) oder H100, 64 GB Arbeitsspeicher und eine 200-GB-SSD. In dieser Klasse läuft das Modell in voller Genauigkeit bequem; auf Heimkarten kommen quantisierte und destillierte Versionen zum Einsatz.

Was passiert auf welcher Karte?

Die Stufen des Leitfadens:

  • 80 GB und mehr (A100, H100): "Dev"-Checkpoint in voller Genauigkeit und zweistufige Pipeline.
  • 32 GB (Klasse RTX 5090): Destillierter Checkpoint mit FP8-Quantisierung.
  • Unter 32 GB: Unterhalb des dokumentierten Minimums. LTX sagt, dass dies nicht unterstützt wird und mit niedriger Auflösung und aggressiver Speicheroptimierung einige Einstellungen funktionieren können.

Erfahrungen aus der Community, aus unabhängigen Quellen:

Karte Berichtetes Ergebnis Quelle
RTX 5090 (32 GB) 4-Sekunden-Clip in 720p in etwa 25 Sekunden NVIDIA-Leitfaden (über RunAIHome)
RTX 5090 (32 GB) 8-Sekunden-Clip, etwa 3 Minuten, sobald Weight Streaming greift RunAIHome
RTX 5090 8-Sekunden-Video aus einem 720p-Bild in etwa 80 Sekunden (BF16) TrueNorthAI (Note)
RTX 3090/4090 (24 GB) 5-Sekunden-Clips werden fertig; auf der 3090 mit dem destillierten Modell etwa 2,5 Minuten pro Clip; bei 10-Sekunden-Clips kann im letzten Decode-Schritt der Speicher ausgehen RunAIHome
RTX 5060 Ti (16 GB) Mit INT8/NVFP4-destillierten Gewichten 1344×768, 24 fps in etwa 170 Sekunden; über 92 % von 32 GB Arbeitsspeicher belegt AI Creative Log (Note)
RTX 3060 (12 GB) Etwa 0,5 Megapixel, 10-Sekunden-Video in etwa 180 Sekunden, mit 96 GB Arbeitsspeicher AI Creative Log (Note)

Alle diese Zahlen sind Berichte einzelner Personen aus der Community. Es gibt keine offizielle Messung, die den Geschwindigkeits- oder Qualitätsunterschied der Quantisierung zeigt; der Autor von AI Creative Log weist ausdrücklich darauf hin. Lesen Sie die Zeiten nicht als Spanne, sondern als "etwas in dieser Größenordnung ist möglich".

Wichtiges Detail: Der Speicher wird nicht nur beim Sampling gebraucht

In den Quellen tauchen immer wieder drei Stolperfallen auf:

  1. Der VAE-Decode-Schritt. Der Schritt, der das Bild nach dem Sampling decodiert, braucht zusätzlichen Speicher; auf 24-GB- und sogar 16-GB-Karten geht der Speicher genau hier aus. Empfohlen wird, auf den leichteren Conv-Video-VAE zu wechseln und das Decodieren in Kacheln (Tiles) aufzuteilen.
  2. Arbeitsspeicher. Weight Streaming und CPU-Offload belegen den System-RAM. Bei 16-GB-Karten sind 32 GB RAM das praktische Minimum.
  3. Clip-Länge. Mit der Länge wächst der Speicherbedarf überproportional; beginnen Sie mit kurzen Clips.

Wege, den Speicherbedarf zu senken

Methoden aus dem Low-VRAM-Leitfaden von LTX, nach Wirkung geordnet:

  • Destillierter (Distilled) Checkpoint. Feste 8-Schritt-Pipeline, deutlich leichter und schneller als das "Dev"-Modell. Auf jeder Karte unter 32 GB ist dies der Startpunkt.
  • FP8-Quantisierung. Senkt den Speicherverbrauch um etwa 40 %. Es gibt zwei Backends: fp8-cast (läuft auf den meisten Karten mit FP8-Unterstützung) und fp8-scaled-mm (schneller auf Hopper-Karten). Auf der Kommandozeile --quantization fp8-cast.
  • INT8-ConvRot-Dateien für ComfyUI. Die Dateinamen stehen im Installationsartikel. In einer Quelle wird diese Dateifamilie mit etwa 21,5 GB angegeben.
  • NVFP4. Eine noch kleinere Version für NVIDIA-Blackwell-Karten mit FP4-Unterstützung.
  • Decodieren in Kacheln. Senkt den Spitzenspeicher, macht das Decodieren etwas langsamer.
  • Textcodierung an die API auslagern. Der Gemma-4-Encoder und der Prompt-Enhancer belegen VRAM; mit einem API-Schlüssel können Sie sie extern laufen lassen.
  • Umgebungsvariable: Setzen Sie vor jeder Pipeline PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True.

Schrittweise hochskalieren

Bei knappem Speicher empfiehlt LTX, mit der kleinsten Einstellung zu beginnen und einzeln zu steigern:

  1. Destillierter Checkpoint, 512 Pixel, 49 Bilder, fp8-cast.
  2. Erhöhen Sie die Auflösung schrittweise: 512, 576, 640, 704, 768. Bei zweistufigen Pipelines müssen Breite und Höhe durch 64 teilbar sein, bei einstufigen durch 32; 720 oder 1080 erfüllen diese Regel nicht.
  3. Erhöhen Sie danach die Bildzahl. Die Regel: (Bilder - 1) muss durch 8 teilbar sein: 9, 17, 25, 33, 41, 49, 57, 65 und höher.
  4. Wenn Sie IC-LoRAs hinzufügen, fügen Sie jeweils nur eine Gruppe hinzu.

Bei einem Speicherfehler der Reihe nach: Umgebungsvariable prüfen, FP8 aktivieren, Auflösung oder Bildzahl senken, auf das destillierte Modell wechseln, die Zahl der VAE-Kacheln erhöhen, auf eine einzige IC-LoRA-Gruppe reduzieren und andere Anwendungen schließen, die GPU-Speicher belegen.

Wie belastbar ist die Behauptung "am schnellsten"?

Dieser Abschnitt beantwortet die Frage der Überschrift. In den Quellen steht:

  • Laut der Zusammenstellung von Pexo wurde ein 10-Sekunden-Clip in 720p auf zwei NVIDIA-GB200-Grafikkarten in etwa 6,8 Sekunden erzeugt (Herstellerdemonstration). Derselbe Artikel gibt wieder, dass VentureBeat das Modell "um ein Mehrfaches schneller als einige der nächsten Closed-Model-Konkurrenten" fand, liefert aber keine unabhängige Bestätigung.
  • NVIDIA hat für RTX-Grafikkarten bei LTX 2.5 bis zu doppelte Leistung und 40 % Speicherersparnis angekündigt (durch Optimierungen wie NVFP4 und FastVideo).
  • Auf der offiziellen Pipeline-Seite läuft die destillierte Pipeline mit festen 8 Schritten (8 in der ersten Stufe, 4 in der zweiten); das ist die Pipeline, die LTX als "schnellste" bezeichnet.

"Eines der schnellsten lokalen Videomodelle" ist also vertretbar; für "ganz sicher das schnellste" bräuchte es einen unabhängigen Vergleich unter gleichen Bedingungen, und einen solchen habe ich in den Quellen nicht gefunden.

Welche Hardware sollte man kaufen?

Das ist meine Einschätzung, abgeleitet aus den Zahlen der Quellen:

  • Wenn Sie bereits eine 32-GB-Karte haben (Klasse RTX 5090), kommen Sie bei kurzen Clips gut zurecht.
  • Auf einer 24-GB-Karte sind 5-Sekunden-Clips möglich, aber der Decode-Schritt ist grenzwertig.
  • Kaufen Sie für 16 GB und weniger nicht speziell dafür eine Karte; der Autor von RunAIHome empfiehlt für 8 bis 12 GB ebenfalls, Cloud-GPUs zu mieten (er nennt etwa 0,99 Dollar pro Stunde).
  • Vernachlässigen Sie den Arbeitsspeicher nicht: 32 GB RAM sind auf dem Low-VRAM-Weg das praktische Minimum.

Häufige Fragen

Wie viel VRAM braucht LTX 2.5?

Das offizielle Minimum sind 32 GB. Mit quantisierten und destillierten Dateien soll es auch auf 24-GB- und 16-GB-Karten laufen, aber das ist kein unterstützter Weg.

Läuft es auf einer Grafikkarte mit 16 GB?

Laut Community-Berichten ja, sehr langsam und mit fast vollständiger Auslastung von 32 GB Arbeitsspeicher. Es gibt keinen offiziellen Support.

Läuft es mit einer AMD-Grafikkarte?

Meine Quellen sprechen nur von NVIDIA CUDA. Der LTX-Leitfaden sagt, er "richte sich an NVIDIA".

Wie viele Minuten dauert ein Video?

Das hängt von Karte und Clip-Länge ab. Auf der RTX 5090 wird für einen 4-Sekunden-Clip in 720p eine Zeit von etwa 25 Sekunden berichtet; auf 24-GB-Karten dauert ein 5-Sekunden-Clip Minuten.

Läuft es auf dem Mac?

In den Quellen gibt es keine Angaben zum Mac, deshalb sage ich dazu nichts.

Quellen

Kommentare