LTX 2.5 Anforderungen und Tempo: Wie viel VRAM?
7 Min. Lesezeit

Das offizielle Minimum für LTX 2.5 ist eine NVIDIA-Grafikkarte mit 32 GB VRAM. Die Community betreibt das Modell auch auf kleineren Karten, aber das ist kein offiziell unterstützter Weg und es ist langsam. Wie schnell ist dieses Modell, das als "schnellster lokaler KI-Videogenerator" bezeichnet wird, tatsächlich, und wie lange warten Sie auf welcher Karte? In diesem Artikel trage ich das mit Zahlen und Quellen zusammen.
Dritter Teil der Serie. Lesen Sie vorher Was ist LTX 2.5 und die Installationsanleitung.
Dieser Artikel ist eine Zusammenstellung; die Zeiten habe ich nicht selbst gemessen. Die Zahlen stammen aus der LTX-Dokumentation, aus einer NVIDIA-Meldung und aus Community-Berichten; die Quelle steht jeweils dabei. Die Quellen stehen am Ende.
Offizielle Anforderungen
Laut ComfyUI-Seite von LTX:
| Posten | Wert |
|---|---|
| Grafikkarte | CUDA-kompatibel, 32 GB VRAM oder mehr |
| Freier Speicherplatz | Über 100 GB (Modelle und Cache) |
| Python | 3.12 oder neuer |
Der Low-VRAM-Leitfaden von LTX nennt zusätzlich 32 GB Arbeitsspeicher, CUDA 13.2 oder neuer, Python 3.10 oder neuer und PyTorch 2.7. Die Model-Card empfiehlt dagegen CUDA 12.7 oder neuer. CUDA- und Python-Versionen sind also zwischen den Quellen nicht einheitlich; prüfen Sie vor der Installation die README im Repository.
Als empfohlene Konfiguration nennt der Leitfaden eine A100 (80 GB) oder H100, 64 GB Arbeitsspeicher und eine 200-GB-SSD. In dieser Klasse läuft das Modell in voller Genauigkeit bequem; auf Heimkarten kommen quantisierte und destillierte Versionen zum Einsatz.
Was passiert auf welcher Karte?
Die Stufen des Leitfadens:
- 80 GB und mehr (A100, H100): "Dev"-Checkpoint in voller Genauigkeit und zweistufige Pipeline.
- 32 GB (Klasse RTX 5090): Destillierter Checkpoint mit FP8-Quantisierung.
- Unter 32 GB: Unterhalb des dokumentierten Minimums. LTX sagt, dass dies nicht unterstützt wird und mit niedriger Auflösung und aggressiver Speicheroptimierung einige Einstellungen funktionieren können.
Erfahrungen aus der Community, aus unabhängigen Quellen:
| Karte | Berichtetes Ergebnis | Quelle |
|---|---|---|
| RTX 5090 (32 GB) | 4-Sekunden-Clip in 720p in etwa 25 Sekunden | NVIDIA-Leitfaden (über RunAIHome) |
| RTX 5090 (32 GB) | 8-Sekunden-Clip, etwa 3 Minuten, sobald Weight Streaming greift | RunAIHome |
| RTX 5090 | 8-Sekunden-Video aus einem 720p-Bild in etwa 80 Sekunden (BF16) | TrueNorthAI (Note) |
| RTX 3090/4090 (24 GB) | 5-Sekunden-Clips werden fertig; auf der 3090 mit dem destillierten Modell etwa 2,5 Minuten pro Clip; bei 10-Sekunden-Clips kann im letzten Decode-Schritt der Speicher ausgehen | RunAIHome |
| RTX 5060 Ti (16 GB) | Mit INT8/NVFP4-destillierten Gewichten 1344×768, 24 fps in etwa 170 Sekunden; über 92 % von 32 GB Arbeitsspeicher belegt | AI Creative Log (Note) |
| RTX 3060 (12 GB) | Etwa 0,5 Megapixel, 10-Sekunden-Video in etwa 180 Sekunden, mit 96 GB Arbeitsspeicher | AI Creative Log (Note) |
Alle diese Zahlen sind Berichte einzelner Personen aus der Community. Es gibt keine offizielle Messung, die den Geschwindigkeits- oder Qualitätsunterschied der Quantisierung zeigt; der Autor von AI Creative Log weist ausdrücklich darauf hin. Lesen Sie die Zeiten nicht als Spanne, sondern als "etwas in dieser Größenordnung ist möglich".
Wichtiges Detail: Der Speicher wird nicht nur beim Sampling gebraucht
In den Quellen tauchen immer wieder drei Stolperfallen auf:
- Der VAE-Decode-Schritt. Der Schritt, der das Bild nach dem Sampling decodiert, braucht zusätzlichen Speicher; auf 24-GB- und sogar 16-GB-Karten geht der Speicher genau hier aus. Empfohlen wird, auf den leichteren Conv-Video-VAE zu wechseln und das Decodieren in Kacheln (Tiles) aufzuteilen.
- Arbeitsspeicher. Weight Streaming und CPU-Offload belegen den System-RAM. Bei 16-GB-Karten sind 32 GB RAM das praktische Minimum.
- Clip-Länge. Mit der Länge wächst der Speicherbedarf überproportional; beginnen Sie mit kurzen Clips.
Wege, den Speicherbedarf zu senken
Methoden aus dem Low-VRAM-Leitfaden von LTX, nach Wirkung geordnet:
- Destillierter (Distilled) Checkpoint. Feste 8-Schritt-Pipeline, deutlich leichter und schneller als das "Dev"-Modell. Auf jeder Karte unter 32 GB ist dies der Startpunkt.
- FP8-Quantisierung. Senkt den Speicherverbrauch um etwa 40 %. Es gibt zwei Backends:
fp8-cast(läuft auf den meisten Karten mit FP8-Unterstützung) undfp8-scaled-mm(schneller auf Hopper-Karten). Auf der Kommandozeile--quantization fp8-cast. - INT8-ConvRot-Dateien für ComfyUI. Die Dateinamen stehen im Installationsartikel. In einer Quelle wird diese Dateifamilie mit etwa 21,5 GB angegeben.
- NVFP4. Eine noch kleinere Version für NVIDIA-Blackwell-Karten mit FP4-Unterstützung.
- Decodieren in Kacheln. Senkt den Spitzenspeicher, macht das Decodieren etwas langsamer.
- Textcodierung an die API auslagern. Der Gemma-4-Encoder und der Prompt-Enhancer belegen VRAM; mit einem API-Schlüssel können Sie sie extern laufen lassen.
- Umgebungsvariable: Setzen Sie vor jeder Pipeline
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True.
Schrittweise hochskalieren
Bei knappem Speicher empfiehlt LTX, mit der kleinsten Einstellung zu beginnen und einzeln zu steigern:
- Destillierter Checkpoint, 512 Pixel, 49 Bilder,
fp8-cast. - Erhöhen Sie die Auflösung schrittweise: 512, 576, 640, 704, 768. Bei zweistufigen Pipelines müssen Breite und Höhe durch 64 teilbar sein, bei einstufigen durch 32; 720 oder 1080 erfüllen diese Regel nicht.
- Erhöhen Sie danach die Bildzahl. Die Regel:
(Bilder - 1)muss durch 8 teilbar sein: 9, 17, 25, 33, 41, 49, 57, 65 und höher. - Wenn Sie IC-LoRAs hinzufügen, fügen Sie jeweils nur eine Gruppe hinzu.
Bei einem Speicherfehler der Reihe nach: Umgebungsvariable prüfen, FP8 aktivieren, Auflösung oder Bildzahl senken, auf das destillierte Modell wechseln, die Zahl der VAE-Kacheln erhöhen, auf eine einzige IC-LoRA-Gruppe reduzieren und andere Anwendungen schließen, die GPU-Speicher belegen.
Wie belastbar ist die Behauptung "am schnellsten"?
Dieser Abschnitt beantwortet die Frage der Überschrift. In den Quellen steht:
- Laut der Zusammenstellung von Pexo wurde ein 10-Sekunden-Clip in 720p auf zwei NVIDIA-GB200-Grafikkarten in etwa 6,8 Sekunden erzeugt (Herstellerdemonstration). Derselbe Artikel gibt wieder, dass VentureBeat das Modell "um ein Mehrfaches schneller als einige der nächsten Closed-Model-Konkurrenten" fand, liefert aber keine unabhängige Bestätigung.
- NVIDIA hat für RTX-Grafikkarten bei LTX 2.5 bis zu doppelte Leistung und 40 % Speicherersparnis angekündigt (durch Optimierungen wie NVFP4 und FastVideo).
- Auf der offiziellen Pipeline-Seite läuft die destillierte Pipeline mit festen 8 Schritten (8 in der ersten Stufe, 4 in der zweiten); das ist die Pipeline, die LTX als "schnellste" bezeichnet.
"Eines der schnellsten lokalen Videomodelle" ist also vertretbar; für "ganz sicher das schnellste" bräuchte es einen unabhängigen Vergleich unter gleichen Bedingungen, und einen solchen habe ich in den Quellen nicht gefunden.
Welche Hardware sollte man kaufen?
Das ist meine Einschätzung, abgeleitet aus den Zahlen der Quellen:
- Wenn Sie bereits eine 32-GB-Karte haben (Klasse RTX 5090), kommen Sie bei kurzen Clips gut zurecht.
- Auf einer 24-GB-Karte sind 5-Sekunden-Clips möglich, aber der Decode-Schritt ist grenzwertig.
- Kaufen Sie für 16 GB und weniger nicht speziell dafür eine Karte; der Autor von RunAIHome empfiehlt für 8 bis 12 GB ebenfalls, Cloud-GPUs zu mieten (er nennt etwa 0,99 Dollar pro Stunde).
- Vernachlässigen Sie den Arbeitsspeicher nicht: 32 GB RAM sind auf dem Low-VRAM-Weg das praktische Minimum.
Häufige Fragen
Wie viel VRAM braucht LTX 2.5?
Das offizielle Minimum sind 32 GB. Mit quantisierten und destillierten Dateien soll es auch auf 24-GB- und 16-GB-Karten laufen, aber das ist kein unterstützter Weg.
Läuft es auf einer Grafikkarte mit 16 GB?
Laut Community-Berichten ja, sehr langsam und mit fast vollständiger Auslastung von 32 GB Arbeitsspeicher. Es gibt keinen offiziellen Support.
Läuft es mit einer AMD-Grafikkarte?
Meine Quellen sprechen nur von NVIDIA CUDA. Der LTX-Leitfaden sagt, er "richte sich an NVIDIA".
Wie viele Minuten dauert ein Video?
Das hängt von Karte und Clip-Länge ab. Auf der RTX 5090 wird für einen 4-Sekunden-Clip in 720p eine Zeit von etwa 25 Sekunden berichtet; auf 24-GB-Karten dauert ein 5-Sekunden-Clip Minuten.
Läuft es auf dem Mac?
In den Quellen gibt es keine Angaben zum Mac, deshalb sage ich dazu nichts.
Quellen
- LTX, Using ComfyUI with LTX: offizielle Voraussetzungen, Low-VRAM-Dateien, NVFP4-Hinweis.
- LTX, How to Run a Video Generation Model Locally: A Low VRAM Guide: Stufen, FP8, schrittweises Hochskalieren, Fehlerbehebung.
- Lightricks, LTX-2.5 Model-Card (Hugging Face): Versionsempfehlungen, Einschränkungen.
- Lightricks, LTX-2-Repository (GitHub): destillierte Pipeline, feste Schrittzahl.
- RunAIHome, LTX-2.5 for Local AI Video in 2026: kartenbezogene Zeiten und Speicherhinweise (Drittanbieter).
- AI Creative Log, What is LTX 2.5?: Berichte zu 12 GB und 16 GB (Drittanbieter).
- TrueNorthAI, RTX 5090 hands-on: Zeit für ein 8-Sekunden-Video aus einem Bild (Drittanbieter).
- Wccftech, NVIDIA Accelerates AI on DGX & RTX Systems: Ankündigung von doppelter Leistung und 40 % Speicherersparnis.
- Pexo, What Is LTX-2.5?: GB200-Geschwindigkeitsdemo und VentureBeat-Wiedergabe (Drittanbieter).
Verwandte Artikel
Was ist LTX 2.5? Kostenloser Open-Source KI-Videogenerator
LTX 2.5 erzeugt Video mit Ton, hat 22 Milliarden Parameter und offene Gewichte. Was es kann, wie die Lizenz aussieht und für wen es sich eignet.
LTX 2.5 installieren: ComfyUI Schritt für Schritt
LTX 2.5 per ComfyUI-Vorlage, manuell über Nodes oder per Python-Kommandozeile installieren. Dateiliste, Ordner und Lösungen für die häufigsten Fehler.
Kostenlose KI-Videogenerierung mit LTX 2.5: Prompts
Mit LTX 2.5 das erste Video erzeugen: Text-, Bild- und Erstes/Letztes-Bild-Ablauf, Prompt-Aufbau, Auflösungs- und Bildregeln, Mehrszenen-Generierung und Ton.