Kostenlose KI-Videogenerierung mit LTX 2.5: Prompts
6 Min. Lesezeit

Nach der Installation von LTX 2.5 entscheiden drei Dinge über das Ergebnis: der Aufbau des Prompts, die Regeln für Auflösung und Bildzahl und der gewählte Ablauf. Dieser Artikel ist der letzte Teil der Serie. Das Modell habe ich in Was ist LTX 2.5 vorgestellt, die Installation und die Hardware-Anforderungen separat beschrieben. Hier geht es darum, das erste Video zu erzeugen und aus der kostenlosen KI-Videogenerierung das Beste herauszuholen.
Dieser Artikel stützt sich auf die offizielle Dokumentation; ich habe die Generierung nicht selbst ausprobiert. Regeln und Einstellungen stammen aus der Model-Card, der README von LTX und der ComfyUI-Seite. Die Quellen stehen am Ende.
Welchen Ablauf wählen?
In ComfyUI gibt es drei fertige Vorlagen:
| Ziel | Vorlage | Hinweis |
|---|---|---|
| Ich habe nur eine Idee | Text-to-Video | Zweistufig |
| Ich habe ein Bild und möchte Bewegung | Image-to-Video | Zweistufig; das Bild wird das erste Bild |
| Start- und Endbild stehen fest | First-Frame / Last-Frame | Einstufig; erzeugt den Zwischenteil |
Auf der Python-Seite gibt es weitere Pipelines: Video aus Audioeingabe (audio-to-video), Keyframe-Interpolation, Neuerzeugung von Bereichen (Retake), lippensynchrone Synchronisation (Dub-It) und Umwandlung von SDR in HDR. Sie sind für Fortgeschrittene; in den ersten Tagen reichen die Abläufe mit Text und Bild.
Praktische Empfehlung: Wenn Sie ein Bild haben, beginnen Sie mit Image-to-Video. Bei der Erzeugung aus Text bleibt die Bildkomposition dem Zufall überlassen; mit einem Bild haben Sie die Kontrolle. Die zweistufigen Vorlagen nutzen für hohe Auflösungen einen räumlichen Upscaler; die einstufige First/Last-Frame-Vorlage hat keinen Upscaler.
Wie schreibt man den Prompt?
Die Richtlinien aus der README von LTX:
- Ausführlich und chronologisch beschreiben. Schreiben Sie die Ereignisse in ihrer Reihenfolge.
- Mit der direkten Handlung beginnen und die Beschreibungen konkret und schlicht halten.
- Nicht mehr als 200 Wörter.
- Diese Reihenfolge einhalten: Hauptaktion, Bewegungen, Erscheinungsbild, Hintergrund, Kamera, Licht, Veränderungen im Verlauf.
- Bewegung, Erscheinungsbild, Kamerawinkel und Umgebungsdetails ausdrücklich nennen.
Ein Beispiel-Prompt, der diesem Aufbau folgt (nicht offiziell, ich habe ihn geschrieben, um die Richtlinie zu zeigen):
A golden retriever runs through a sunny meadow, ears flapping. The grass
bends as it passes; wildflowers sway. Behind it, a wooden fence and rolling
hills. The camera tracks alongside at ground level, shallow depth of field.
Warm afternoon light, long shadows.Die offiziellen Beispiele und der Prompt-Leitfaden sind alle auf Englisch. Wie gut deutsche Prompts funktionieren, dazu liegen mir in meinen Quellen keine Daten vor, deshalb stelle ich keine Behauptung auf; auf Englisch zu schreiben passt am besten zu den offiziellen Beispielen.
Prompt-Enhancer
Die Vorlagen lassen den Prompt-Enhancer standardmäßig eingeschaltet, der einen kurzen Prompt zu einer ausführlicheren, filmischen Beschreibung erweitert. Wenn Ihr eigener Satz unverändert verwendet werden soll, schalten Sie die Einstellung Prompt Enhance aus.
Ton
Das Modell erzeugt den Ton gleichzeitig. Wenn Sie im Prompt Ton- und Sprachdetails beschreiben (Umgebungsgeräusche, sprechende Figur, Musik), steuert das das Ergebnis. Ein unabhängiger Hands-on-Artikel berichtet von Problemen mit japanischem Ton; zum Deutschen habe ich keine Daten gefunden, testen Sie es selbst.
Mehrszenen-Generierung
Die Neuerung von LTX 2.5: mehrere zusammenhängende Einstellungen in einer Generierung. Figur, Licht und Ton bleiben über die Einstellungen hinweg erhalten. Wie man Mehrszenen-Prompts schreibt, steht im offiziellen Leitfaden "How to prompt LTX-2" von LTX; ich gehe nicht ins Detail, weil ich das noch nicht gelesen und getestet habe.
Regeln für Auflösung und Bildzahl
Wenn Sie diese nicht einhalten, gibt es Fehler oder die Ausgabe wird fehlerhaft:
| Regel | Wert |
|---|---|
| Bildzahl | Bilder % 8 == 1 (9, 17, 25, 33, 41, 49, 57, 65, ..., 121, ...) |
| Breite und Höhe, einstufige Pipeline | Durch 32 teilbar |
| Breite und Höhe, zweistufige Pipeline | Durch 64 teilbar |
| Auflösung von Stufe 2 | Das Doppelte von Stufe 1 |
Deshalb werden Sendeformat-Bezeichnungen wie 720 oder 1080 nicht direkt verwendet; stattdessen Werte wie 704 oder 768. Im Diffusers-Beispiel werden für Stufe 1 544×960 und 121 Bilder (24 fps) verwendet; die zweite Stufe arbeitet mit dem Doppelten davon.
Wenn Sie die Dauer nicht selbst wählen möchten, lassen Sie den Dauerschätzer-Node oder auf der Kommandozeile das Weglassen des Flags --num-frames die Länge aus dem Prompt wählen.
Empfohlene Einstellungen für das erste Video
Der Abschnitt "Workflow-Tipps" der ComfyUI-Seite und der Low-VRAM-Leitfaden von LTX:
- Führen Sie zuerst eine fertige Vorlage unverändert aus. Prüfen Sie, dass das Werkzeug funktioniert.
- Testen Sie mit niedriger Auflösung und wenigen Bildern. Die ComfyUI-Seite empfiehlt 480×720 und 41 bis 81 Bilder.
- Steigern Sie die Qualität, wenn Sie zufrieden sind. Erhöhen Sie erst die Auflösung, dann die Bildzahl, jeweils einzeln.
- Vergleichen Sie mit demselben Seed. Ändern Sie immer nur eine Einstellung.
- Bei Speicherfehlern folgen Sie der Reihenfolge im Artikel zu den Anforderungen: FP8, niedrigere Auflösung, destilliertes Modell, VAE in Kacheln.
- Halten Sie den Arbeitsbereich sauber. Schließen Sie ungenutzte Workflows und leeren Sie zwischen großen Generierungen den Cache.
Einzeiliges Bild-zu-Video-Beispiel auf der Kommandozeile:
--image path/to/first_frame.jpg 0 1.0 \
--prompt "The camera slowly dollies out as wind moves through the grass"Das Flag --image nimmt den Pfad, die Bildnummer (0 ist das erste Bild) und die Stärke.
Worauf Sie bei kostenloser Generierung achten sollten
- Lizenz: Bei einem Jahresumsatz unter 10 Millionen Dollar ist die kommerzielle Nutzung frei. Darüber brauchen Sie eine kostenpflichtige Lizenz. Details im Artikel "Was ist LTX 2.5".
- Strom und Zeit: Kostenlos heißt, dass Sie nichts bezahlen, nicht, dass die Laufzeit Ihrer Karte nichts kostet.
- Richtigkeit: Das Modell wurde nicht dafür entworfen, Sachinformationen zu liefern. Veröffentlichen Sie keine Inhalte, die wie echte Personen oder Ereignisse aussehen, unverändert.
- Zulässige Nutzung: Die in der Lizenz verbotenen Bereiche (sexueller Missbrauch von Kindern, nicht einvernehmliche sexuelle Inhalte usw.) gelten.
- Bilder echter Menschen: Wenn Sie aus dem Foto einer anderen Person ein Video erzeugen, stellen Sie sicher, dass Sie die Erlaubnis haben.
Für Schnitt, Untertitel und Veröffentlichung nach der Generierung lesen Sie den kompletten Leitfaden zur Videoerstellung mit KI.
Feinabstimmung und LoRA
Der "Dev"-Transformer ist voll trainierbar, und mit dem LTX-2 Trainer lassen sich LoRA und IC-LoRA trainieren. Laut Model-Card laufen die meisten unter LTX-2.3 trainierten LoRAs in LTX-2.5 ohne Änderung; es gibt einige Ausnahmen, prüfen Sie das vor dem Produktiveinsatz.
Häufige Fragen
Wie erzeuge ich mit LTX 2.5 das erste Video?
Öffnen Sie in ComfyUI über das Menü Templates die Vorlage Text-to-Video oder Image-to-Video, wählen Sie Download all, schreiben Sie den Prompt und klicken Sie auf Queue Prompt. Die Ausgabe landet im Ordner ComfyUI/output/.
Kann ich deutsche Prompts schreiben?
Meine Quellen sagen dazu nichts. Die offiziellen Beispiele und Leitfäden sind auf Englisch; machen Sie die ersten Versuche auf Englisch und vergleichen Sie das Deutsche selbst.
Warum bekomme ich einen Fehler, liegt es an Bildzahl oder Auflösung?
Sehr wahrscheinlich. Die Bildzahl muss % 8 == 1 erfüllen, Breite und Höhe müssen bei der einstufigen Pipeline durch 32, bei der zweistufigen durch 64 teilbar sein.
Wie steuere ich den Ton?
Beschreiben Sie im Prompt Ton- und Sprachdetails. Der Ton kommt aus einem eigenen Audio-VAE.
Wie lang kann ein Video höchstens sein?
Die Quellen nennen 6 bis 20 Sekunden. Die praktische Grenze setzt Ihre Hardware.
Quellen
- Lightricks, LTX-2.5 Model-Card (Hugging Face): Einschränkungen, Beispiel Bild-zu-Video, Dauerschätzer, Hinweis zur Feinabstimmung, Grenzen.
- Lightricks, LTX-2-Repository (GitHub): Prompt-Richtlinien, Pipelines.
- LTX, Using ComfyUI with LTX: Vorlagen, Workflow-Tipps.
- LTX, How to Run a Video Generation Model Locally: Regeln für Bildzahl und Auflösung, schrittweises Hochskalieren.
- TrueNorthAI, RTX 5090 hands-on: Hinweis zum japanischen Ton (Drittanbieter).
- The Rundown, LTX-2.5 Review: Acceptable-Use-Policy.
Verwandte Artikel
Was ist LTX 2.5? Kostenloser Open-Source KI-Videogenerator
LTX 2.5 erzeugt Video mit Ton, hat 22 Milliarden Parameter und offene Gewichte. Was es kann, wie die Lizenz aussieht und für wen es sich eignet.
LTX 2.5 installieren: ComfyUI Schritt für Schritt
LTX 2.5 per ComfyUI-Vorlage, manuell über Nodes oder per Python-Kommandozeile installieren. Dateiliste, Ordner und Lösungen für die häufigsten Fehler.
LTX 2.5 Anforderungen und Tempo: Wie viel VRAM?
Das offizielle Minimum für LTX 2.5 sind 32 GB VRAM. Was auf 24- und 16-GB-Karten passiert, wie FP8 und INT8 Speicher sparen und welche Zeiten berichtet werden.