Was ist LTX 2.5? Kostenloser Open-Source KI-Videogenerator
5 Min. Lesezeit

LTX 2.5 ist ein KI-Videomodell, das Bild und Ton gleichzeitig erzeugt und dessen Gewichte frei zugänglich sind. Sie können es auf Ihrem eigenen Rechner ausführen, ohne Gebühr pro Clip und ohne Wasserzeichen. Deshalb gehört es zu den ersten Modellen, die sich Interessierte an "kostenloser KI-Videoerstellung" ansehen. Das Wort "kostenlos" hat allerdings drei Haken: Lizenz, Hardware und Strom. Alle drei erkläre ich unten.
Dieser Artikel ist der erste Teil einer vierteiligen LTX-2.5-Serie. In dieser Reihenfolge: was es ist (dieser Artikel), Installation, Anforderungen und Geschwindigkeit und erstes Video, Prompt und Einstellungen.
Dieser Artikel ist eine Zusammenstellung; ich habe das Modell nicht selbst auf meinem Rechner getestet. Die Angaben stammen von der Hugging-Face-Seite des Modells, aus der offiziellen LTX-Dokumentation und aus unabhängigen Artikeln. Die Quellen stehen am Ende.
Was ist LTX 2.5?
LTX ist die Videomodell-Familie der Firma LTX, die aus Lightricks hervorgegangen ist. LTX 2.5 ist das jüngste Mitglied dieser Familie. Die Meldung von OpenSourceForU verortet das Modell im August 2026.
| Eigenschaft | Wert |
|---|---|
| Größe | 22 Milliarden Parameter, Dual-Stream-Diffusion-Transformer (DiT) |
| Ausgabe | Gleichzeitig Video und Ton |
| Eingabe | Text, Bild, Video |
| Auflösung | Von 720p bis natives 4K |
| Clip-Länge | 6 bis 20 Sekunden |
| Textencoder | Speziell feinabgestimmtes Gemma 4 12B |
| Verbreitung | Offene Gewichte auf Hugging Face, fertige Vorlage in ComfyUI |
Was das Modell gegenüber der Vorversion mitbringt, listet die Model-Card so auf:
- Mehrszenen-Generierung. Das Modell erzeugt in einem Durchgang mehrere zusammenhängende Einstellungen; Figur, Umgebung, Licht, Ton und visueller Stil bleiben über die Einstellungen hinweg erhalten. Frühere Versionen erzeugten eine einzige durchgehende Einstellung.
- Neuer Diffusions-Videodecoder. Schärfere Ergebnisse bei Gesichtern, Texturen und Text im Bild, weniger Artefakte bei schwierigen Szenen.
- Diffusion Fidelity Rendering. Die Rechenleistung wird nach der Komplexität der Szene verteilt.
- Gemma-4-Textencoder. Er verarbeitet lange Prompts mit mehreren Figuren, Kamerabewegung und Lichtbeschreibung besser.
- Prompt-Enhancer. Er erweitert einen kurzen Satz zu einer ausführlicheren, filmischen Beschreibung.
- Dauerschätzer. Ein optionaler Node schätzt die Clip-Länge aus dem Prompt und stellt die Bildzahl selbst ein.
- Besseres destilliertes (Distilled) Modell. Der kleinere, schnellere Checkpoint bewahrt einen größeren Teil der visuellen Qualität des vollen Modells.
Was heißt "kostenlos"?
Nutzen, ohne zu bezahlen
Wenn Sie die Gewichte von Hugging Face laden und auf Ihrer eigenen Hardware ausführen, zahlen Sie keine Gebühr pro Clip. Eine unabhängige Zusammenstellung schreibt "keine Gebühr pro Clip, kein Wasserzeichen". Wird die Generierung über die API abgewickelt, kostet sie Geld.
Lizenz: offene Gewichte, nicht Open Source
Das Modell kommt mit der LTX-2.x Community License. Diese Lizenz entspricht nicht der Definition der Open Source Initiative; "offene Gewichte" ist deshalb treffender als "Open Source". Das sollten Sie wissen:
- Organisationen mit einem Jahresumsatz von unter 10 Millionen Dollar dürfen das Modell kommerziell nutzen, auf eigenen Servern betreiben und feinabstimmen.
- Organisationen mit 10 Millionen Dollar Umsatz oder mehr müssen eine kostenpflichtige kommerzielle Lizenzvereinbarung abschließen. Der Umsatz wird über die gesamte Rechtsperson einschließlich verbundener Unternehmen berechnet.
- Es gibt eine Acceptable-Use-Policy: Bereiche wie sexueller Missbrauch von Kindern, nicht einvernehmliche sexuelle Inhalte und offene Pornografie sind verboten.
- Die Dateien auf Hugging Face sind "gated": Sie müssen die Lizenz akzeptieren und sich anmelden.
Verbindlich ist die Datei LICENSE im Repository. Wenn Sie das Modell für ein kommerzielles Vorhaben einsetzen wollen, lesen Sie sie selbst.
Hardware: die eigentlichen Kosten
Die Gewichte sind kostenlos, die Grafikkarte, auf der sie laufen, nicht. Die offizielle ComfyUI-Seite verlangt eine CUDA-Grafikkarte mit 32 GB VRAM oder mehr und 100 GB freien Speicherplatz. Die Community berichtet, dass es auch mit weniger VRAM läuft, aber langsam. Die Einzelheiten habe ich im Artikel zu den Anforderungen aufgeschlüsselt. Wenn Sie keine passende Karte haben, ist stundenweise GPU-Miete oder die LTX-API eine Alternative.
Für wen eignet es sich?
- Wer auf dem eigenen Rechner erzeugen und die Privatsphäre behalten will. Bilder und Prompts verlassen den Rechner nicht.
- Wer ComfyUI nutzt oder bereit ist, es zu lernen. Die einfachste Route ist die Node-basierte Oberfläche.
- Wer mit eigenen Daten feinabstimmen will. Der "Dev"-Checkpoint ist voll trainierbar; laut Angaben laufen die meisten unter LTX-2.3 trainierten LoRAs in 2.5 ohne Änderung.
- Wer kurze Clips mit Ton erzeugt. Ton und Bild kommen aus einem einzigen Modell.
Wenn Sie gar nichts installieren möchten, passen cloudbasierte Werkzeuge besser. Den allgemeinen Ablauf habe ich im kompletten Leitfaden zur Videoerstellung mit KI beschrieben, ein fertiges Cloud-Werkzeug im Higgsfield-Artikel.
Grenzen
Die Model-Card nennt selbst: Das Modell wurde nicht dafür entworfen, Sachinformationen zu liefern, es kann gesellschaftliche Vorurteile verstärken, reagiert stark auf den Prompt-Stil, setzt den Prompt womöglich nicht exakt um und kann unangemessene Inhalte erzeugen. Dazu drei praktische Anmerkungen: Die Installation setzt ComfyUI-Kenntnisse voraus, die Dateien umfassen Dutzende GB, und die Geschwindigkeit hängt eng von der Hardware ab.
Häufige Fragen
Ist LTX 2.5 wirklich kostenlos?
Wenn Sie die Gewichte laden und auf Ihrem eigenen Rechner ausführen, fällt keine Gebühr pro Clip an. Es gibt aber eine Community-Lizenz mit Umsatzgrenze (10 Millionen Dollar Jahresumsatz), und die Hardwarekosten tragen Sie selbst.
Ist LTX 2.5 Open Source?
Die Gewichte sind offen, die Lizenz entspricht aber nicht der OSI-Definition. Der richtige Begriff lautet "offene Gewichte".
Erzeugt LTX 2.5 auch Ton?
Ja. Video und Ton entstehen im selben Modell, der Ton mit einem eigenen Audio-VAE.
Wie lang können die Videos sein?
Die Quellen nennen Clip-Längen von 6 bis 20 Sekunden. In der Praxis hängt die Länge von Ihrer Grafikkarte ab.
Darf ich es kommerziell nutzen?
Ja, wenn Ihr Jahresumsatz unter 10 Millionen Dollar liegt. Darüber brauchen Sie eine kostenpflichtige Lizenz.
Quellen
- Lightricks, LTX-2.5 Model-Card (Hugging Face): Neuerungen, Checkpoints, Nutzung und Grenzen.
- LTX, Using ComfyUI with LTX: Voraussetzungen, Dateiliste, Vorlagen.
- Open Source For You, LTX-2.5 Brings Open-Weight Video Generation: technische Daten, Erscheinungszeitpunkt.
- The Rundown, LTX-2.5 Review: Features, API Pricing & License: Umsatzgrenze der Lizenz und Acceptable-Use-Policy.
- Pexo, What Is LTX-2.5?: Hinweis zu Wasserzeichen und Gebühr pro Clip (Drittanbieter).
Verwandte Artikel
LTX 2.5 installieren: ComfyUI Schritt für Schritt
LTX 2.5 per ComfyUI-Vorlage, manuell über Nodes oder per Python-Kommandozeile installieren. Dateiliste, Ordner und Lösungen für die häufigsten Fehler.
Kostenlose KI-Videogenerierung mit LTX 2.5: Prompts
Mit LTX 2.5 das erste Video erzeugen: Text-, Bild- und Erstes/Letztes-Bild-Ablauf, Prompt-Aufbau, Auflösungs- und Bildregeln, Mehrszenen-Generierung und Ton.
LTX 2.5 Anforderungen und Tempo: Wie viel VRAM?
Das offizielle Minimum für LTX 2.5 sind 32 GB VRAM. Was auf 24- und 16-GB-Karten passiert, wie FP8 und INT8 Speicher sparen und welche Zeiten berichtet werden.