İçeriğe geç / Skip to content / Zum Inhalt

Was ist ElevenLabs v4? Das emotionale Text-to-Speech-Modell

Ahmet Balaman

5 Min. Lesezeit

KI-VideoElevenLabs v4Text-to-SpeechTTSKI-StimmeVertonungKI
Was ist ElevenLabs v4? Das emotionale Text-to-Speech-Modell

ElevenLabs hat die vierte Version seines Text-to-Speech-Modells (TTS) veröffentlicht, Eleven v4, dazu eine schnelle Variante für Echtzeit, v4 Turbo. Das Unternehmen stellt v4 als „unser emotionalstes Modell bisher" vor. Die neue Architektur liest ein Skript so, wie es ein Sprecher täte: Sie weiß, wer spricht, was gerade passiert ist und wie jede Zeile ankommen soll.

Dieser Artikel fasst den ElevenLabs-v4-Abschnitt des wöchentlichen KI-News-Videos des YouTube-Kanals AI Search zusammen und erweitert ihn um die Angaben auf der Modellseite von ElevenLabs; der Link zum Video steht am Ende. Das ist eine Nachrichtenzusammenstellung, ich habe das Modell nicht getestet. Die Angaben stammen von ElevenLabs' eigener Seite; das Ranking „bestes Modell" beruht auf einer einzelnen im Video gezeigten Bestenliste.

Was ist ElevenLabs v4?

Eleven v4 ist ElevenLabs' Text-to-Speech-Modell für produzierte Inhalte (Bücher, Werbung, Video, Spiele), bei denen die Qualität an erster Stelle steht. Laut Seite:

  • Über 90 Sprachen, eine große emotionale Bandbreite, mehrere Sprecher und eingebaute Soundeffekte.
  • Neue Architektur: höhere Audioqualität und größere emotionale Bandbreite; die Sprecheridentität bleibt bei Neuerzeugung stabil, es spricht also dieselbe Person, ob Sie eine Zeile einmal oder fünfzigmal neu erzeugen.
  • Kontext-Stitching: Tempo und Vortrag bleiben über lange Skripte konsistent; ein Hörbuch klingt von der ersten bis zur letzten Seite wie ein einziger Take.
  • Stimmklonen: Professionelle Stimmklone (PVC), die es in v3 nicht gab, sind in v4 zurück und arbeiten mit der vollen emotionalen Bandbreite des Modells. Sofort-Stimmklone (IVC) übertreffen jetzt die professionellen Klone von Multilingual v2. Für jeden Klon ist die verifizierte Zustimmung des Stimminhabers nötig. Klone, die vor v4 erstellt wurden, müssen neu trainiert werden, damit sie gut funktionieren.
  • Stimmbibliothek: Über 17.500 Stimmen funktionieren mit v4. Außerdem können Sie eine Stimme aus zehn Sekunden Audio klonen oder mit einem Satz entwerfen.

Seite: elevenlabs.io/v4.

Wie nutzt man Metatags (Audio-Tags)?

In v4 erfolgt die Regie über Tags in natürlicher Sprache in eckigen Klammern, die Sie ins Skript schreiben. Beispiele von der Seite:

  • Pausen: [pause], [long pause]
  • Emotion und Vortrag: [whispers], [excited], [sighs], [warm], [amused], [nervous laugh]
  • Klangereignisse: [laughs], [door slams], [Gong sounds], [crowd applause]

In der Demo auf der Seite sprechen ein Quizshow-Moderator und eine Kandidatin; der Text sieht so aus: [warm] Welcome back to the final round. [long pause] Our returning champion needs one more answer. In derselben Demo wird zu Beginn jeder Zeile festgelegt, wer spricht; das Modell folgt Tag-Folgen verlässlicher als v3.

Ein wichtiger Hinweis: SSML-Tags (etwa <break>) sind in v4 deaktiviert; verwenden Sie für Pausen die oben genannten Tags in natürlicher Sprache. Aussprachewörterbücher funktionieren weiterhin: Für Namen, Abkürzungen und Fachbegriffe können Sie phonetische Schreibweisen festlegen (IPA wird unterstützt). Eine einzelne Erzeugung nimmt bis zu 10.000 Zeichen; für längere Inhalte nutzen Sie das Kontext-Stitching.

Praktisches Vorgehen: Schreiben Sie den Text zuerst ohne Tags, hören Sie ihn an und fügen Sie dann nur dort Tags ein, wo Sie Betonung wollen. Ein Tag in jeder Zeile klingt nicht natürlich.

v4 Turbo: für Echtzeit und Sprachagenten

v4 Turbo ist die Variante, die die emotionale Bandbreite von v4 mit niedriger Latenz liefert. Laut ElevenLabs beträgt die mediane Inferenzlatenz etwa 100 ms und die Zeit bis zur ersten Sprache etwa 150 ms. Im Vergleichsdiagramm des Unternehmens stehen Cartesia Sonic 3.6 mit 262 ms und OpenAI GPT-4o mini TTS mit 814 ms. Mit bidirektionalem Streaming (Text hinein, Audio heraus) beginnt das Audio, bevor Ihr Sprachmodell den Satz beendet hat. Genutzt wird es über die API und ElevenAgents, und es arbeitet mit denselben professionellen Stimmklonen wie v4.

Preis und Zugang

  • Gratis-Plan: 10.000 Credits pro Monat (etwa 10 Minuten Audio), private Nutzung, keine Kreditkarte. v4 nutzt dieselbe Credit-Preisgestaltung wie andere TTS-Modelle und ist daher in jedem Plan inklusive der kostenlosen Stufe verfügbar.
  • Bezahlte Pläne: Auf der Seite beginnen sie bei 6 Dollar im Monat; sie enthalten mehr Credits, professionelles Stimmklonen und höhere Limits. Der Enterprise-Plan hat individuelle Preise.
  • Aktion: Die Seite kündigt bis zum 12. Oktober dreifache Credits für Creator und höher an.
  • API: REST, Streaming-Endpunkte, TypeScript- und Python-SDKs. Das Modell wählen Sie mit einer einzigen model_id (eleven_v4). Ausgabeformate sind MP3, WAV/PCM und µ-law für Telefonie.

Die Angabe des Videos „10.000 Credits im Gratis-Plan" ist deshalb unvollständig: Laut Seite ist das ein monatliches Kontingent.

Sicherheit und Datenschutz

Skripte und Audio-Tags, die Sie senden, werden ohne Ihre Zustimmung nicht zum Training von Modellen verwendet. ElevenLabs nennt SOC 2 Type II, ISO 27001 und PCI DSS Level 1 als Zertifizierungen, DSGVO-Konformität und HIPAA-taugliche Abläufe für das Gesundheitswesen. Enterprise-Kunden können den Zero-Retention-Modus aktivieren. Erzeugtes Audio lässt sich mit einem KI-Sprachklassifikator als KI-erzeugt erkennen.

Für wen ist es nützlich?

  • Video- und Spielemacher: Figurenstimmen, Erzähler, Trailer; Sounddesign in einem Durchgang mit Effekt-Tags.
  • Hörbuch- und Podcastproduzenten: Kontext-Stitching und stabile Sprecheridentität.
  • App-Entwickler: v4 Turbo für Sprachagenten und Echtzeit-Chat.

Zum Erzeugen von Spielsound und Musik per Code siehe Spielmusik und Sounds per Code erzeugen; zu kleinen Modellen, die Sprache in Text umwandeln, Whistle und Phonon 2.

Häufig gestellte Fragen

Ist ElevenLabs v4 kostenlos?

Es ist im Gratis-Plan nutzbar: 10.000 Credits pro Monat, etwa 10 Minuten Audio, private Nutzung. Für mehr brauchen Sie einen bezahlten Plan.

Was ist ein Metatag?

Ein in eckigen Klammern in den Text geschriebenes Tag, das Tonfall, Pause oder Soundeffekt der Stimme festlegt; zum Beispiel [whispers], [excited], [pause], [door slams].

Was ist der Unterschied zwischen v4 und v4 Turbo?

v4 ist auf Qualität bei produzierten Inhalten ausgelegt. v4 Turbo ist die schnelle Variante für Sprachagenten und Echtzeit, mit derselben emotionalen Bandbreite bei etwa 100 ms medianer Inferenzlatenz.

Welche Sprachen unterstützt v4?

Über 90 Sprachen. Die Seite enthält keine Sprachliste; ob Deutsch dazugehört, prüfen Sie in der Sprachliste von ElevenLabs.

Ist ElevenLabs v4 das beste TTS-Modell?

Laut einer im Video gezeigten Bestenliste ja. Aber es ist ein einzelnes Ranking; vergleichen Sie durch Anhören mit Ihrem eigenen Text.

Quelle

Kommentare