Whistle und Phonon 2: Die kleinsten Spracherkennungsmodelle
6 Min. Lesezeit

Diese Woche wurden zwei sehr kleine Spracherkennungsmodelle vorgestellt: Whistle von Cactus und Phonon 2 von Fermion Research. Spracherkennungsmodelle, die Audio in Text umwandeln, umfassen meist mehrere Gigabyte. Whistle ist 16,9 MB groß, Phonon 2 ein Download von 164 MB. Beide laufen ohne Cloud auf dem eigenen Gerät.
Dieser Artikel fasst die betreffenden Abschnitte des wöchentlichen KI-News-Videos des YouTube-Kanals AI Search zusammen und erweitert sie um Messwerte, Installationsbefehle und Einschränkungen von den Seiten der beiden Projekte; der Link zum Video steht am Ende. Das ist eine Nachrichtenzusammenstellung, ich habe die Modelle nicht getestet. Die Zahlen stammen aus den Vergleichstabellen auf den Projektseiten, die Messungen haben die Entwickler selbst durchgeführt.
Warum sollte ein Spracherkennungsmodell klein sein?
Wird Audio in der Cloud verarbeitet, entstehen Probleme bei Latenz und Datenschutz; jede Aufnahme geht an einen Server. Ein Modell auf dem Gerät löst beides: keine Netzwerkverzögerung, und das Audio verlässt das Gerät nicht. Für Geräte mit begrenztem Speicher wie Smartphones, Uhren, Roboter, Smart Homes und Mikrocontroller ist die Modellgröße entscheidend. Deshalb gehen diese beiden Veröffentlichungen bei Größe und Tempo unterschiedliche Wege.
Was ist Whistle?
Whistle ist ein Spracherkennungsmodell, das Cactus Compute am 2. Oktober 2026 veröffentlicht hat. Es ist eine einzelne 16,9-MB-Datei; es läuft ohne zusätzliche Abhängigkeiten auf der CPU und wird in die C++-Engine geladen, die auch Cactus' kleines Sprachmodell Needle nutzt.
Die wichtigsten Punkte:
- Sprachen: Englisch, Deutsch, Französisch, Spanisch, Italienisch, Niederländisch und Polnisch. Die Sprache wird automatisch erkannt, sofern Sie sie nicht angeben.
- Eingabe: 16-kHz-Mono-Audio, bis zu 30 Sekunden in einem Durchgang.
- Wortzeitstempel: Start, Ende und Wahrscheinlichkeit für jedes Wort.
- Sprach-Embedding: Encoder-Ausgabe für jeden 80-ms-Frame, ohne ein Transkript zu erzeugen.
- Schlüsselwort-Gewichtung: Namen und Begriffe (zum Beispiel „Siobhan", „Krzysztof") lassen sich per Liste hervorheben.
- Stille: Liegt die Lautstärke unter einer Schwelle, gibt es ein leeres Transkript zurück, ohne den Decoder zu betreten.
- Bereitstellung: Fertige Engines für siebzehn Ziele, von macOS und Linux über Android, iOS, watchOS, Windows on ARM und RISC-V bis zum Browser. In der Demo auf der Seite läuft das Modell in einem Browser-Tab, das Audio verlässt das Gerät nicht.
Messwerte von Whistle
Cactus' Vergleichstabelle (10 Sekunden Audio, Apple M4 Pro CPU; jedes Modell in seiner offiziellen Laufzeitumgebung):
| Whistle | Whisper base | Moonshine tiny v2 | |
|---|---|---|---|
| Größe | 16,9 MB | 145,3 MB | 41,9 MB |
| Zeit bis zum ersten Token | 11,1 ms | 73,2 ms | 22,8 ms |
| Dekodiergeschwindigkeit | 1.319 Tokens/s | 266 Tokens/s | 262 Tokens/s |
Bei der Wortfehlerrate (WER, niedriger ist besser) liegt Whistle bei LibriSpeech test-clean und test-other, SPGISpeech, Earnings-22 und dem FLEURS-Durchschnitt vorn. Whisper base liegt bei TED-LIUM, AMI und dem MLS-Durchschnitt vorn. Whistle gewinnt also nicht jeden Benchmark, ist bei 8,6-mal kleinerer Größe aber bemerkenswert. Die Aussage des Videos „viel schneller als Whisper base" passt zu den Messwerten: etwa 5-fach beim Dekodieren und etwa 6,6-fach bei der Zeit bis zum ersten Token.
Whistle installieren
In Python können Sie es mit einem einzigen Befehl ausprobieren:
pip install cactus-needleimport needle
print(needle.transcribe("clip.wav")["text"])word_timestamps=True liefert Wortzeiten, keywords=[...] hebt Namen hervor und language="de" erzwingt die Sprache. Die Gewichte liegen auf Hugging Face, die Engine auf GitHub (Cactus-Compute/needle3).
Was ist Phonon 2?
Phonon 2 ist das Spracherkennungsmodell von Fermion Research mit offenen Gewichten, nur für Englisch. Das Unternehmen sagt, es sei das genaueste offene Spracherkennungsmodell unter 900 MB. Der Download umfasst 164 MB. Es ist von NVIDIAs Parakeet TDT 0.6B v3 abgeleitet, und die Gewichte erscheinen unter derselben CC-BY-4.0-Lizenz. Jedes Encoder-Gewicht wird als eine von fünf gelernten Stufen mit etwa 2,1 Bit gespeichert.
Messwerte von Phonon 2
Durchschnittliche Wortfehlerrate über die sieben englischen Sets des Open ASR Leaderboards:
| Modell | Download | Durchschnittliche WER |
|---|---|---|
| Parakeet TDT 0.6B v3 (Lehrer) | 2.508 MB | 4,96 % |
| Phonon 2 | 164 MB | 5,21 % |
| Parakeet Redux | 178 MB | 5,69 % |
| Canary 180M Flash | 737 MB | 5,69 % |
| Whisper large-v3-turbo | 1.618 MB | 6,58 % |
Eine 15-mal kleinere Datei kommt also sehr nah an die Genauigkeit des Lehrers heran. Bei Meeting-Aufnahmen (AMI) und Parlamentsreden (VoxPopuli) schlägt Phonon 2 den Lehrer.
Tempo: Auf einem Apple M5 MacBook Air läuft es auf der GPU (MLX) mit dem 174-Fachen der Echtzeit; eine Stunde Audio wird in etwa 20 Sekunden zu Text. Laut Seite ist das 1,7-mal schneller als die schnellste andere Laufzeitumgebung, die auf derselben Maschine gemessen wurde. Auf acht CPU-Kernen dauert eine Stunde Audio 25 Sekunden; auf einer einzelnen H100 braucht ein ganzer Tag Audio in Batches zu 128 nur 13 Sekunden.
Phonon 2 installieren
pip install fermion-research
phonon transcribe meeting.wav
phonon serve --port 8010phonon serve öffnet einen OpenAI-kompatiblen Endpunkt, phonon listen schreibt auf einem Mac das Mikrofon live mit. Es gibt Docker-Container (CPU und CUDA) und FermionResearch/Phonon-2 auf Hugging Face. Dasselbe Labor bietet auch Detta an, eine Mac-Diktier-App, die Phonon 2 in jedem Textfeld ausführt.
Wie wählt man zwischen beiden?
| Whistle | Phonon 2 | |
|---|---|---|
| Größe | 16,9 MB | 164 MB |
| Sprachen | 7 Sprachen, automatisch erkannt | Nur Englisch |
| Eingabe | Bis 30 s | Lange Aufnahmen (stundenlang) |
| Stärke | Sehr eingeschränkte Geräte wie Mikrocontroller, Uhren, Browser | Lange englische Aufnahmen wie Meetings, Parlament, Podcasts |
| Ausgabe | Text, Wortzeiten, Embeddings | Text, Wortzeiten (--json) |
Beide Modelle leisten nicht dasselbe: Whistle ist mehrsprachig und auf kurze Clips auf sehr kleinen Geräten ausgerichtet; Phonon 2 betont Genauigkeit und Tempo für Englisch und lange Aufnahmen. Entscheiden Sie erst nach einem Test mit Ihrer eigenen Stimme und Ihrem Akzent; die Vergleichstabellen beruhen teils auf sauberen Aufnahmen. Das Video nennt Phonon 2 gelegentlich „Text-to-Speech", beschrieben wird aber Sprache zu Text.
Als Beispiel für eine sprachgesteuerte App siehe Was ist Talkamble; zur Sprachmodell-Meldung derselben Woche den Artikel zu ElevenLabs v4.
Häufig gestellte Fragen
Braucht Whistle eine GPU?
Nein. Laut Cactus läuft es nur auf der CPU, ohne zusätzliche Abhängigkeiten.
Welche Sprachen unterstützt Whistle?
Englisch, Deutsch, Französisch, Spanisch, Italienisch, Niederländisch und Polnisch; die Sprache wird automatisch erkannt.
Ist Whistle genauer als Whisper base?
Bei einigen Benchmarks (LibriSpeech, SPGISpeech, Earnings-22, FLEURS-Durchschnitt) ja; bei TED-LIUM, AMI und dem MLS-Durchschnitt ist Whisper base besser. Whistle ist 8,6-mal kleiner und schneller.
Kann Phonon 2 Deutsch?
Nein, es wurde nur für Englisch veröffentlicht.
Wie schnell ist Phonon 2?
Auf einem Apple M5 MacBook Air wird eine Stunde Audio in etwa 20 Sekunden zu Text; auf acht CPU-Kernen sind es 25 Sekunden.
Quelle
- AI Search, Gemini 4, GPT 6.1, Dots, Claude Sonnet 5.5, Ideogram 4.5, Flux 3: AI NEWS (YouTube, 4. Oktober 2026): die Abschnitte zu Whistle und Phonon 2.
- Cactus Compute, Whistle: Speech to Text in 16.9 MB (2. Oktober 2026): Funktionen, Messwerte, Installation.
- Fermion Research, Introducing Phonon-2: Genauigkeit, Tempo und Installation.
Verwandte Artikel
Was ist OpenAI Dots? Open-Source-Alternativen Open Dots
OpenAI Dots ist ein dauerhafter Agent mit eigenem Rechner, der auch in Ihrer Abwesenheit arbeitet. Wer ihn bekommt, Sicherheitskontrollen, Open-Source-Optionen.
Was ist Claude Sonnet 5.5? Benchmarks, Kosten, Gratis-Plan
Claude Sonnet 5.5 ist das Standardmodell im Gratis-Plan. 70,6 % bei Terminal-Bench 4.0, 2 $ / 10 $ pro Million Tokens. Der Vergleich mit Opus 5.5.
Was ist GPT-6.1 Sol? Preis, Leistung, wer es nutzen kann
GPT-6.1 Sol bietet fast Astra-Intelligenz zu einem Fünftel des Preises: 2 $ / 10 $. Neue Plan-Stufen, Ultrafast-Tempo und wer es nutzen kann.