İçeriğe geç / Skip to content / Zum Inhalt

Whistle ve Phonon 2: En Küçük Konuşma Tanıma Modelleri

Ahmet Balaman

5 dk okuma

Vibe CodingWhistlePhonon 2Konuşma TanımaWhisperAçık KaynakYapay Zeka
Whistle ve Phonon 2: En Küçük Konuşma Tanıma Modelleri

Bu hafta iki çok küçük konuşma tanıma modeli duyuruldu: Cactus'un Whistle'ı ve Fermion Research'ün Phonon 2'si. Konuşma tanıma, yani sesi yazıya çeviren modeller, genellikle birkaç gigabayt. Whistle 16,9 MB, Phonon 2 ise 164 MB indirme. Üstelik ikisi de bulut gerektirmeden kendi cihazınızda çalışıyor.

Bu yazı, YouTube'daki AI Search kanalının haftalık yapay zekâ haberleri videosunun ilgili bölümlerini özetleyip iki projenin kendi sayfalarındaki ölçümlerle, kurulum komutlarıyla ve sınırlamalarla genişletiyor; videonun bağlantısı en sonda. Bu bir haber ve derleme yazısıdır; modelleri ben denemedim. Rakamlar proje sayfalarındaki kıyas tablolarından alındı ve ölçümleri geliştiricilerin kendisi yaptı.

Konuşma tanıma modeli neden küçük olmalı?

Ses, bulutta işlenince gecikme ve gizlilik sorunu çıkarır; her kayıt bir sunucuya gider. Cihaz üzerinde çalışan bir model bu ikisini birden çözer: ağ gecikmesi yok, ses cihazdan çıkmıyor. Telefon, saat, robot, akıllı ev ve mikrodenetleyici gibi sınırlı belleği olan cihazlar için model boyutu belirleyici. Bu yüzden bu iki sürüm, boyut ve hızda farklı yollar deniyor.

Whistle nedir?

Whistle, Cactus Compute'un 2 Ekim 2026'da açtığı konuşma tanıma modeli. Tek bir 16,9 MB dosya; ek bağımlılık olmadan CPU'da çalışıyor ve Cactus'un Needle adlı küçük dil modelinin kullandığı C++ motoruna yükleniyor.

Öne çıkanlar:

  • Diller: İngilizce, Almanca, Fransızca, İspanyolca, İtalyanca, Felemenkçe ve Lehçe. Dil, siz belirtmedikçe otomatik algılanıyor.
  • Girdi: 16 kHz mono ses, tek geçişte en fazla 30 saniye.
  • Kelime zaman damgası: Her kelime için başlangıç, bitiş ve olasılık değeri.
  • Konuşma gömmesi (embedding): Metne çevirmeden, her 80 ms'lik kare için kodlayıcı çıktısı.
  • Anahtar kelime ağırlıklandırma: Özel adları ve terimleri (ör. "Siobhan", "Krzysztof") listeyle öne çıkarabiliyorsunuz.
  • Sessizlik: Ses seviyesi eşiğin altındaysa çözücüye hiç girmeden boş metin döndürüyor.
  • Dağıtım: macOS ve Linux'tan Android, iOS, watchOS, Windows ARM, RISC-V ve tarayıcıya kadar on yedi hedef için hazır derlemeler var. Sayfadaki demoda model tarayıcı sekmesinde çalışıyor ve ses cihazdan çıkmıyor.

Whistle ölçümleri

Cactus'un kıyas tablosu (10 saniyelik ses, Apple M4 Pro CPU; her model kendi resmî çalışma ortamında):

Whistle Whisper base Moonshine tiny v2
Boyut 16,9 MB 145,3 MB 41,9 MB
İlk token süresi 11,1 ms 73,2 ms 22,8 ms
Çözümleme hızı 1.319 token/sn 266 token/sn 262 token/sn

Kelime hata oranında (WER, düşük iyi) Whistle; LibriSpeech test-clean ve test-other, SPGISpeech, Earnings-22 ve FLEURS ortalamasında önde. Whisper base ise TED-LIUM, AMI ve MLS ortalamasında önde. Yani Whistle her ölçütte kazanmıyor; ama 8,6 kat daha küçük olduğu düşünülünce dikkat çekici. Videodaki "Whisper base'den çok daha hızlı" ifadesi ölçümlerle uyumlu; hız farkı çözümlemede yaklaşık 5 kat, ilk token süresinde yaklaşık 6,6 kat.

Whistle kurulumu

Python ile tek komutla deneyebilirsiniz:

pip install cactus-needle
import needle
print(needle.transcribe("clip.wav")["text"])

word_timestamps=True kelime zamanlarını, keywords=[...] özel adları, language="de" ise dili zorlamayı sağlıyor. Ağırlıklar Hugging Face'te, motor GitHub'da (Cactus-Compute/needle3).

Phonon 2 nedir?

Phonon 2, Fermion Research'ün açık ağırlıklı, yalnızca İngilizce konuşma tanıma modeli. Şirket, 900 MB altındaki en doğru açık konuşma tanıma modeli olduğunu söylüyor. İndirme boyutu 164 MB. NVIDIA'nın Parakeet TDT 0.6B v3 modelinden türetilmiş; ağırlıklar aynı CC-BY-4.0 lisansıyla yayımlanıyor. Kodlayıcının her ağırlığı beş öğrenilmiş düzeyden biri olarak, yaklaşık 2,1 bitle saklanıyor.

Phonon 2 ölçümleri

Open ASR Leaderboard'un yedi İngilizce setinde ortalama kelime hata oranı:

Model İndirme Ortalama WER
Parakeet TDT 0.6B v3 (öğretmen) 2.508 MB %4,96
Phonon 2 164 MB %5,21
Parakeet Redux 178 MB %5,69
Canary 180M Flash 737 MB %5,69
Whisper large-v3-turbo 1.618 MB %6,58

Yani 15 kat küçük dosya, öğretmenin doğruluğuna çok yakın. Phonon 2 toplantı kayıtları (AMI) ve parlamento konuşmalarında (VoxPopuli) öğretmeni geçiyor.

Hız: Apple M5 MacBook Air'de GPU üzerinde (MLX) gerçek zamanın 174 katı; yani bir saatlik ses yaklaşık 20 saniyede metne dönüşüyor. Sayfaya göre aynı makinede ölçülen en hızlı diğer çalışma ortamından 1,7 kat hızlı. Sekiz CPU çekirdeğinde bir saatlik ses 25 saniye; tek H100 ekran kartında yüz yirmi sekizlik gruplarla bir günlük ses 13 saniye.

Phonon 2 kurulumu

pip install fermion-research
phonon transcribe meeting.wav
phonon serve --port 8010

phonon serve OpenAI uyumlu bir uç nokta açıyor; phonon listen ise Mac'te mikrofonu canlı yazıya döküyor. Docker kapsayıcıları (CPU ve CUDA) ve Hugging Face'te FermionResearch/Phonon-2 var. Aynı laboratuvar, Phonon 2'yi her metin alanında çalıştıran Mac dikte uygulaması Detta'yı da sunuyor.

İkisi arasında nasıl seçilir?

Whistle Phonon 2
Boyut 16,9 MB 164 MB
Diller 7 dil, otomatik algılama Yalnızca İngilizce
Girdi En fazla 30 sn Uzun kayıtlar (saatlik)
Güçlü yanı Mikrodenetleyici, saat, tarayıcı gibi çok kısıtlı cihazlar Toplantı, parlamento, podcast gibi uzun İngilizce kayıtlar
Çıktı Metin, kelime zamanı, gömme Metin, kelime zamanı (--json)

İki model aynı işi yapmıyor: Whistle çok dilli ve kısa parçalar için, çok küçük cihazları hedefliyor; Phonon 2 İngilizce ve uzun kayıtlar için doğruluğu ve hızı öne çıkarıyor. Kendi sesiniz ve aksanınızla denemeden karar vermeyin; kıyas tabloları kısmen temiz kayıtlara dayanıyor. Videoda Phonon 2 yer yer "metinden sese" diye anılıyor, ama anlatılan iş sesten metne.

Sesli uygulama örneği olarak Talkamble nedir yazısına, aynı haftanın ses modeli haberi için ElevenLabs v4 yazısına bakabilirsiniz.

Sık Sorulan Sorular

Whistle GPU gerektiriyor mu?

Hayır. Cactus'a göre yalnızca CPU'da, ek bağımlılık olmadan çalışıyor.

Whistle hangi dilleri destekliyor?

İngilizce, Almanca, Fransızca, İspanyolca, İtalyanca, Felemenkçe ve Lehçe; dil otomatik algılanıyor.

Whistle, Whisper base'den daha mı doğru?

Bazı ölçütlerde (LibriSpeech, SPGISpeech, Earnings-22, FLEURS ortalaması) evet; TED-LIUM, AMI ve MLS ortalamasında Whisper base daha iyi. Whistle 8,6 kat küçük ve daha hızlı.

Phonon 2 Türkçe biliyor mu?

Hayır, yalnızca İngilizce için yayımlandı.

Phonon 2 ne kadar hızlı?

Apple M5 MacBook Air'de bir saatlik ses yaklaşık 20 saniyede yazıya dönüyor; sekiz CPU çekirdeğinde 25 saniye.

Kaynak

Yorumlar