İçeriğe geç / Skip to content / Zum Inhalt
Ahmet Balaman LogoAhmet Balaman

LongCat 2.5 Preview ve Rakip Yapay Zekâlar

Ahmet Balaman

8 dk okuma

Vibe CodingLongCatMeituanYapay ZekaAI AgentBenchmark
LongCat 2.5 Preview ve Rakip Yapay Zekâlar

Meituan, LongCat-2.5-Preview modelini yayımladı ve açık ağırlıklı model cephesinde rekabeti yeniden kızıştırdı. Aile, uzun bağlamlı ajan kodlaması üzerine kurulu bir şirket içi araştırma hattından, tek bir model etrafında on iki farklı araca resmî rehber yayımlayan bir ekosisteme dönüştü.

Bu haberin asıl meselesi tek bir modelin yetenekleri değil, ortaya çıkan yapısal bir değişim. Aynı anda üç şey birden doğru: bir milyon tokenlık bağlam artık farklı edici değil, düşünme modelleri isteğe bağlı hâle geliyor ve açık ağırlıklı modeller kapalı amiral gemilere fiyatta yaklaşıyor.

Bu yazıda üç şeyi bir araya getiriyorum: LongCat'in kendi yayımladığı benchmark puanları, tüm modellerin teknik özellikleri ve bu puanların nasıl okunması gerektiği.

Bir uyarıyla başlayayım: Bu bir haber metnidir, bağımsız bir test değildir. Aşağıdaki puanlar LongCat'in kendi model kartından alınmıştır ve LongCat'in kendi ölçümleridir. Karşılaştırma satırlarının önemli bir kısmı ise doğrudan LongCat tarafından değil, rakip şirketlerin kendi raporlarından alıntılanmıştır. Bu ayrımı neden önemli gördüğümü yazının ortasında açıklıyorum.

Yayımlanan benchmark tablosu

LongCat, kendi model kartında modeli rakip modellerle karşılaştıran bir tablo yayımlıyor. Tabloyu aynen aktarıyorum, çünkü bir haber metninde kaynak tabloyu bozmak en sık yapılan hatadır:

Ölçüt LongCat-2.0 Gemini 3.1 Pro GPT-5.5 Claude Opus 4.6 Claude Opus 4.7 Claude Opus 4.8
Terminal-Bench 2.1 70.8 70.7* 73.8* - 71.7* 78.9*
SWE-bench Pro 59.5 54.2* 58.6* 57.3* 64.3* 69.2*
SWE-bench Multilingual 77.3 76.9* - 77.8* 80.5* 84.8*
FORTE 73.2 70.3 77.8 73.2 77.6 77.2
BrowseComp 79.9 85.9* 84.4* 84.0* 79.3* 84.3*
RWSearch 78.8 76.3 85.3 81.3 79.3 77.3
IFEval 90.0 96.1 95.0 92.2 88.7 86.0
Writing Bench 83.8 83.7 84.7 - 85.3 85.2
IMO-AnswerBench 81.8 90.0 79.5 75.3* 81.8 75.3
GPQA-diamond 88.9 94.3* 93.6* 91.3* 94.2* 92.4*

LongCat'in notu şu: yıldız işareti (*) "rakip modelin kendi raporundan alıntılandı" anlamına geliyor. Yani LongCat'in puanları kendi ortamında ölçülmüş, rakiplerin puanları ise o rakiplerin kendi ölçümleri.

Bu tabloyu nasıl okumalı

Haber metinlerinde benchmark tablosu genellikle bir sıralama listesi gibi sunulur. Bu burada yanıltıcı olur, çünkü yıldız işaretleri tam olarak karşılaştırmanın en zayıf noktasını gösteriyor.

Sorun şu: LongCat'in puanı kendi donanımında, kendi harness'inde, kendi prompt kalıbında ölçülmüş. Rakibin puanı ise o rakibin kendi donanımında, kendi harness'inde ölçülmüş. Bu iki ölçüm aynı laboratuvarda yapılmamış. Aynı modeli iki farklı yerde koşturduğunuzda aynı puanı almazsınız; bu, modelin değil ölçümün bir özelliği.

İkinci sorun: Bazı satırlarda rakip puanı boş. Claude Opus 4.6 sütununda Terminal-Bench karşılığı "-", yani "kıyaslanabilir kamuya açık puan yok". LongCat'in bu satırlarda rakibin puanını bilmediği, yani kendi lehine ya da aleyhine bir yorum yapmadığı görülüyor. Bu, tarafsızlığın bir işareti.

Üçüncü ve en önemli sorun: Tablonun satırları tek bir yönde değil. LongCat, kodlama ve ajan satırlarında bazı yerlerde önde, bazı yerlerde geride. Terminal-Bench 2.1'de Claude Opus 4.8'den on puan geride, ama FORTE'ta Gemini 3.1 Pro'dan üç puan önde. IFEval'da 90,0 ile tablonun en yüksek ikinci değeri; ama GPQA-diamond'da 88,9 ile en düşük değerlerden biri.

Bu dağınık tablo, haberin asıl mesajını veriyor: LongCat tek bir alanda uzmanlaşmış bir model değil, rakiplerle aynı genişlikte bir bandın içinde duran bir model. Kimse "LongCat Codex'i yendi" ya da "LongCat derin araştırmada lider" diyemez. Doğru ifade şu: kodlama ajanlarında rekabet edilebilir seviyede, temel akıl yürütmede geride.

Uzun bağlam savaşı bitti mi

Teknik özellik tablosuna bakınca tablo şöyle görünüyor:

Model Bağlam Azami çıktı Girdi biçimleri Girdi $ / M Çıktı $ / M
LongCat-2.5-Preview 1.048.576 131.072 metin, görsel 0,30 1,20
meituan/longcat-2.0 1.048.756 262.144 metin 0,30 1,20
openai/gpt-6-luna 1.050.000 128.000 metin, görsel, dosya 0,10 0,50
google/gemini-3.8-flash 1.048.576 65.536 metin, görsel, video, dosya, ses 0,75 3,75
anthropic/claude-opus-5.5 1.000.000 128.000 metin, görsel, dosya 4,00 20,00
stealth/space-bunny-alpha 1.000.000 524.288 metin, görsel, video 0 0

Altı modelin altısı da bir milyon token civarında bağlam penceresi sunuyor. Bu, karşılaştırma yazısındaki tespiti doğruluyor: bir milyon token artık bir özellik değil, bir beklenti seviyesi. Rekabet bağlamın büyüklüğüne değil, o bağlamı nasıl kullandığına kaymış durumda.

LongCat'in buradaki farkı, pencere değil, arkasındaki mekanizma. Seyrek dikkat sayesinde 1M pencereyi her token çiftini karşılaştırmadan kullanıyor. 1M bağlam yazısında anlattığım karesel maliyet sorunu, seyrek dikkatin varlığında azalıyor. Pencere aynı, maliyet aynı değil.

Düşünme modu cephesi

Son aylarda en görünür değişim bu alanda. Üç farklı yaklaşım var:

Kapatılamayan akıl yürütme. Space Bunny Alpha bunu zorunlu kılıyor, varsayılan kademesi max. Claude Opus 5.5'te de kapatılamıyor, ama varsayılan high. Uzun cevaplarda istenen, basit görevlerde gereksiz.

İsteğe bağlı akıl yürütme. LongCat-2.5-Preview'da thinking alanı enabled ya da disabled alıyor, varsayılan enabled. Gemini 3.8 Flash'te de kapatılamıyor. Bu, üretim sistemi kuran biri için en kullanışlı davranış: basit sınıflandırmada kapatıp gecikmeden kurtulabiliyorsunuz.

Kapatılabilir akıl yürütme. GPT-6 Luna bunu none kademesiyle sunuyor, varsayılanı medium. Model bazında değil, çağrı bazında karar veriyorsunuz.

Pratik sonuç: uzun süreli ajan döngülerinde vibe coding yazısındaki "hangi aracı seçmeliyim" sorusu artık yeni bir soru daha içeriyor: "hangi model seçtiğimde ne kadar düşünmeme izin veriyorum." Uzun bağlamlı bir ajanda, düşünme kademesini tura göre ayarlamak ajan yazısındaki örnekte yaptığımızın genel hâli.

Fiyat cephesi

Aynı senaryoyu altı modelde hesaplayalım. Bir turda 200.000 token girdi, 50.000 token çıktı; ayda 30 tur:

Model Tur başına Aylık Önbellekli girdiyle aylık
stealth/space-bunny-alpha 0,00 $ 0,00 $ 0,00 $
openai/gpt-6-luna 0,045 $ 1,35 $ 1,20 $
LongCat-2.5-Preview 0,1200 $ 3,60 $ 1,76 $
google/gemini-3.8-flash 0,3375 $ 10,13 $ 10,13 $
anthropic/claude-opus-5.5 1,80 $ 54,00 $ 53,65 $

Son sütun, LongCat'in önbellekli fiyatı sayesinde 3,60 $ yerine 1,76 $'ya düştüğü gerçek hali. GPT-6 Luna'nın da önbellek fiyatı var, oradaki düşüş daha küçük.

Buradaki sıralama haberin üçüncü ayağını tamamlıyor. Kapalı amiral gemilerin fiyat avantajı, önizleme modellerinde açık modellerin fiyat avantajına dönüşüyor. Claude Opus 5.5 ayda 54 $ iken LongCat-2.5-Preview ayda 1,76 $'ya aynı bağlamı sunuyor. Bu bir fiyat savaşı değil, bir ekonomik sınıf değişimi.

Ama tek cümlelik bir uyarı: LongCat'in 0,30 $ fiyatı da "sınırlı süreli indirimli" olarak listeleniyor. Space Bunny Alpha karşılaştırmasında anlatıldığı gibi, bugünün fiyat listesi yarınınki değil.

Şeffaflık cephesi

Bu, LongCat'in en güçlü ve en zayıf olduğu yer.

Güçlü: LongCat'i bir şirket, yani hukuki olarak tanımlanabilir bir muhatap. Model kartı var, lisans açık (MIT), teknik blog var, GitHub deposu var. 1,8 trilyon parametrelik modelin mimarisi seyrek dikkat ve N-gram gömme olarak açıklanmış. LongCat-2.0'ın kuantize sürümleri indirilebilir.

Zayıf: LongCat-2.5-Preview için ağırlıklar yayımlanmamış. Yani "LongCat açık kaynaklıdır" ifadesi sürüm belirtmeden doğru değil. Bugünün gerçeği, önizleme sürümüne yalnızca API üzerinden erişilebilmesi.

Karşı tarafta Space Bunny Alpha'nın durumu tam tersi: fiyat sıfır, bağlam bir milyon, video girdisi var, ama ne şirket ne lisans ne ağırlık ne de bilgi kesim tarihi var.

Yani iki uç, aynı eksende:

Space Bunny Alpha ve LongCat-2.5-Preview yan yana: Space Bunny Alpha ücretsiz ama şeffaf değil, LongCat şeffaf ama 0,30 $ listeleniyor

Şeffaflık Fiyat Bağlam Görsel/video
Space Bunny Alpha yok 0 $ 1M metin, görsel, video
LongCat-2.5-Preview sınırlı (ağırlıklar yok) 0,30 $ 1M metin, görsel

Bu, "hangisi daha iyi" sorusunun neden model adıyla değil, sorduğunuz soruyla ilgili olduğunu gösteriyor. JEV yazısında anlatılan ayrım burada da geçerli: model, metin girip metin çıkaran bir fonksiyondur; onu ne için kullanacağınıza karar vermek sizin işiniz.

Bu haberden ne çıkar

Üç cümleyle:

Bir. Uzun bağlam birinci sınıf özelliğini yitirdi. Altı rakip modelin altısında da bir milyon token var. Artık soru "kaç token" değil, "o token'ları hangi mekanizmayla seçiyorsun."

İki. Düşünme kademesi, yeni bir fiyat kalemi haline geldi. reasoning_effort ya da thinking yazmadan uzun bir ajan döngüsü kurmak, faturalandırmayı göz kararı yapmak demek.

Üç. Açık ağırlıklı modeller, bağlam ve multimodal yeteneklerde kapalı rakiplerle aynı sınıfa geldi; farkı fiyatta ve entegrasyon genişliğinde. LongCat'in en somut kazanımı bu: on iki araca resmî rehber yayımlamak, modelin teknik özelliklerinden daha çok işe yarıyor.

Kaynaklar

Yorumlar