GLM-5.3, bağımsız kıyaslamada kapalı-kaynak modelleri beşte bir maliyetle geride bıraktı
Bağımsız kıyaslama platformu Ed-o-meter, 17 farklı büyük dil modelini aynı 28 gerçek-dünya görevinde tek bir test düzeneğiyle karşılaştırdı. Açık ağırlıklı GLM-5.3 modeli, yüzde 100 görev tamamlama oranı ve 9,3 rubrik puanıyla sıralamanın zirvesine yerleşti; görev başına maliyeti ise GPT-5.5'in yaklaşık beşte biri (0,28 dolar) olarak ölçüldü. Aynı kıyaslamada GPT-5.6-Luna en düşük maliyetli model, Sonnet-4-6 ise hız-kalite dengesinde öne çıkan alternatif olarak not edildi.
İngiltere merkezli Reinvently’nin geliştirdiği bağımsız kıyaslama aracı Ed-o-meter, 17 büyük dil modelini 28 gerçek-dünya görevinden oluşan ortak bir test setinde, aynı değerlendirme çerçevesiyle (harness) karşılaştırdı. Sonuçlara göre açık ağırlıklı GLM-5.3 modeli, yüzde 100 görev geçiş oranı ve 9,3 rubrik puanıyla listenin zirvesine yerleşti.
Kıyaslamanın öne çıkan yanı maliyet karşılaştırması oldu: GLM-5.3’ün görev başına ortalama maliyeti yaklaşık 0,28 dolar olarak ölçüldü — bu, GPT-5.5’in maliyetinin kabaca beşte biri. Listede GPT-5.6-Luna en ucuz model kategorisinde öne çıkarılırken, Sonnet-4-6 hız ile kalite arasındaki dengesiyle alternatif bir seçenek olarak not edildi.
Haber, teknoloji forumu Hacker News’te de geniş yankı buldu ve 239 puana ulaşarak günün öne çıkan tartışma konularından biri oldu. Bununla birlikte sonuçların tek bir bağımsız kıyaslama sitesinden geldiği, herhangi bir laboratuvarın resmi duyurusuna dayanmadığı belirtilmeli — bu tür tekil kıyaslamalar, ikinci kaynaklarla doğrulanmadan kesin karar dayanağı olarak kullanılmamalı.
Açık ağırlıklı modellerin kapalı-kaynak muadillerine yakın veya üstün performansı önemli ölçüde düşük maliyetle sunabildiğine dair bağımsız bir sinyal; ancak tek bir kıyaslama kaynağına dayandığından, model seçimi kararlarında ikinci bağımsız doğrulama olmadan referans alınması önerilmiyor.
- Ed-o-meter (Reinvently) · 2026-08-23
- Hacker News · 2026-08-23
Bu haber ozgun ozet olarak hazirlanmistir; telif hakki ilgili kaynaklara aittir. Tam metin icin kaynak baglantilarini ziyaret edin.
Ilgili Haberler
Anthropic araştırmacısından kendi kendini geliştiren yapay zekâya bir bakış
Anthropic'in fellows programındaki bir araştırmacı, yapay zekâ sistemlerinin literatür tarayıp yöntem önererek ve modeli kısa iterasyonlarla eğiterek hizalama hatalarını azaltabildiğini gösteren yeni bir makale yayınladı. Çalışmada, en iyi otomatik yöntem ortalama altı saat içinde deneyimli insan araştırmacıların önerdiği yöntemleri geride bırakmış; maliyet karşılaştırmasında saatte yaklaşık 4 dolarlık otomatik araştırmaya karşı insan araştırmacı için saatte yaklaşık 150 dolar rakamı veriliyor.
Sony, EMI ve Warner Chappell, Anthropic'i şarkı sözü korsanlığıyla suçlayan yeni dava açtı
Büyük müzik yayıncıları Sony, EMI ve Warner Chappell, Anthropic'in kitap yazarlarıyla 1,5 milyar dolarlık telif uzlaşmasının ardından şirketi bu kez torrent yoluyla binlerce şarkı sözü ve nota içeren eseri izinsiz indirmekle suçlayan yeni bir dava açtı. Dilekçe, kurucu ortağın toplu indirme yaptığını gösteren iç yazışmaları kanıt olarak sunuyor. Anthropic ise iddiaları reddedip adil-kullanım savunmasını sürdüreceğini açıkladı.
Anthropic'in yeni Fable 5.1 modeli daha ucuz ve daha az kısıtlayıcı geliyor
Anthropic, en gelişmiş model ailesinin yeni sürümlerini — Fable 5.1 ve Mythos 5.1'i — yayınladı. Yeni sürüm performans artışının yanında token maliyetini düşürüyor ve güvenlik filtrelerinin yanlış-pozitif engellemelerini azaltıyor. Kurumsal müşteriler için daha önce sunulmayan 'Sıfır Veri Saklama' özelliği artık Fable ailesine de geliyor; Mythos 5.1 ise yalnızca siber güvenlik veya yaşam bilimleri araştırması yapan kayıtlı ortaklara açılıyor.