Anthropic: dogru deterministik arac, AI biyoloji dogrulugunu %16.9'dan %92.8'e cikardi
Anthropic'in AI for Science calismasi, en iyi arastirma ajanlarinin basit bir biyoloji gorevinde (NCBI Virus veritabanindan virus dizisi cekme) %16.9 kadar dusuk dogrulukla, ustelik ayni soruya farkli cevaplarla calistigini gosterdi. Cozum NCBI ile birlikte gelistirilen 'gget virus' adli deterministik arac oldu: onunla her model %92'yi asti ve calisma-arasi kararlilik 0.92-1.00'e ulasti. Cikarim net: guvenilir veri, en yeni ya da en pahali modele degil dogru deterministik araca bagli.
Anthropic’in AI for Science calismasindan cikan carpici bulgu: en iyi arastirma ajanlari bile temel bir biyoloji gorevinde guvenilmez.
Problem: ayni soru, farkli cevap
Anthropic, gunumuzun en iyi arastirma ajanlarinin NCBI Virus veritabanindan virus dizisi cekme gibi basit bir gorevde %16.9’a kadar dusuk dogrulukla calistigini ve ayni sorguya her seferinde farkli cevaplar verdigini raporladi. Yani sorun yalniz “yeterince akilli degil” degil; sonuc tekrar-uretilebilir bile degil.
Cozum: gget virus (deterministik arac)
Anthropic ekibi NCBI ile birlikte gget virus adli deterministik bir arac gelistirdi. Bu arac NCBI’nin REST, Datasets ve E-utilities API’lerini koordine ediyor, buyuk sonuclari toplu isliyor ve standartlastirilmis, loglanmis cikti donduruyor.
Sonuc: her model %92’yi asti
- Kiyaslama setindeki her model %92 dogrulugu gecti.
- Calisma-arasi kararlilik 0.92 ile 1.00 arasina firladi.
- Claude Sonnet 4 tek basina %16.9’dan %92.8’e yukseldi.
Arastirmanin acik cikarimi: “Guvenilir veri kurulumu, en yeni ya da en pahali modele erisime bagli olmamali.” Dogru deterministik araca sahip daha ucuz bir model, o arac olmadan calisan pahali modelleri geciyor.
Neden önemli
Bu bulgu, yaygin bir tasarim ilkesini bagimsiz bir kanitla dogruluyor: gerceklerde ve guvenlikte determinizm, dilde ve niyette AI. Fiyat/bolge/odeme gibi kritik alanlari deterministik cozup, dogal-dil ve niyeti AI’ya birakan mimariler burada laboratuvar kanitiyla destekleniyor. Pratik ders: para-hassas ve gizlilik-hassas is yuklerinde “daha buyuk model” degil, “dogru deterministik arac” yatirimi getiri sagliyor.
Onemli bir mimari ders: gerceklerde ve guvenlikte determinizm, dilde ve niyette AI. Ucuz model + dogru deterministik arac, pahali modeli gecebiliyor — para-hassas ve gizlilik-hassas is yuklerinde 'daha buyuk model' degil 'dogru arac' getiri sagliyor.
- Anthropic Research — Paving the way for AI agents in biology · 2026-06-30
- TechTimes — AI agents in biology too inaccurate; Anthropic's deterministic tool is the fix · 2026-06-09
- byteiota — Anthropic's AI for Biology: the accuracy crisis explained · 2026-06-30
Bu haber ozgun ozet olarak hazirlanmistir; telif hakki ilgili kaynaklara aittir. Tam metin icin kaynak baglantilarini ziyaret edin.
Ilgili Haberler
Anthropic araştırmacısından kendi kendini geliştiren yapay zekâya bir bakış
Anthropic'in fellows programındaki bir araştırmacı, yapay zekâ sistemlerinin literatür tarayıp yöntem önererek ve modeli kısa iterasyonlarla eğiterek hizalama hatalarını azaltabildiğini gösteren yeni bir makale yayınladı. Çalışmada, en iyi otomatik yöntem ortalama altı saat içinde deneyimli insan araştırmacıların önerdiği yöntemleri geride bırakmış; maliyet karşılaştırmasında saatte yaklaşık 4 dolarlık otomatik araştırmaya karşı insan araştırmacı için saatte yaklaşık 150 dolar rakamı veriliyor.
Sony, EMI ve Warner Chappell, Anthropic'i şarkı sözü korsanlığıyla suçlayan yeni dava açtı
Büyük müzik yayıncıları Sony, EMI ve Warner Chappell, Anthropic'in kitap yazarlarıyla 1,5 milyar dolarlık telif uzlaşmasının ardından şirketi bu kez torrent yoluyla binlerce şarkı sözü ve nota içeren eseri izinsiz indirmekle suçlayan yeni bir dava açtı. Dilekçe, kurucu ortağın toplu indirme yaptığını gösteren iç yazışmaları kanıt olarak sunuyor. Anthropic ise iddiaları reddedip adil-kullanım savunmasını sürdüreceğini açıkladı.
Anthropic'in yeni Fable 5.1 modeli daha ucuz ve daha az kısıtlayıcı geliyor
Anthropic, en gelişmiş model ailesinin yeni sürümlerini — Fable 5.1 ve Mythos 5.1'i — yayınladı. Yeni sürüm performans artışının yanında token maliyetini düşürüyor ve güvenlik filtrelerinin yanlış-pozitif engellemelerini azaltıyor. Kurumsal müşteriler için daha önce sunulmayan 'Sıfır Veri Saklama' özelliği artık Fable ailesine de geliyor; Mythos 5.1 ise yalnızca siber güvenlik veya yaşam bilimleri araştırması yapan kayıtlı ortaklara açılıyor.