Ne zaman vazgeçileceğini bilmek: LLM'leri sonuçsuz akıl yürütmeyi durdurmaya eğitme
Yeni bir araştırma, büyük dil modellerinin yetkinliklerinin ötesindeki görevlerde işlemsel açıdan pahalı ama anlamsal olarak boş akıl yürütme ürettiğini sistematik olarak inceliyor. Yazarlar, modeli kendi yetkinlik sınırlarıyla hizalayan CaRL adlı bir pekiştirmeli öğrenme yöntemi öneriyor.
Yeni bir araştırma, büyük dil modellerinin kendi yetkinliklerinin ötesindeki görevlerde işlemsel açıdan pahalı ama anlamsal olarak boş — yani “sonuçsuz” — akıl yürütme ürettiğini sistematik biçimde karakterize ediyor. Çalışmaya göre en yaygın hata modu, yüzeysel olarak makul görünen ama ince hatalar taşıyan “gösterişli akıl yürütme” (specious reasoning).
Araştırmacılar bu soruna karşı, modeli kendi yetkinlik sınırlarıyla hizalayan Capability-aligned Reinforcement Learning (CaRL) adlı bir yöntem öneriyor. Yöntem, ödül şekillendirmesi yoluyla modeli sonuçsuz akıl yürütme yerine görevi reddetmeye teşvik ediyor.
Geçmiş başarısızlıklardan öğrenme
CaRL yaklaşımının önemli bir bileşeni, modelin geçmişte başarısız olduğu görev türlerini bir “ret-denetimi” sinyaline dönüştürmesi. Bu sayede model, benzer bir görevle tekrar karşılaştığında boşa kaynak harcamak yerine erken aşamada görevi reddetmeyi veya belirsizliğini açıkça belirtmeyi öğrenebiliyor. Araştırmacılar bunun, üretim ortamlarında güvenilirliği artırabilecek pratik bir yaklaşım olduğunu vurguluyor.
Modellerin ne zaman durup 'bilmiyorum' demesi gerektiğini öğrenebilmesi, üretim ortamlarında yanıltıcı ama makul görünen yanlış cevapların önüne geçebilecek önemli bir güvenilirlik gelişimi olarak görülüyor.
Bu haber ozgun ozet olarak hazirlanmistir; telif hakki ilgili kaynaklara aittir. Tam metin icin kaynak baglantilarini ziyaret edin.
Ilgili Haberler
Anthropic araştırmacısından kendi kendini geliştiren yapay zekâya bir bakış
Anthropic'in fellows programındaki bir araştırmacı, yapay zekâ sistemlerinin literatür tarayıp yöntem önererek ve modeli kısa iterasyonlarla eğiterek hizalama hatalarını azaltabildiğini gösteren yeni bir makale yayınladı. Çalışmada, en iyi otomatik yöntem ortalama altı saat içinde deneyimli insan araştırmacıların önerdiği yöntemleri geride bırakmış; maliyet karşılaştırmasında saatte yaklaşık 4 dolarlık otomatik araştırmaya karşı insan araştırmacı için saatte yaklaşık 150 dolar rakamı veriliyor.
Sony, EMI ve Warner Chappell, Anthropic'i şarkı sözü korsanlığıyla suçlayan yeni dava açtı
Büyük müzik yayıncıları Sony, EMI ve Warner Chappell, Anthropic'in kitap yazarlarıyla 1,5 milyar dolarlık telif uzlaşmasının ardından şirketi bu kez torrent yoluyla binlerce şarkı sözü ve nota içeren eseri izinsiz indirmekle suçlayan yeni bir dava açtı. Dilekçe, kurucu ortağın toplu indirme yaptığını gösteren iç yazışmaları kanıt olarak sunuyor. Anthropic ise iddiaları reddedip adil-kullanım savunmasını sürdüreceğini açıkladı.
Anthropic'in yeni Fable 5.1 modeli daha ucuz ve daha az kısıtlayıcı geliyor
Anthropic, en gelişmiş model ailesinin yeni sürümlerini — Fable 5.1 ve Mythos 5.1'i — yayınladı. Yeni sürüm performans artışının yanında token maliyetini düşürüyor ve güvenlik filtrelerinin yanlış-pozitif engellemelerini azaltıyor. Kurumsal müşteriler için daha önce sunulmayan 'Sıfır Veri Saklama' özelliği artık Fable ailesine de geliyor; Mythos 5.1 ise yalnızca siber güvenlik veya yaşam bilimleri araştırması yapan kayıtlı ortaklara açılıyor.