OpenAI, Astra modelinin kritik siber güvenlik eşiğini geçmesi üzerine eğitimi yavaşlattı
OpenAI, geliştirmekte olduğu Astra modelinin kendi Preparedness Framework'ündeki 'Kritik' siber güvenlik yetenek eşiğini geçebileceğine dair ön kanıtlar buldu — şirketin bir modeli bu eşikle işaretlemesi ilk kez yaşanıyor. Sonuç: pekiştirmeli öğrenme eğitiminde iki haftalık duraklama ve araştırma ortamlarının sertleştirilmesi.
OpenAI, son haftalarda iki gelişmenin giderek yetenekli hâle gelen yapay zekâ sistemleriyle ilişkili riskleri gözler önüne serdiğini açıkladı: OpenAI-Hugging Face güvenlik olayı ve ayrıca, geliştirmekte olduğu Astra modelinin kendi Preparedness Framework’ündeki “Kritik” siber güvenlik yetenek eşiğini geçebileceğine dair ön kanıtlar. Şirket bu gelişmeleri, izleme, hizalama (alignment) ve güvenlik önlemlerini eğitim sürecinin her aşamasında güçlendirme çalışmalarına aciliyet kazandıran etkenler olarak tanımlıyor.
Modeller daha yetenekli hâle geldikçe onları dahili olarak geliştirme ve test etme riskleri de artıyor. OpenAI bu standartları karşılamak için gereken zamanı almak amacıyla ölçeklendirme hızını geçici olarak yavaşlattığını belirtti — bu, dağıtımı planlanan en son modellerde pekiştirmeli öğrenme (RL) eğitiminde iki haftalık bir duraklamayı, araştırma ortamlarının daha sıkı test edilmesini (red-teaming) ve izleme sistemlerinin kapsamının genişletilmesini kapsıyor. En büyük planlanan “frontier RL” koşusu, model davranışını değerlendirmek, güvenlik önlemlerini doğrulamak ve hizalanmaya dair daha fazla kanıt oluşturmak amacıyla küçük ölçekli eğitim ve değerlendirmeler yapılırken hâlâ beklemede.
Şirket, hizalamayı — yapay zekâ sistemlerinin amaçlandığı gibi davranmasını ve insan gözetimine duyarlı kalmasını sağlama çalışmasını — araştırma programının merkezinde olduğunu, ancak artık eğitimin tüm aşamalarında hizalanmış davranışa dair daha güçlü kanıt talep ettiklerini vurguluyor. OpenAI, gelecekteki model ilerlemesinden gelen sinyallerin, mevcut Preparedness Framework’ün ötesine geçen daha geniş bir yaklaşıma ihtiyaç olduğunu gösterdiğini belirtti.
Bir AI laboratuvarının kendi modelini 'kritik risk' eşiğiyle işaretleyip eğitimi durdurması, sektörde model geliştirme hızının artık yalnızca performansla değil güvenlik doğrulamasıyla da sınırlandığının somut bir göstergesi.
- OpenAI · 2026-08-18
Bu haber ozgun ozet olarak hazirlanmistir; telif hakki ilgili kaynaklara aittir. Tam metin icin kaynak baglantilarini ziyaret edin.
Ilgili Haberler
Anthropic araştırmacısından kendi kendini geliştiren yapay zekâya bir bakış
Anthropic'in fellows programındaki bir araştırmacı, yapay zekâ sistemlerinin literatür tarayıp yöntem önererek ve modeli kısa iterasyonlarla eğiterek hizalama hatalarını azaltabildiğini gösteren yeni bir makale yayınladı. Çalışmada, en iyi otomatik yöntem ortalama altı saat içinde deneyimli insan araştırmacıların önerdiği yöntemleri geride bırakmış; maliyet karşılaştırmasında saatte yaklaşık 4 dolarlık otomatik araştırmaya karşı insan araştırmacı için saatte yaklaşık 150 dolar rakamı veriliyor.
Sony, EMI ve Warner Chappell, Anthropic'i şarkı sözü korsanlığıyla suçlayan yeni dava açtı
Büyük müzik yayıncıları Sony, EMI ve Warner Chappell, Anthropic'in kitap yazarlarıyla 1,5 milyar dolarlık telif uzlaşmasının ardından şirketi bu kez torrent yoluyla binlerce şarkı sözü ve nota içeren eseri izinsiz indirmekle suçlayan yeni bir dava açtı. Dilekçe, kurucu ortağın toplu indirme yaptığını gösteren iç yazışmaları kanıt olarak sunuyor. Anthropic ise iddiaları reddedip adil-kullanım savunmasını sürdüreceğini açıkladı.
Anthropic'in yeni Fable 5.1 modeli daha ucuz ve daha az kısıtlayıcı geliyor
Anthropic, en gelişmiş model ailesinin yeni sürümlerini — Fable 5.1 ve Mythos 5.1'i — yayınladı. Yeni sürüm performans artışının yanında token maliyetini düşürüyor ve güvenlik filtrelerinin yanlış-pozitif engellemelerini azaltıyor. Kurumsal müşteriler için daha önce sunulmayan 'Sıfır Veri Saklama' özelliği artık Fable ailesine de geliyor; Mythos 5.1 ise yalnızca siber güvenlik veya yaşam bilimleri araştırması yapan kayıtlı ortaklara açılıyor.