UI-Mate: Açık ağırlıklı GUI ajanı temel modeli tanıtıldı
Tencent Hunyuan'dan 29 yazarlı bir ekip, ekran-tabanlı görevleri otonom yürüten açık-ağırlıklı bir 'GUI ajanı' temel modeli olan UI-Mate'i tanıttı. 27 milyar parametreli model, OSWorld-Verified kıyaslamasında yüzde 77,0 başarı elde etti; tek bir örnek gösterim, katı başarı oranını yüzde 17,2'den yüzde 35,4'e çıkardı.
Tencent Hunyuan’dan 29 yazarlı geniş bir araştırma ekibi, ekran görüntüsü üzerinden görevleri otonom biçimde yürüten açık-ağırlıklı bir “GUI ajanı” temel modeli olan UI-Mate’i tanıttı. Model, kapalı-döngü bir veri motoru ve paralel ortamlarda otomatik görev üretimiyle eğitildi.
27 milyar parametreli model, ekran-tabanlı ajan görevlerini değerlendiren OSWorld-Verified kıyaslamasında yüzde 77,0 başarı oranına ulaştı. Araştırmacılar ayrıca modele yalnızca tek bir örnek gösterim (demonstration) sunulduğunda katı başarı oranının yüzde 17,2’den yüzde 35,4’e çıktığını, yani modelin bağlam-içi öğrenmeye güçlü şekilde duyarlı olduğunu tespit etti.
Yeni bir ofis-görevi kıyaslaması
Çalışma kapsamında, 100 gerçekçi ofis görevinden oluşan yeni bir kıyaslama seti olan OSWorkerBench de sunuldu. Bu set, GUI ajanı modellerinin form doldurma, buton bulma ve çok adımlı arayüz navigasyonu gibi günlük ofis görevlerindeki performansını ölçmeyi amaçlıyor.
Açık ağırlıklı GUI ajanı modellerinin olgunlaşması, ekran-tabanlı görev otomasyonunda üçüncü taraf kapalı servislere bağımlılığı azaltıp kendi barındırılan çözümlerin önünü açabilir.
- arXiv - UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations · 2026-08-16
Bu haber ozgun ozet olarak hazirlanmistir; telif hakki ilgili kaynaklara aittir. Tam metin icin kaynak baglantilarini ziyaret edin.
Ilgili Haberler
Anthropic araştırmacısından kendi kendini geliştiren yapay zekâya bir bakış
Anthropic'in fellows programındaki bir araştırmacı, yapay zekâ sistemlerinin literatür tarayıp yöntem önererek ve modeli kısa iterasyonlarla eğiterek hizalama hatalarını azaltabildiğini gösteren yeni bir makale yayınladı. Çalışmada, en iyi otomatik yöntem ortalama altı saat içinde deneyimli insan araştırmacıların önerdiği yöntemleri geride bırakmış; maliyet karşılaştırmasında saatte yaklaşık 4 dolarlık otomatik araştırmaya karşı insan araştırmacı için saatte yaklaşık 150 dolar rakamı veriliyor.
Sony, EMI ve Warner Chappell, Anthropic'i şarkı sözü korsanlığıyla suçlayan yeni dava açtı
Büyük müzik yayıncıları Sony, EMI ve Warner Chappell, Anthropic'in kitap yazarlarıyla 1,5 milyar dolarlık telif uzlaşmasının ardından şirketi bu kez torrent yoluyla binlerce şarkı sözü ve nota içeren eseri izinsiz indirmekle suçlayan yeni bir dava açtı. Dilekçe, kurucu ortağın toplu indirme yaptığını gösteren iç yazışmaları kanıt olarak sunuyor. Anthropic ise iddiaları reddedip adil-kullanım savunmasını sürdüreceğini açıkladı.
Anthropic'in yeni Fable 5.1 modeli daha ucuz ve daha az kısıtlayıcı geliyor
Anthropic, en gelişmiş model ailesinin yeni sürümlerini — Fable 5.1 ve Mythos 5.1'i — yayınladı. Yeni sürüm performans artışının yanında token maliyetini düşürüyor ve güvenlik filtrelerinin yanlış-pozitif engellemelerini azaltıyor. Kurumsal müşteriler için daha önce sunulmayan 'Sıfır Veri Saklama' özelliği artık Fable ailesine de geliyor; Mythos 5.1 ise yalnızca siber güvenlik veya yaşam bilimleri araştırması yapan kayıtlı ortaklara açılıyor.