JetBrains, gerçek dünya Kotlin görevleriyle yeni bir AI ajan benchmark'ı yayınladı
JetBrains, AI kodlama ajanlarını gerçekçi Kotlin mühendislik görevleriyle (bir issue'yu okuyup çözüm üretmekten uçtan uca) değerlendiren 'Kotlin Benchmark'ı duyurdu. İlk turda Opus 4.7 xhigh ile çalışan Claude Code, 105 görevden 90'ını çözerek %85,71 ile listeyi domine etti; JetBrains Junie ve Codex ise %81,9 ile takip etti.
JetBrains, yapay zekâ kodlama ajanlarını değerlendirmek için yeni bir açık benchmark yayınladı: Kotlin Benchmark. Amaç, ajanların soyut/sentetik görevler yerine gerçek dünyadaki Kotlin mühendislik akışlarında — bir issue’yu okumaktan çözüm üretip teslim etmeye kadar — nasıl performans gösterdiğini ölçmek.
İlk sonuçlar
- Claude Code + Opus 4.7 xhigh: 105 görevden 90’ını çözdü — %85,71 çözüm oranı, listenin zirvesi.
- JetBrains Junie + Opus 4.7 max: %81,9
- Codex + GPT-5.5 xhigh: %81,9
- Sonraki değerlendirme turlarında, aynı prompt ve ajan yapılandırmasıyla Claude Code’un oranı %86,4’e çıktı.
- Benchmark’ın ilk kamuya açık sürümü bu sonuçları içeriyor; en yeni model sürümlerini henüz kapsamıyor, ikinci iterasyon geliştirme aşamasında.
Neden önemli
Genel amaçlı kodlama benchmark’ları (Terminal-Bench, SWE-Bench gibi) modelin ortalama yeteneğini gösterirken, dile özel testler gerçek proje ortamındaki performansı daha isabetli yansıtıyor. JetBrains’in bu adımı, kodlama ajanı pazarının artık “hangi model en genel olarak iyi” sorusundan “hangi ajan benim dilimde/çerçevemde en iyi” sorusuna evrildiğinin bir işareti.
Dile özel, gerçekçi benchmark'ların artması, kodlama ajanlarının 'genel' skorlar yerine ekiplerin gerçekten kullandığı dil ve çerçevelerde ölçülmesine doğru bir kayma olduğunu gösteriyor — araç seçerken kendi teknoloji yığınınıza en yakın benchmark'a bakmak daha isabetli sonuç verir.
- JetBrains Blog — Introducing the Kotlin Benchmark for AI Coding Agents · 2026-07-08
- kotlinlang.org — The Kotlin Benchmark by JetBrains · 2026-07-08
Bu haber ozgun ozet olarak hazirlanmistir; telif hakki ilgili kaynaklara aittir. Tam metin icin kaynak baglantilarini ziyaret edin.
Ilgili Haberler
OpenAI, SpaceX'in Cursor'u satın almasının ardından modellerini platformdan çekiyor
OpenAI, bir uzay şirketinin AI kodlama aracı Cursor'un geliştiricisini 60 milyar dolara satın almasının ardından, Cursor'a model tedarikini 12 Kasım 2026 itibarıyla sonlandıracağını duyurdu. Gerekçe olarak, alıcı şirketin bağlı olduğu grubun geçmişte hizmet şartlarını ihlal ettiği ve platformun teknolojiyi şartlara uygun kullanacağına dair yeterli güven duyulmadığı belirtildi. Kasım'a kadar geliştiriciler mevcut modellere erişebilecek, ancak bu süreçte yayınlanacak yeni modeller Cursor üzerinden hiç sunulmayacak.
OpenShot 4.0 yayınlandı — yerel AI maskeleme, renk düzeltme ve ekran kaydı geldi
Açık kaynak video düzenleyici OpenShot, kuruluşundan bu yana en iddialı güncellemesi olarak tanıtılan 4.0 sürümünü yayınladı. Yeni Kayıt Görünümü ekran, webcam, mikrofon ve sistem sesini doğrudan projeye kaydedebiliyor; yeni Renk Görünümü renk çarkları, eğriler, LUT'lar ve canlı video skopları sunuyor. Bulut veya abonelik gerektirmeyen, kullanıcının kendi bilgisayarında çalışan yerel AI destekli maskeler ve 10 yeni efekt eklendi.
Google, Manifest V2 uzantılarını Chrome Web Store'dan kalıcı olarak kaldırdı — uBlock Origin dahil
Google, 31 Ağustos 2026'da Chrome Web Store'da kalan tüm Manifest V2 uzantılarını kaldırarak çok yıllık Manifest V3 geçişini tamamladı — bunlar arasında uBlock Origin'in tam sürümü de var. MV2 uzantıları zaten Temmuz 2025'te stabil Chrome'da çalışmayı durdurmuştu; artık mağazadan yüklenemiyor, güncellenemiyor veya yeniden yüklenemiyor. Google değişikliği güvenlik ve performans gerekçesiyle savunuyor; topluluk alternatif tarayıcıları öneriyor.