Supabase, AI kodlama ajanlarını gerçek görevlerle ölçen açık kaynak benchmark yayınladı
Supabase, Claude Code, Codex ve OpenCode gibi AI kodlama ajanlarının veritabanı görevlerinde ne kadar başarılı olduğunu ölçen 'supabase/evals' adlı benchmark'ı Apache 2.0 lisansıyla açık kaynak olarak yayınladı. Ajanlar şema kurma, bozuk bir Edge Function'ı debug etme ve kırık bir RLS politikasını düzeltme gibi gerçek görevlerle konteynerize gerçek Supabase ortamlarına karşı test ediliyor.
Supabase, yapay zekâ kodlama ajanlarının veritabanı odaklı gerçek dünya görevlerinde ne kadar başarılı olduğunu ölçen supabase/evals adlı benchmark’ı Apache 2.0 lisansıyla açık kaynak olarak yayınladı.
Nasıl çalışıyor
Test setinde ajanlara (Claude Code, Codex, OpenCode) şema kurma, bozuk bir Edge Function’ı debug etme, kırık bir Row Level Security (RLS) politikasını düzeltme gibi görevler veriliyor. Ajanlar, konteynerize edilmiş gerçek Supabase yığınlarına karşı çalıştırılıyor; skorlama deterministik kontrol adımlarıyla LLM-hakem değerlendirmesinin karışımından oluşuyor.
Dikkat çeken bulgu: doküman okuma davranışı
Yayınlanan sonuçlara göre Codex/GPT-5.6, senaryo başına ortalama ~8 dokümantasyon sayfası okurken, Claude Code ortalama ~2 sayfa okuyor ve elinde ilgili skill yüklüyken bile senaryoların yüzde 40’ından azında dokümana başvuruyor. Bu fark, ajanların “önce araştır, sonra uygula” davranışında modeller arasında belirgin bir tutarsızlık olduğuna işaret ediyor.
Neden önemli
Açık kaynaklı ve tekrarlanabilir bir benchmark, geliştirici ekiplerinin hangi ajanı hangi görev sınıfı için tercih edeceklerine dair sübjektif izlenimler yerine ölçülebilir veriye dayanmasını sağlıyor. Supabase, benchmark’ın sonuçlarını düzenli aralıklarla güncelleyeceğini ve yeni görev senaryoları ekleyeceğini belirtti.
Bağımsız, tekrarlanabilir bir ölçüm çerçevesinin ortaya çıkması, ekiplerin hangi kodlama ajanının kendi veritabanı iş akışlarına en uygun olduğuna varsayım yerine veriyle karar vermesini kolaylaştırıyor.
- marktechpost.com — Supabase Releases Evals · 2026-08-01
- Supabase — Introducing Supabase Evals · 2026-08-01
Bu haber ozgun ozet olarak hazirlanmistir; telif hakki ilgili kaynaklara aittir. Tam metin icin kaynak baglantilarini ziyaret edin.
Ilgili Haberler
OpenAI, SpaceX'in Cursor'u satın almasının ardından modellerini platformdan çekiyor
OpenAI, bir uzay şirketinin AI kodlama aracı Cursor'un geliştiricisini 60 milyar dolara satın almasının ardından, Cursor'a model tedarikini 12 Kasım 2026 itibarıyla sonlandıracağını duyurdu. Gerekçe olarak, alıcı şirketin bağlı olduğu grubun geçmişte hizmet şartlarını ihlal ettiği ve platformun teknolojiyi şartlara uygun kullanacağına dair yeterli güven duyulmadığı belirtildi. Kasım'a kadar geliştiriciler mevcut modellere erişebilecek, ancak bu süreçte yayınlanacak yeni modeller Cursor üzerinden hiç sunulmayacak.
OpenShot 4.0 yayınlandı — yerel AI maskeleme, renk düzeltme ve ekran kaydı geldi
Açık kaynak video düzenleyici OpenShot, kuruluşundan bu yana en iddialı güncellemesi olarak tanıtılan 4.0 sürümünü yayınladı. Yeni Kayıt Görünümü ekran, webcam, mikrofon ve sistem sesini doğrudan projeye kaydedebiliyor; yeni Renk Görünümü renk çarkları, eğriler, LUT'lar ve canlı video skopları sunuyor. Bulut veya abonelik gerektirmeyen, kullanıcının kendi bilgisayarında çalışan yerel AI destekli maskeler ve 10 yeni efekt eklendi.
Google, Manifest V2 uzantılarını Chrome Web Store'dan kalıcı olarak kaldırdı — uBlock Origin dahil
Google, 31 Ağustos 2026'da Chrome Web Store'da kalan tüm Manifest V2 uzantılarını kaldırarak çok yıllık Manifest V3 geçişini tamamladı — bunlar arasında uBlock Origin'in tam sürümü de var. MV2 uzantıları zaten Temmuz 2025'te stabil Chrome'da çalışmayı durdurmuştu; artık mağazadan yüklenemiyor, güncellenemiyor veya yeniden yüklenemiyor. Google değişikliği güvenlik ve performans gerekçesiyle savunuyor; topluluk alternatif tarayıcıları öneriyor.