AirLLM: 70 milyar parametreli modeli 4GB'lık tüketici GPU'sunda çalıştırma tekniği
Açık kaynak proje AirLLM, katman-akış (layer-streaming) tekniğiyle büyük dil modellerini GPU belleğine tamamen yüklemeden, aynı anda yalnızca tek bir katmanı tutarak çalıştırmayı mümkün kılıyor. Proje sahipleri, Llama 70B'yi 4GB'lık, 405B parametreli Llama 3.1'i 8GB'lık tüketici GPU'larında çalıştırdıklarını iddia ediyor. Proje Hacker News'te 211 puanla öne çıktı.
Açık kaynak dünyasından, büyük dil modellerinin donanım gereksinimlerini önemli ölçüde azaltan bir teknik dikkat çekti.
Teknik nasıl çalışıyor
AirLLM adlı proje, “katman-akış” (layer-streaming) tekniğiyle büyük dil modellerini GPU belleğine tamamen yüklemeden çalıştırmayı mümkün kılıyor. Yöntem, modelin tamamını değil, aynı anda yalnızca tek bir katmanını bellekte tutuyor — bu sayede bellek ihtiyacı, modelin toplam boyutuna değil, tek bir katmanın boyutuna bağlı hale geliyor.
İddia edilen sonuçlar
Proje sahipleri şu sonuçları paylaştı:
- Llama 70B — 4GB’lık tüketici GPU’sunda
- 405B parametreli Llama 3.1 — 8GB’lık GPU’da
- 671B parametreli DeepSeek-V3 — yaklaşık 12GB’lık GPU’da
Opsiyonel 4/8-bit kuantizasyon, buna ek olarak 3 kata kadar hız kazandırabiliyor.
Topluluk ilgisi
Proje, Hacker News’te 211 puanla öne çıkarak geliştirici topluluğunun dikkatini çekti.
Neden önemli
Bu teknik, büyük dil modellerinin çalıştırılması için gereken donanım maliyetini ciddi biçimde düşürerek, daha önce yalnızca kurumsal/bulut ölçekli donanımla mümkün olan model boyutlarının tüketici düzeyindeki donanımda da erişilebilir hale gelmesini sağlıyor — bu da yerel/gizlilik-öncelikli AI dağıtımlarının önünü açabilir.
Bulut tabanlı API'lere dayalı çalışan ekipler için doğrudan aksiyon gerektirmiyor. Ancak maliyet veya gizlilik nedeniyle yerel model kullanımı değerlendiren kurumlar için, bu tür bellek-verimli çalıştırma teknikleri değerli bir referans sunuyor — özellikle hassas veri işleyen modüllerde bulut bağımlılığını azaltma potansiyeli taşıyor.
- GitHub — lyogavin/airllm · 2026-08-03
Bu haber ozgun ozet olarak hazirlanmistir; telif hakki ilgili kaynaklara aittir. Tam metin icin kaynak baglantilarini ziyaret edin.
Ilgili Haberler
Anthropic araştırmacısından kendi kendini geliştiren yapay zekâya bir bakış
Anthropic'in fellows programındaki bir araştırmacı, yapay zekâ sistemlerinin literatür tarayıp yöntem önererek ve modeli kısa iterasyonlarla eğiterek hizalama hatalarını azaltabildiğini gösteren yeni bir makale yayınladı. Çalışmada, en iyi otomatik yöntem ortalama altı saat içinde deneyimli insan araştırmacıların önerdiği yöntemleri geride bırakmış; maliyet karşılaştırmasında saatte yaklaşık 4 dolarlık otomatik araştırmaya karşı insan araştırmacı için saatte yaklaşık 150 dolar rakamı veriliyor.
Sony, EMI ve Warner Chappell, Anthropic'i şarkı sözü korsanlığıyla suçlayan yeni dava açtı
Büyük müzik yayıncıları Sony, EMI ve Warner Chappell, Anthropic'in kitap yazarlarıyla 1,5 milyar dolarlık telif uzlaşmasının ardından şirketi bu kez torrent yoluyla binlerce şarkı sözü ve nota içeren eseri izinsiz indirmekle suçlayan yeni bir dava açtı. Dilekçe, kurucu ortağın toplu indirme yaptığını gösteren iç yazışmaları kanıt olarak sunuyor. Anthropic ise iddiaları reddedip adil-kullanım savunmasını sürdüreceğini açıkladı.
Anthropic'in yeni Fable 5.1 modeli daha ucuz ve daha az kısıtlayıcı geliyor
Anthropic, en gelişmiş model ailesinin yeni sürümlerini — Fable 5.1 ve Mythos 5.1'i — yayınladı. Yeni sürüm performans artışının yanında token maliyetini düşürüyor ve güvenlik filtrelerinin yanlış-pozitif engellemelerini azaltıyor. Kurumsal müşteriler için daha önce sunulmayan 'Sıfır Veri Saklama' özelliği artık Fable ailesine de geliyor; Mythos 5.1 ise yalnızca siber güvenlik veya yaşam bilimleri araştırması yapan kayıtlı ortaklara açılıyor.