Yeni Nesil Açık Kaynak Model: Qwen 3.8 27B
Alibaba'nın Qwen 3.8 27B modeli, birkaç hafta önce piyasaya sürüldüğünde yerel yapay zeka meraklıları arasında büyük bir heyecan dalgası yarattı. Boyutuna göre etkileyici zeka kıyaslama sonuçları, 4-bit quantize edilmiş ağırlıkların yalnızca 17 GB yer kaplaması ve üstüne üstlük çoklu ortam (multimodal) yetenekleri sunması, RTX 5090, RTX 4090 ve RTX 3090 sahiplerinin yanı sıra Radeon RX 7900 XTX, Radeon AI Pro R9700 veya Arc Pro B70 kullananların da dikkatini çekti.
Herkesin aklında aynı soru vardı: Tek bir ekran kartıyla, 4-bit quantize bir modelden sınır seviyesinde zeka elde edebilecek miyiz? Herkes Claude veya ChatGPT aboneliğini iptal edip kendi donanımında mı çalıştıracak? Ancak her açık kaynak model hype döngüsünde olduğu gibi, işler modelin boyutuna bakıp VRAM havuzunuzla kıyaslamaktan çok daha karmaşık.
VRAM Yeterli Ama Darboğazlar Başka Yerde
Modeli barındırmak için kullandığınız ekran kartında, her şey çalışırken context için yeterli boş VRAM kalıyor mu? Ana sisteminiz ve LLM inference motorunuz, boş context penceresiyle hız testi yapmanın ötesinde, kabul edilebilir bir ilk token süresi (time-to-first-token) ve yüksek iş hacmi (throughput) sağlıyor mu? Modelle sohbet edip ne olacağını görmek bir şey; onu gerçekten işe koşmak bambaşka bir şey, özellikle de sabırsız ajanlar insan algısının sınırlarını ortadan kaldırdığında.
Qwen 3.8 27B'nin gerçekte hangi donanım ve yazılım yığınıyla iyi performans gösterdiğini görmek için testleri, ayrık GPU'lara sahip bir masaüstü bilgisayardan DGX Spark, Mac Studio ve Ryzen AI Halo gibi birleşik bellek mimarilerine sahip sistemlere kadar geniş bir yelpazede gerçekleştirdik. Test düzeneğimizde ayrıca, mümkün olan yerlerde modelin çok tokenlı tahmin (MTP) özelliğini açıp kapatarak da denemeler yaptık. Ancak bazı platformlarda VRAM kısıtı nedeniyle MTP'yi destekleyemedik; bu durumu analizlerimizde ve grafiklerde belirttik.
RTX 5090 ile Hayal Kırıklığı: llama.cpp Uyumsuz
Testlere, 32 GB GDDR7 belleği ve 1,8 TB/s bellek bant genişliği ile bu yoğun modelde en iyi yerel inference performansını almak için mutlak bir şart gibi görünen RTX 5090 ile başladık. (Mixture-of-experts modelleri, DGX Spark ve AMD'nin Strix Halo gibi düşük donanımlarda daha dostane olma eğiliminde çünkü sınırlı sayıda aktif parametre, inference sırasında daha az veri hareketi anlamına geliyor.)
Standart yerel AI kıyaslama yaklaşımımızı uyguladık: GitHub'dan en son llama.cpp sürümünü alıp derledik, Hugging Face'ten Unsloth quantizasyonunu indirdik ve çalıştırdık. Ancak testlerimiz hızla bir engelle karşılaştı. llama.cpp, bu modeli RTX 5090'da tam 262K context uzunluğuyla çalıştırmayı kabul etmesine rağmen, bu kartta uzun context'lerde işlem hızları berbattı. Tek bir 5090 ile ilk token süresi yaklaşık 30 dakikaya uzadı; bu, burada bir şeylerin bozuk olduğunu gösteriyor. Ve saniyedeki token sayısı, dünyanın en hızlı ekran kartlarından birine sahipken bekleyeceğinizin çok çok altına düştü.
Her açıdan bakıldığında, llama.cpp şu an bu donanım için doğru model çalıştırıcı değil. Bu durum, yalnızca VRAM kapasitesinin yetmediğini, yazılım ve inference motoru optimizasyonunun da en az donanım kadar kritik olduğunu gösteriyor.
Henüz yorum yok — ilk yorumu sen yaz!