🔍
SON DAKİKA Apple Arcade Ekim Ayında 'Pusheen's Place' ve 4 Yeni Oyunla Geliyor Ocarina of Time Remake, Switch 2 İçin 5 Kasım'da Geliyor Ocarina of Time Remake İlk Oynanış Görüntüleriyle Karşımızda: Yeni Motor, Şarkı Söyleyerek Oynama ve Daha Fazlası Switch 2'ye Zelda Temalı Konsol ve Pro Controller Geliyor! Zelda 40. Yıl Özel Direct'i: Ocarina of Time Remake ve Daha Fazlası Steam Deck vs Switch 2: Hangisi Daha Güçlü? İşte Karşılaştırma SON DAKİKA Apple Arcade Ekim Ayında 'Pusheen's Place' ve 4 Yeni Oyunla Geliyor Ocarina of Time Remake, Switch 2 İçin 5 Kasım'da Geliyor Ocarina of Time Remake İlk Oynanış Görüntüleriyle Karşımızda: Yeni Motor, Şarkı Söyleyerek Oynama ve Daha Fazlası Switch 2'ye Zelda Temalı Konsol ve Pro Controller Geliyor! Zelda 40. Yıl Özel Direct'i: Ocarina of Time Remake ve Daha Fazlası Steam Deck vs Switch 2: Hangisi Daha Güçlü? İşte Karşılaştırma
🖥️ Donanım

Qwen 3.8 27B RTX 5090'da Neden Yavaş? Tek Başına VRAM Yetmiyor

Alibaba'nın yeni açık kaynak modeli Qwen 3.8 27B, büyük umutlarla RTX 5090'da test edildi ancak yazılım ve inference motoru darboğazları yüzünden performans hayal kırıklığı yarattı.

Qwen 3.8 27B RTX 5090'da Neden Yavaş? Tek Başına VRAM Yetmiyor

Yeni Nesil Açık Kaynak Model: Qwen 3.8 27B

Alibaba'nın Qwen 3.8 27B modeli, birkaç hafta önce piyasaya sürüldüğünde yerel yapay zeka meraklıları arasında büyük bir heyecan dalgası yarattı. Boyutuna göre etkileyici zeka kıyaslama sonuçları, 4-bit quantize edilmiş ağırlıkların yalnızca 17 GB yer kaplaması ve üstüne üstlük çoklu ortam (multimodal) yetenekleri sunması, RTX 5090, RTX 4090 ve RTX 3090 sahiplerinin yanı sıra Radeon RX 7900 XTX, Radeon AI Pro R9700 veya Arc Pro B70 kullananların da dikkatini çekti.

Herkesin aklında aynı soru vardı: Tek bir ekran kartıyla, 4-bit quantize bir modelden sınır seviyesinde zeka elde edebilecek miyiz? Herkes Claude veya ChatGPT aboneliğini iptal edip kendi donanımında mı çalıştıracak? Ancak her açık kaynak model hype döngüsünde olduğu gibi, işler modelin boyutuna bakıp VRAM havuzunuzla kıyaslamaktan çok daha karmaşık.

VRAM Yeterli Ama Darboğazlar Başka Yerde

Modeli barındırmak için kullandığınız ekran kartında, her şey çalışırken context için yeterli boş VRAM kalıyor mu? Ana sisteminiz ve LLM inference motorunuz, boş context penceresiyle hız testi yapmanın ötesinde, kabul edilebilir bir ilk token süresi (time-to-first-token) ve yüksek iş hacmi (throughput) sağlıyor mu? Modelle sohbet edip ne olacağını görmek bir şey; onu gerçekten işe koşmak bambaşka bir şey, özellikle de sabırsız ajanlar insan algısının sınırlarını ortadan kaldırdığında.

Qwen 3.8 27B'nin gerçekte hangi donanım ve yazılım yığınıyla iyi performans gösterdiğini görmek için testleri, ayrık GPU'lara sahip bir masaüstü bilgisayardan DGX Spark, Mac Studio ve Ryzen AI Halo gibi birleşik bellek mimarilerine sahip sistemlere kadar geniş bir yelpazede gerçekleştirdik. Test düzeneğimizde ayrıca, mümkün olan yerlerde modelin çok tokenlı tahmin (MTP) özelliğini açıp kapatarak da denemeler yaptık. Ancak bazı platformlarda VRAM kısıtı nedeniyle MTP'yi destekleyemedik; bu durumu analizlerimizde ve grafiklerde belirttik.

RTX 5090 ile Hayal Kırıklığı: llama.cpp Uyumsuz

Testlere, 32 GB GDDR7 belleği ve 1,8 TB/s bellek bant genişliği ile bu yoğun modelde en iyi yerel inference performansını almak için mutlak bir şart gibi görünen RTX 5090 ile başladık. (Mixture-of-experts modelleri, DGX Spark ve AMD'nin Strix Halo gibi düşük donanımlarda daha dostane olma eğiliminde çünkü sınırlı sayıda aktif parametre, inference sırasında daha az veri hareketi anlamına geliyor.)

Standart yerel AI kıyaslama yaklaşımımızı uyguladık: GitHub'dan en son llama.cpp sürümünü alıp derledik, Hugging Face'ten Unsloth quantizasyonunu indirdik ve çalıştırdık. Ancak testlerimiz hızla bir engelle karşılaştı. llama.cpp, bu modeli RTX 5090'da tam 262K context uzunluğuyla çalıştırmayı kabul etmesine rağmen, bu kartta uzun context'lerde işlem hızları berbattı. Tek bir 5090 ile ilk token süresi yaklaşık 30 dakikaya uzadı; bu, burada bir şeylerin bozuk olduğunu gösteriyor. Ve saniyedeki token sayısı, dünyanın en hızlı ekran kartlarından birine sahipken bekleyeceğinizin çok çok altına düştü.

Her açıdan bakıldığında, llama.cpp şu an bu donanım için doğru model çalıştırıcı değil. Bu durum, yalnızca VRAM kapasitesinin yetmediğini, yazılım ve inference motoru optimizasyonunun da en az donanım kadar kritik olduğunu gösteriyor.

💬 Yorumlar (0)

Yorumlar, yazan kullanıcıların kendi görüşleridir. Hukuka aykırı içerik bildirimi: admin@alttabzone.com

Henüz yorum yok — ilk yorumu sen yaz!