• Forumu şuan da Ziyaretçi olarak görüntülüyorsunuz. Forum ziyaretçileri tüm konu ve bağlantıları görüntüleyemez ve kaynaklara erişimi yoktur. Eğer üye iseniz buradan üye girişi yapın ya da burayı tıklayarak şimdi üye olun.
  • Ubden® Topluluk Projelerine, Aracılığınızla Destek Vermektedir.

    Topluluk projelerine katkı yapmak ve topluğumuza ulaşan genç girişimcilere destek olmak için Buradaki  bağlantıdan işlem kanallarına ulaşabilirsiniz.

    Desteklerinizle 9.000 kişilik bir ekosistem olduk ve büyümeye devam ediyoruz. Desteğiniz için teşekkürler.

Haber Qwen3.8-Flash-Next: Tek DGX Spark ve Tek RTX PRO 6000 ile Neler Mümkün?

  • Konbuyu başlatan Enhar Ormeci
  • Başlangıç tarihi
E

Enhar Ormeci

Misafir
Misafir
qwen3.8-flash-next.webp

Qwen3.8-Flash-Next, 262K token bağlam penceresine sahip, 176B parametreli bir Mixture-of-Experts modeli. Artificial Analysis Intelligence Index’te 39.8, Agentic Index’te 53.6 puana sahip.* NVIDIA NVFP4 checkpoint’i 132.7 GB. DGX Spark’ta 128 GB, RTX PRO 6000’de ise 96 GB bellek var; yani kâğıt üzerinde model ikisine de sığmıyor.

Ölçümlerimizde ise ikisinde de çalışıyor: tek DGX Spark’ta 28.5 tok/s, tek RTX PRO 6000’de 155.8 tok/s. Bu yazıda bunun nasıl mümkün olduğunu ve her cihazın neler sunduğunu anlatıyoruz.

Püf noktası: modelin hesap yapmadığı, yalnızca baktığı bir tablo​


Bir dil modeli her token’ı üretirken tüm katmanlarından geçer ve ağırlık matrisleriyle çarpım yapar. Bu ağırlıklar ve konuşmayı hatırlayan KV cache her adımda okunur. Bu yüzden hızlı GPU belleğinde durmaları gerekir; aksi halde her şey yavaşlar.

Qwen3.8-Flash-Next ise farklı türde bir bileşen daha içeriyor: öğrenilmiş kelime öbeklerinden oluşan, 51B parametrelik bir arama tablosu (Engram tarzı tablo). Model bu tabloyla hesap yapmaz; tablodan bilgi arar. Her token için yalnızca son birkaç kelimeyle eşleşen birkaç satırı okur: 51 GB’lık tablonun yaklaşık 2.5 KB’ı. Fikri ortaya koyan DeepSeek buna conditional memory (koşullu bellek) diyor: bir satır yalnızca giriş onu gerektirdiğinde okunur.

Bunu raftaki büyük bir sözlük gibi düşünebilirsiniz. Kitabın tamamını yanınızda taşımanız gerekmez; yalnızca ihtiyacınız olan sayfayı açarsınız.

Dolayısıyla tablonun GPU belleğinde durması gerekmez. GPU modelin hesaplamada kullandığı kısmı tutarken tablo daha yavaş ama daha büyük bir yerde durabilir:

  • DGX Spark: CPU ve GPU aynı 128 GB’ı paylaştığı için tablo yerel NVMe diske taşınır.
  • RTX PRO 6000: tablo iş istasyonunun sistem RAM’ine taşınır.

Tablonun değerleri değişmediği için modelin yanıtları da aynı kalır.

Tek DGX Spark üzerinde​


Eşzamanlı istek başına hız ve ilk token süreleri:

  • 1 eşzamanlı istek: 28.5 tok/s, ilk token 302 ms
  • 2 eşzamanlı istek: 23.6 tok/s, ilk token 393 ms
  • 4 eşzamanlı istek: 17.1 tok/s, ilk token 566 ms
  • 8 eşzamanlı istek: 11.8 tok/s, ilk token 763 ms

Masaüstü bir cihaz, bu sınıftaki bir modeli rahat okunabilir bir hızla çalıştırıyor. İki eşzamanlı isteğe kadar hız 20 tok/s’nin üzerinde kalıyor ve test edilen her seviyede ilk token bir saniyenin altında geliyor.
Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.
, bu hızı ve kullanıcıların konuşmaları için kalan KV cache belleğini esas alarak bunun 8 sohbet kullanıcısına veya 3 agentic kullanıcıya yeteceğini tahmin ediyor: kişisel asistan, küçük bir ekip veya geliştirme çalışmaları için uygun.

Tek RTX PRO 6000 üzerinde​


Eşzamanlı istek başına hız ve ilk token süreleri:

  • 1 eşzamanlı istek: 155.8 tok/s, ilk token 139 ms
  • 4 eşzamanlı istek: 90.8 tok/s, ilk token 221 ms
  • 8 eşzamanlı istek: 63.7 tok/s, ilk token 252 ms
  • 16 eşzamanlı istek: 43.2 tok/s, ilk token 257 ms

İş istasyonu kartı aynı modeli beş kattan daha hızlı çalıştırıyor. 16 eşzamanlı istekte bile her istek 43.2 tok/s hız alıyor ve ilk token yaklaşık çeyrek saniyede geliyor. Bunun yaklaşık 20 sohbet veya 8 agentic kullanıcıya yeteceğini tahmin ediyoruz (
Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.
).

Bilmeniz gerekenler​

  • Kullanıcı sayıları, yaklaşık 128 token’lık kısa prompt’larla yapılan ölçümlere dayanan tahminlerdir.
  • RTX PRO 6000 iş istasyonunda tablo için en az 64 GB boş sistem RAM’i gerekir.

Daha fazlası​

  • White paper:
    Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.
    , mekanizmayı, DGX Spark, RTX PRO 6000 ve DGX B300 arasındaki bellek farklarını ve tüm ölçüm sonuçlarını anlatır.
  • Ölçümler: her çalıştırma, eşzamanlılık taramasının tamamıyla birlikte
    Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.
    ‘nde. Hedefleri değiştirerek kapasite tahminlerinin nasıl değiştiğini görebilirsiniz.

Donanımınızın hangi modelleri çalıştırabileceğini ya da modelleriniz için hangi donanımın gerektiğini öğrenmek ister misiniz? OpenZeka ekibiyle iletişime geçin; boyutlandırmayı birlikte yapalım.

*Intelligence Index v4.3 ve Agentic Index,
Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.
tarafından yayımlanmıştır; veriler 28 Eylül 2026’da alınmış ve kaynak gösterilerek kullanılmıştır. Hız değerleri, CordatusAI LLM Benchmark Tool ile yapılan OpenZeka ölçümleridir (yaklaşık 128 giriş ve 128 çıkış token’ı, ortalama değerler).

TAVSİYE EDİLEN ÜRÜNLER​

Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.

❮
Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.

Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.

Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.

Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.

❯


Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.
 
Üst