• Forumu şuan da Ziyaretçi olarak görüntülüyorsunuz. Forum ziyaretçileri tüm konu ve bağlantıları görüntüleyemez ve kaynaklara erişimi yoktur. Eğer üye iseniz buradan üye girişi yapın ya da burayı tıklayarak şimdi üye olun.
  • Ubden® Topluluk Projelerine, Aracılığınızla Destek Vermektedir.

    Topluluk projelerine katkı yapmak ve topluğumuza ulaşan genç girişimcilere destek olmak için Buradaki  bağlantıdan işlem kanallarına ulaşabilirsiniz.

    Desteklerinizle 9.000 kişilik bir ekosistem olduk ve büyümeye devam ediyoruz. Desteğiniz için teşekkürler.

Haber Jetson & Spark Performans Rehberi: Modeller Hangi Metriklerde Nasıl Performans Gösteriyor?

  • Konbuyu başlatan Enhar Ormeci
  • Başlangıç tarihi
E

Enhar Ormeci

Misafir
Misafir
jetson-spark-1920x1080-1.webp

Edge cihazda büyük dil modeli çalıştırmak, artık “çalışır mı?” sorusundan çok “ne kadar akıcı çalışır?” sorusuna evrildi. Bu yazıda, Jetson cihaz ailesinde hangi modellerin çalıştığını, hangi nicemleme ve runtime kombinasyonunun ne kadar hız verdiğini, ve en önemlisi — farklı hızların ekranda nasıl hissettirdiğini ele alacağız.

Hız Nasıl Hissedilir? — 20 / 60 / 200 tok/s​


“TokensPerSec” (saniye başına token) sayısı, tek başına bir anlama gelir mi? Aşağıdaki 3 saniyelik screencast’ler, üç farklı decode hızının ekrandaki hissiyatını gösteriyor. Soldan sağa: yavaş, orta, akıcı.


≈20 tok/s — yavaş, harf harf akar


≈60 tok/s — orta, okunabilir tempo


≈200 tok/s — akıcı, anlık akar


Bazı Terimler​

  • Decode (Çözümleme): Modelin ürettiği her yeni token’ı kullanıcıya aktardığı aşamadır. Prompt işlendiikten sonra başlayan bu fazın hızı genellikle tok/s değeriyle ölçülür.
  • TokensPerSec (tok/s): Modelin saniyede ürettiği token sayısını ifade eder. Değer yükseldikçe model daha akıcı ve hızlı yanıt üretir.
  • Concurrency (Eşzamanlılık): Aynı anda işlenen istek sayısıdır. Örneğin c=1 tek kullanıcıyı, c=5 ise beş eşzamanlı isteği temsil eder. Eşzamanlılık arttıkça toplam throughput yükselirken, kullanıcı başına düşen hız azalabilir.
  • Runtime: Büyük dil modelini çalıştıran çıkarım (inference) motorudur.
  • vLLM: Yüksek throughput sağlayan, PagedAttention mimarisini kullanan çıkarım motorudur. Jetson platformunda en geniş model desteğini sunar ve 48 modelden 45’ini çalıştırabilir.
  • SGLang: Özellikle sunucu tarafında yüksek eşzamanlı istekleri verimli şekilde işlemek için optimize edilmiş bir çıkarım motorudur.
  • Ollama: Jetson üzerinde kolay kurulum ve kullanım sunan popüler bir runtime’dır. Yaklaşık 13 modeli destekler.
  • llama.cpp: CPU ve GPU’yu birlikte kullanabilen hafif bir çıkarım motorudur. Jetson’da özellikle Gemma ve Cosmos ailesi olmak üzere yaklaşık 12 modeli destekler.
  • Quant (Nicemleme): Model ağırlıklarının daha düşük hassasiyette saklanarak bellek kullanımının azaltılması işlemidir.
  • BF16: 16-bit kayan nokta formatıdır. En yüksek doğruluğu sunarken en fazla belleği kullanır.
  • FP8: 8-bit kayan nokta formatıdır. BF16’ya göre yaklaşık iki kat bellek tasarrufu sağlar.
  • NVFP4: NVIDIA’nın 4-bit kayan nokta formatıdır. Büyük MoE modellerinin edge cihazlara sığmasını mümkün kılar.
  • INT4: 4-bit tamsayı nicemleme yöntemidir. En yüksek sıkıştırma oranını sağlar.
  • PRISMAQUANT: Yaklaşık 4.75-bit gibi karışık hassasiyet kullanan nicemleme yaklaşımıdır. Kalite ile performans arasında denge kurmayı amaçlar.
  • Cluster: Modelin çalıştırıldığı sistem yapısını ifade eder. Single tek makineyi, 2 Nodes ve 4 Nodes ise birden fazla makineden oluşan kümeleri belirtir. Jetson tek cihaz olduğu için Single kategorisine girer.
  • VLM (Vision-Language Model): Görüntü ve metni birlikte işleyebilen yapay zekâ modelleridir. Desteklenen 48 modelin 26’sı bu sınıftadır.
  • MoE (Mixture of Experts): Her token için modelin yalnızca gerekli alt ağlarını etkinleştiren mimaridir. Örneğin 35B-A3B, toplam 35 milyar parametre bulunmasına rağmen her token için yaklaşık 3 milyar parametrenin aktif olduğu anlamına gelir. Bu yapı, büyük modellerin daha yüksek hızla çalışmasını sağlayarak özellikle Jetson gibi edge cihazlarda önemli avantaj sunar.

Jetson Cihaz Başına Model Desteği​


Aşağıdaki tablo, NVIDIA Jetson AI Lab tarafından desteklenen üretken yapay zekâ modellerinin farklı Jetson platformları ve iş istasyonu GPU’ları üzerindeki çalışabilirlik durumunu göstermektedir. Tabloda yer alan her model için ilgili donanımda desteklenme durumu belirtilmiştir. işareti modelin ilgili cihaz üzerinde çalıştırılabildiğini, işareti ise desteklenmediğini ifade eder. Bu bilgiler, belirli bir Jetson platformu için uygun modeli seçme, donanım gereksinimlerini değerlendirme ve uygulama geliştirme süreçlerinde hızlı bir başvuru kaynağı sunmayı amaçlamaktadır.

Tabloda sunulan model uyumluluk bilgileri,
Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.
sayfasından derlenmiştir. Jetson AI Lab, Jetson platformlarında büyük dil modelleri (LLM), görsel-dil modelleri (VLM) ve diğer üretken yapay zekâ modellerinin çalıştırılmasına yönelik resmî örnekler, optimizasyonlar ve güncel destek durumlarını sağlamaktadır. Model desteği zaman içerisinde değişebileceğinden, en güncel bilgiler için ilgili sayfanın takip edilmesi önerilir.

Model​
Aile​
VLM​
Nano 8GB​
NX 16GB​
AGX Orin 64GB​
T4000​
T5000​
Gemma 3 270M​
Google Gemma3​
—​
✓​
✓​
✓​
✓​
✓​
Qwen3.5 0.8B​
Alibaba Qwen3.5​
VLM​
✓​
✓​
✓​
✓​
✓​
Gemma 3 1B​
Google Gemma3​
—​
✓​
✓​
✓​
✓​
✓​
Cosmos Reason 2 2B​
NVIDIA Cosmos Reason​
VLM​
✓​
✓​
✓​
✓​
✓​
Llama 3.2 3B​
Meta Llama 3​
—​
✓​
✓​
✓​
✓​
✓​
Ministral 3 3B Instruct​
Mistral AI Ministral 3​
VLM​
✓​
✓​
✓​
✓​
✓​
Ministral 3 3B Reasoning​
Mistral AI Ministral 3​
VLM​
✓​
✓​
✓​
✓​
✓​
Nemotron3 Nano 4B​
NVIDIA Nemotron​
—​
✓​
✓​
✓​
✓​
✓​
Qwen3 4B​
Alibaba Qwen3​
—​
✓​
✓​
✓​
✓​
✓​
Qwen3.5 4B​
Alibaba Qwen3.5​
VLM​
✓​
✓​
✓​
✓​
✓​
Qwen3 VL 4B​
Alibaba Qwen3​
VLM​
✓​
✓​
✓​
✓​
✓​
Gemma 3 4B​
Google Gemma3​
VLM​
✓​
✓​
✓​
✓​
✓​
FunctionGemma​
Google Gemma3​
—​
✓​
✓​
✓​
✓​
✓​
Cosmos Reason 1 7B​
NVIDIA Cosmos Reason​
VLM​
✓​
✓​
✓​
✓​
✓​
Gemma 4 E2B​
Google Gemma4​
VLM​
✓​
✓​
✓​
✓​
✓​
Llama 3.1 8B​
Meta Llama 3​
—​
✓​
✓​
✓​
✓​
✓​
Ministral 3 8B Instruct​
Mistral AI Ministral 3​
VLM​
✓​
✓​
✓​
✓​
✓​
Ministral 3 8B Reasoning​
Mistral AI Ministral 3​
VLM​
—​
✓​
✓​
✓​
✓​
Qwen3 8B​
Alibaba Qwen3​
—​
—​
✓​
✓​
✓​
✓​
Qwen3 VL 8B​
Alibaba Qwen3​
VLM​
—​
✓​
✓​
✓​
✓​
Cosmos Reason 2 8B​
NVIDIA Cosmos Reason​
VLM​
✓​
✓​
✓​
✓​
✓​
Nemotron Nano 9B v2​
NVIDIA Nemotron​
—​
—​
—​
—​
✓​
✓​
Qwen3.5 9B​
Alibaba Qwen3.5​
VLM​
—​
✓​
✓​
✓​
✓​
Gemma 3 12B​
Google Gemma3​
VLM​
✓​
✓​
✓​
✓​
✓​
Nemotron Nano 12B VL​
NVIDIA Nemotron​
VLM​
—​
—​
—​
✓​
✓​
Ministral 3 14B Instruct​
Mistral AI Ministral 3​
VLM​
✓​
✓​
✓​
✓​
✓​
Ministral 3 14B Reasoning​
Mistral AI Ministral 3​
VLM​
—​
—​
—​
✓​
✓​
Gemma 4 12B​
Google Gemma4​
VLM​
—​
—​
✓​
✓​
✓​
Gemma 4 E4B​
Google Gemma4​
VLM​
✓​
✓​
✓​
✓​
✓​
Qwen3.5 27B​
Alibaba Qwen3.5​
—​
—​
—​
✓​
✓​
✓​
Qwen3.6 27B​
Alibaba Qwen3.6​
—​
—​
—​
✓​
✓​
✓​
Gemma 3 27B​
Google Gemma3​
VLM​
✓​
✓​
✓​
✓​
✓​
Llama 3.1 70B​
Meta Llama 3​
—​
✓​
✓​
✓​
✓​
✓​
Nemotron3 Nano 30B-A3B​
NVIDIA Nemotron​
—​
✓​
✓​
✓​
✓​
✓​
Qwen3 30B-A3B (MoE)​
Alibaba Qwen3​
—​
—​
—​
✓​
✓​
✓​
Qwen3.5 35B-A3B (MoE)​
Alibaba Qwen3.5​
—​
—​
—​
✓​
✓​
✓​
Qwen3.6 35B-A3B (MoE)​
Alibaba Qwen3.6​
—​
—​
—​
✓​
✓​
✓​
Gemma 4 26B-A4B​
Google Gemma4​
VLM​
—​
—​
✓​
✓​
✓​
DiffusionGemma 26B-A4B​
Google Gemma4​
—​
—​
—​
✓​
✓​
✓​
Gemma 4 31B​
Google Gemma4​
VLM​
—​
—​
✓​
✓​
✓​
Qwen3 32B​
Alibaba Qwen3​
—​
—​
—​
—​
✓​
✓​
GPT OSS 20B​
OpenAI GPT OSS​
—​
—​
—​
✓​
✓​
✓​
Cosmos3 Edge New​
NVIDIA Cosmos​
VLM​
—​
—​
✓​
✓​
✓​
Cosmos3 Nano New​
NVIDIA Cosmos​
VLM​
—​
—​
—​
✓​
✓​
Nemotron 3 Nano Omni​
NVIDIA Nemotron​
VLM​
—​
—​
✓​
✓​
✓​
MiniMax M2.7​
MiniMax M2.7​
—​
—​
—​
—​
—​
✓​
GPT OSS 120B​
OpenAI GPT OSS​
—​
—​
—​
—​
✓​
✓​

Performans Tabloları — Spark Arena​


Aşağıdaki performans tabloları, farklı büyük dil modellerinin decode aşamasında ölçülen saniyedeki token üretim hızlarını (tok/s) karşılaştırmaktadır. Sonuçlar; model, nicemleme (quant), çıkarım motoru (runtime), küme yapısı (cluster) ve eşzamanlı istek sayısı (concurrency) gibi farklı yapılandırmalar altında elde edilmiştir. Böylece farklı donanım ve yazılım kombinasyonlarının performans üzerindeki etkisi karşılaştırılabilir.

Bu bölümde yer alan veriler,
Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.
sayfasından derlenmiştir. Spark Arena, farklı yapay zekâ modellerinin ve çıkarım motorlarının performansını standart test senaryoları kullanarak karşılaştıran güncel bir benchmark platformudur. Sonuçlar zaman içerisinde değişebileceğinden, en güncel performans değerleri için ilgili leaderboard sayfasının incelenmesi önerilir.

Concurrency = 1 (tek kullanıcı)

tok/s​
Model​
Quant​
Runtime​
Cluster​
188.47​
LFM2.5-350M​
BF16​
vLLM​
Single​
116.03​
Qwen3.6-35B-A3B​
NVFP4​
vLLM​
Single​
109.81​
Qwen3.5-0.8B​
BF16​
vLLM​
Single​
106.16​
Qwen3.6-35B-A3B​
NVFP4​
vLLM​
Single​
106.16​
Qwen3.6-35B-A3B​
NVFP4​
vLLM​
Single​
97.74​
Qwen3.5-0.8B​
BF16​
SGLang​
Single​
50.90​
Qwen3-Coder-Next​
FP8​
SGLang​
2 nodes​
Concurrency = 2
tok/s​
Model​
Quant​
Runtime​
Cluster​
325.44​
LFM2.5-350M​
BF16​
vLLM​
Single​
179.48​
Qwen3.5-0.8B​
BF16​
vLLM​
Single​
178.85​
gemma-3-1b-it​
BF16​
vLLM​
Single​
178.29​
Qwen3.6-35B-A3B​
NVFP4​
vLLM​
Single​
165.88​
Qwen3.6-35B-A3B​
NVFP4​
vLLM​
Single​
154.39​
Qwen3.5-0.8B​
BF16​
SGLang​
Single​
57.52​
Qwen3-Coder-Next​
FP8​
SGLang​
2 nodes​
40.23​
Minimax-M3-v0​
NVFP4​
SGLang​
4 nodes​
37.69​
Minimax-M3-v0​
NVFP4​
SGLang​
4 nodes​
Concurrency = 4 ( Büyük modeller )
tok/s​
Model​
Quant​
Runtime​
Cluster​
46.68​
Gemma-4-26B-A4B​
NVFP4​
vLLM​
Single​
42.03​
Qwen3.5-122B-A10B​
INT4​
vLLM​
Single​
39.58​
Gemma-4-26B-A4B​
NVFP4​
vLLM​
Single​
26.69​
DeepSeek-V4-Flash-180B​
FP8​
vLLM​
Single​
25.89​
DeepSeek-V4-Flash-162B​
FP8​
vLLM​
Single​
Concurrency = 5
tok/s​
Model​
Quant​
Runtime​
Cluster​
428.95​
LFM2.5-350M​
BF16​
vLLM​
Single​
230.47​
Qwen3.5-0.8B​
BF16​
vLLM​
Single​
214.15​
gemma-3-1b-it​
BF16​
vLLM​
Single​
193.49​
Qwen3.6-35B-A3B​
NVFP4​
vLLM​
Single​
191.15​
Qwen3.5-0.8B​
BF16​
SGLang​
Single​
186.64​
Qwen3.6-35B-A3B​
PRISMAQUANT​
vLLM​
Single​
73.81​
Qwen3.6-27B​
FP8​
SGLang​
Single​
63.55​
Minimax-M3-v0​
NVFP4​
SGLang​
4 nodes​
57.99​
Minimax-M3-v0​
NVFP4​
SGLang​
4 nodes​
53.83​
Qwen3-Coder-Next​
FP8​
SGLang​
2 nodes​

Hangi Jetson Cihazı Hangi Modeller İçin Uygun?​


Jetson platformları farklı bellek kapasiteleri ve işlem güçlerine sahip olduğundan, çalıştırabilecekleri model boyutları da değişiklik gösterir. Küçük modeller için giriş seviyesi bir Jetson yeterli olurken, daha büyük LLM ve VLM modelleri için daha yüksek bellek kapasitesine sahip cihazlara ihtiyaç duyulur. Bu nedenle model seçimi yapılırken yalnızca parametre sayısı değil, kullanılacak nicemleme yöntemi (BF16, FP8, NVFP4 vb.) ve hedef uygulamanın gerçek zamanlı performans gereksinimleri de dikkate alınmalıdır.

Senaryo
Önerilen Cihaz
Açıklama
Küçük LLM’ler (270M–4B)​
Orin Nano 8GB​
Temel sohbet botları, eğitim ve hafif çıkarım uygulamaları için uygundur.​
Orta boy modeller (7B–14B)​
Orin NX 16GB​
Daha gelişmiş edge yapay zekâ uygulamaları ve VLM’ler için dengeli bir seçenektir.​
Büyük MoE modelleri (27B–35B)​
AGX Orin 64GB​
Yüksek performanslı edge çıkarım uygulamaları için önerilir.​
En büyük LLM’ler​
RTX T4000 / RTX T5000​
120B sınıfına kadar büyük modeller ve çok kullanıcılı servisler için uygundur.​

Hangi Runtime Ne Zaman Tercih Edilmeli?​


Jetson platformlarında aynı model farklı çıkarım motorları (runtime) kullanılarak çalıştırılabilir. Ancak her runtime farklı kullanım senaryolarına odaklandığından, doğru seçimin yapılması performans ve kullanım kolaylığı açısından önemlidir.

Runtime
Öne Çıktığı Senaryo
Avantajı
vLLM​
En yüksek performans​
Yüksek throughput sağlar ve Jetson’da en geniş model desteğine sahiptir.​
SGLang​
Çok kullanıcılı sunucular​
Yüksek concurrency için optimize edilmiştir.​
Ollama​
Hızlı kurulum​
Kurulumu ve model yönetimi oldukça kolaydır.​
llama.cpp​
Hafif sistemler​
Düşük kaynak tüketimiyle CPU ve GPU üzerinde çalışabilir.​

Sonuç​


Jetson platformları, günümüzde yalnızca küçük yapay zekâ modellerini çalıştıran geliştirme kartları olmaktan çıkmış; büyük dil modelleri (LLM) ve görsel-dil modellerini (VLM) yerel olarak çalıştırabilen güçlü edge yapay zekâ platformlarına dönüşmüştür. Özellikle nicemleme (quantization) teknikleri ve modern çıkarım motorları sayesinde, daha önce yalnızca veri merkezlerinde çalıştırılabilen birçok model artık tek bir Jetson cihazı üzerinde gerçek zamanlı olarak kullanılabilmektedir.

Bu yazıda, Jetson AI Lab tarafından desteklenen modellerin cihazlara göre uyumluluğu, farklı runtime seçenekleri ve Spark Arena benchmark sonuçları birlikte incelenmiştir. Bu bilgiler, belirli bir Jetson platformu için uygun modeli seçerken yalnızca model boyutunu değil, aynı zamanda çıkarım motorunu, nicemleme yöntemini ve hedef performansı da dikkate almanın önemini göstermektedir.

Jetson ekosistemi sürekli gelişmeye devam ettiğinden, desteklenen model sayısı ve performans sonuçları zaman içerisinde değişebilir. Bu nedenle uygulama geliştirme sürecinde Jetson AI Lab ve Spark Arena gibi güncel kaynakların takip edilmesi, en uygun model ve yapılandırmanın seçilmesine yardımcı olacaktır.


Bu bağlantıyı görüntüleyebilmek için kayıt olmalı zaten üyeyseniz üye girişi yapmalısınız.
 
Üst