Local LLM hız karşılaştırması: M1 Max vs M2 Max vs DGX Spark — Apple decode’da lider, NVIDIA prompt processing ve MoE’de ezici üstün, seçim use case’e bağlı

Local LLM cephesinde 2026’nın en yaygın üç consumer/prosumer platform karşılaştırması: Apple M1 Max, M2 Max ve NVIDIA DGX Spark. Üçü de “masa altına koyabileceğin AI kutusu” sınıfında. Ama karşılaştıklarında beklenmedik bir tablo çıkıyor.

Ana rakamlar:

M1 Max M2 Max DGX Spark
Maks. unified memory 64 GB 96 GB 128 GB
Memory bandwidth 400 GB/s 400 GB/s 273 GB/s
Dense model decode 🟢 Hızlı 🟢 Biraz daha hızlı 🟡 Yavaş
Prompt / prefill 🟡 🟢 🟢🟢 Çok hızlı
CUDA / vLLM / TensorRT

Dikkat çeken detay: DGX Spark’ın memory bandwidth’i Apple Max serisinden düşük. Apple 400 GB/s, DGX Spark 273 GB/s. Bu, single-user interactive LLM inference için Apple’ın büyük avantajı anlamına geliyor. Çünkü decode (token üretimi) memory-bandwidth bound — hangi hızda RAM okuyabildiğinize bağlı.

Ama başka bir cephede tablo tersine dönüyor. Prompt processing (prefill), yani “model verdiğim uzun bağlamı okusun” safhası, compute-bound. Ve burada DGX Spark’ın Blackwell mimarisi + CUDA olgunluğu ezici avantaj sağlıyor.

Gerçek llama.cpp rakamları: Llama 7B

Aynı benchmark üzerinde M1 Max vs M2 Max karşılaştırması:

Llama 7B M1 Max M2 Max
Q4 decode 61.2 tok/s ~65.9 tok/s
Q8 decode 40.2 tok/s 41.8 tok/s
Q4 prompt processing 530 tok/s 671 tok/s
Q8 prompt processing 537 tok/s 678 tok/s

Yani M2 Max, M1 Max’a göre:

  • Token generation: sadece %4-8 daha hızlı
  • Prompt processing: ~%26 daha hızlı

Neden decode’da fark az? Çünkü ikisi de aynı 400 GB/s memory bandwidth. Decode memory-bound. Bandwidth aynı, hız aynı.

DGX Spark’ın llama.cpp benchmark’ı Qwen 2.5-Coder 7B Q8 için ~29.4 tok/s decode ama ~2,250 tok/s prompt processing. Bu tam aynı 7B mimarisi değil, ama örüntü çok net: Apple Max güçlü single-stream decode, DGX Spark güçlü prefill.

Model boyutuna göre pratik tahminler

GGUF dense modeller için, memory’ye sığdığı senaryolarda beklenen tokens/second:

Model / quant M1 Max M2 Max DGX Spark
7-8B Q4 ~55-65 t/s ~60-70 t/s ~40-50 t/s
14B Q4 ~30-35 ~32-37 ~22-27
30-32B Q4 ~15-18 ~16-19 ~11-14
70B Q4 ~7-9* ~8-10 ~6-8
>96 GB modeller

Not: 70B Q4 için M1 Max satırı marjinal — 64 GB memory, 70B Q4 modeli tam sığdıramayabilir, KV cache sıkışabilir. M2 Max’in 96 GB’ı bu senaryo için daha rahat.

Yani dense modellerde: Apple Max > DGX Spark, decode hızı için.

MoE sürprizi: DGX Spark tabloyu değiştiriyor

Mixture-of-Experts modellerde denklem çok farklı. MoE her token için sadece küçük bir alt kümeyi aktif ediyor. Bu, compute avantajı olan platformların lehine. Ve DGX Spark’ın Blackwell mimarisi + CUDA kernel’ları burada güçlü.

DGX Spark benchmark’ları:

  • Qwen3-Coder 30B-A3B Q8: ~61 tok/s zero context, ~48 tok/s 8K context
  • Prompt processing: ~2,987 tok/s
  • GPT-OSS-120B MXFP4 (117B parametre): ~59 tok/s, tüm ~59 GB model memory’de

Aynı MoE modelleri M1/M2 Max’ta Metal Performance Shaders üzerinde çalışıyor ama CUDA/TensorRT-LLM seviyesinde optimize değil. Yaklaşık %30-40 daha yavaş.

Yani MoE için: DGX Spark, Apple Max’a rakip veya üstün.

Prompt processing: DGX Spark’ın ezici avantajı

Uzun bağlamlı işlerde — RAG pipeline’lar, uzun döküman analizi, büyük kod tabanları ile agentic coding — prompt processing kritik. 128K token bir bağlam okumak, decode’dan daha çok zaman alabilir.

Örnek karşılaştırma, 7B model:

  • M1 Max: 530 tok/s prefill
  • M2 Max: 671 tok/s prefill
  • DGX Spark: ~2,250 tok/s prefill (yaklaşık 3.3x M2 Max)

Bu, pratik olarak ne demek?

128K token bir promt için:

  • M2 Max: 128,000 / 671 = ~191 saniye (~3.2 dakika)
  • DGX Spark: 128,000 / 2,250 = ~57 saniye (~1 dakika)

Uzun bağlam workflow’larda DGX Spark çok daha iyi kullanıcı deneyimi sunuyor. Kullanıcı 3 dakika beklemek yerine 1 dakika bekliyor.

Ekosistem farkı: CUDA vs Metal

Rakamların ötesinde bir gerçek: CUDA ekosistemi. vLLM, TensorRT-LLM, SGLang, Triton, DeepSpeed — hepsi CUDA-first geliştiriliyor. Apple MLX + llama.cpp iyi ama sınırlı bir alternatif.

Pratik sonuçları:

  • Yeni model release’ler önce CUDA optimizasyonu ile geliyor. Apple support için community port bekleyebilirsiniz.
  • Batch inference, tensor parallelism, kompleks quantization pathleri — hepsi CUDA’da olgun.
  • vLLM, TensorRT-LLM gibi production stack’ler Apple’da native yok.

Yani DGX Spark, sadece hız değil ekosistem/framework destek olarak da avantajlı. Özellikle production workflow’lar için.

Karar rehberi

Farklı use case’lere göre öneriler:

Sadece tek kişi interaktif chat / kod asistanı, dense 7-32B modeller: M2 Max ideal. Decode hızı en iyi. Sessiz, düşük güç, taşınabilir.

Prompt processing yoğun (RAG, uzun bağlam, büyük repo agentic coding): DGX Spark tercih. Prefill 3-4x daha hızlı, kullanıcı deneyimi belirgin iyi.

MoE modeller çalıştırmak istiyorsanız (Kimi K3, DeepSeek V4, Mixtral): DGX Spark. CUDA optimizasyonu MoE’lerde avantaj sağlıyor.

Büyük modeller (70B-120B): DGX Spark. 128 GB unified memory, M2 Max’in 96 GB’ından fazla. GPT-OSS 120B gibi “M2 Max’a sığmayan” modelleri çalıştırabilirsiniz.

Production API server (batch inference, multi-user): DGX Spark, CUDA ekosistem sayesinde tek doğru cevap.

Sadece MacBook alternatifi arayan geliştirici: M2 Max. Diğer tüm Mac özelliklerine de sahip — sadece LLM için ayrı kutu almak istemeyenler için.

Eski M1 Max satın almak mı, yoksa?

İkinci el M1 Max Mac Studio’lar bugün ~$1,200-1,500 civarı. M2 Max ~$2,000-2,500. DGX Spark ~$4,000.

Fiyat/performans:

  • M1 Max: En ucuz. Dense modellerde decode hızı M2 Max’in %90-95’i. Prompt processing zayıf ama tek kullanıcı chat için sorun değil. Bütçe için ideal.
  • M2 Max: Orta fiyat. Dense modellerde decode hızı en iyi. 96 GB büyük modelleri kaldırabilir.
  • DGX Spark: En pahalı ama farklı bir kategori — MoE, uzun bağlam, CUDA ekosistem, batch inference — hepsi için tek doğru cevap.

Sonuç: bir cevap değil, kategori bazlı öneri

M1 Max ≈ M2 Max > DGX Spark — dense model interactive token generation için.

DGX Spark >>> M1/M2 Max — prompt processing, batch inference, CUDA workload için.

DGX Spark >>> M1/M2 Max — 128 GB model kapasitesi için (M1 64 GB, M2 96 GB, DGX 128 GB).

Yani “hangisi daha hızlı?” sorusu tek başına yanıltıcı. Doğru soru: ne yapmak istiyorsunuz?

Yalnız kullanıcı, dense model chat: M2 Max. Uzun bağlam agentic workflow, MoE, veya production API: DGX Spark. Bütçe kısıtı ile başlayan hobici: M1 Max ikinci el.

Genel eğilim: 2026-2027 arasında MoE modeller giderek daha yaygın hale gelecek (DeepSeek, Kimi, Qwen, Ling — hepsi MoE). Bu, DGX Spark’ın konumunu güçlendirecek. Apple da MLX ekosistemini geliştirmeye devam ediyor — 2027’deki M4/M5 Max modelleri tabloyu tekrar sarsabilir. Ama şu anki kesitte, kategori bazlı seçim üstteki gibi.

Comments

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir