Local LLM cephesinde 2026’nın en yaygın üç consumer/prosumer platform karşılaştırması: Apple M1 Max, M2 Max ve NVIDIA DGX Spark. Üçü de “masa altına koyabileceğin AI kutusu” sınıfında. Ama karşılaştıklarında beklenmedik bir tablo çıkıyor.
Ana rakamlar:
| M1 Max | M2 Max | DGX Spark | |
|---|---|---|---|
| Maks. unified memory | 64 GB | 96 GB | 128 GB |
| Memory bandwidth | 400 GB/s | 400 GB/s | 273 GB/s |
| Dense model decode | 🟢 Hızlı | 🟢 Biraz daha hızlı | 🟡 Yavaş |
| Prompt / prefill | 🟡 | 🟢 | 🟢🟢 Çok hızlı |
| CUDA / vLLM / TensorRT | ❌ | ❌ | ✅ |
Dikkat çeken detay: DGX Spark’ın memory bandwidth’i Apple Max serisinden düşük. Apple 400 GB/s, DGX Spark 273 GB/s. Bu, single-user interactive LLM inference için Apple’ın büyük avantajı anlamına geliyor. Çünkü decode (token üretimi) memory-bandwidth bound — hangi hızda RAM okuyabildiğinize bağlı.
Ama başka bir cephede tablo tersine dönüyor. Prompt processing (prefill), yani “model verdiğim uzun bağlamı okusun” safhası, compute-bound. Ve burada DGX Spark’ın Blackwell mimarisi + CUDA olgunluğu ezici avantaj sağlıyor.
Gerçek llama.cpp rakamları: Llama 7B
Aynı benchmark üzerinde M1 Max vs M2 Max karşılaştırması:
| Llama 7B | M1 Max | M2 Max |
|---|---|---|
| Q4 decode | 61.2 tok/s | ~65.9 tok/s |
| Q8 decode | 40.2 tok/s | 41.8 tok/s |
| Q4 prompt processing | 530 tok/s | 671 tok/s |
| Q8 prompt processing | 537 tok/s | 678 tok/s |
Yani M2 Max, M1 Max’a göre:
- Token generation: sadece %4-8 daha hızlı
- Prompt processing: ~%26 daha hızlı
Neden decode’da fark az? Çünkü ikisi de aynı 400 GB/s memory bandwidth. Decode memory-bound. Bandwidth aynı, hız aynı.
DGX Spark’ın llama.cpp benchmark’ı Qwen 2.5-Coder 7B Q8 için ~29.4 tok/s decode ama ~2,250 tok/s prompt processing. Bu tam aynı 7B mimarisi değil, ama örüntü çok net: Apple Max güçlü single-stream decode, DGX Spark güçlü prefill.
Model boyutuna göre pratik tahminler
GGUF dense modeller için, memory’ye sığdığı senaryolarda beklenen tokens/second:
| Model / quant | M1 Max | M2 Max | DGX Spark |
|---|---|---|---|
| 7-8B Q4 | ~55-65 t/s | ~60-70 t/s | ~40-50 t/s |
| 14B Q4 | ~30-35 | ~32-37 | ~22-27 |
| 30-32B Q4 | ~15-18 | ~16-19 | ~11-14 |
| 70B Q4 | ~7-9* | ~8-10 | ~6-8 |
| >96 GB modeller | ❌ | ❌ | ✅ |
Not: 70B Q4 için M1 Max satırı marjinal — 64 GB memory, 70B Q4 modeli tam sığdıramayabilir, KV cache sıkışabilir. M2 Max’in 96 GB’ı bu senaryo için daha rahat.
Yani dense modellerde: Apple Max > DGX Spark, decode hızı için.
MoE sürprizi: DGX Spark tabloyu değiştiriyor
Mixture-of-Experts modellerde denklem çok farklı. MoE her token için sadece küçük bir alt kümeyi aktif ediyor. Bu, compute avantajı olan platformların lehine. Ve DGX Spark’ın Blackwell mimarisi + CUDA kernel’ları burada güçlü.
DGX Spark benchmark’ları:
- Qwen3-Coder 30B-A3B Q8: ~61 tok/s zero context, ~48 tok/s 8K context
- Prompt processing: ~2,987 tok/s
- GPT-OSS-120B MXFP4 (117B parametre): ~59 tok/s, tüm ~59 GB model memory’de
Aynı MoE modelleri M1/M2 Max’ta Metal Performance Shaders üzerinde çalışıyor ama CUDA/TensorRT-LLM seviyesinde optimize değil. Yaklaşık %30-40 daha yavaş.
Yani MoE için: DGX Spark, Apple Max’a rakip veya üstün.
Prompt processing: DGX Spark’ın ezici avantajı
Uzun bağlamlı işlerde — RAG pipeline’lar, uzun döküman analizi, büyük kod tabanları ile agentic coding — prompt processing kritik. 128K token bir bağlam okumak, decode’dan daha çok zaman alabilir.
Örnek karşılaştırma, 7B model:
- M1 Max: 530 tok/s prefill
- M2 Max: 671 tok/s prefill
- DGX Spark: ~2,250 tok/s prefill (yaklaşık 3.3x M2 Max)
Bu, pratik olarak ne demek?
128K token bir promt için:
- M2 Max: 128,000 / 671 = ~191 saniye (~3.2 dakika)
- DGX Spark: 128,000 / 2,250 = ~57 saniye (~1 dakika)
Uzun bağlam workflow’larda DGX Spark çok daha iyi kullanıcı deneyimi sunuyor. Kullanıcı 3 dakika beklemek yerine 1 dakika bekliyor.
Ekosistem farkı: CUDA vs Metal
Rakamların ötesinde bir gerçek: CUDA ekosistemi. vLLM, TensorRT-LLM, SGLang, Triton, DeepSpeed — hepsi CUDA-first geliştiriliyor. Apple MLX + llama.cpp iyi ama sınırlı bir alternatif.
Pratik sonuçları:
- Yeni model release’ler önce CUDA optimizasyonu ile geliyor. Apple support için community port bekleyebilirsiniz.
- Batch inference, tensor parallelism, kompleks quantization pathleri — hepsi CUDA’da olgun.
- vLLM, TensorRT-LLM gibi production stack’ler Apple’da native yok.
Yani DGX Spark, sadece hız değil ekosistem/framework destek olarak da avantajlı. Özellikle production workflow’lar için.
Karar rehberi
Farklı use case’lere göre öneriler:
Sadece tek kişi interaktif chat / kod asistanı, dense 7-32B modeller: M2 Max ideal. Decode hızı en iyi. Sessiz, düşük güç, taşınabilir.
Prompt processing yoğun (RAG, uzun bağlam, büyük repo agentic coding): DGX Spark tercih. Prefill 3-4x daha hızlı, kullanıcı deneyimi belirgin iyi.
MoE modeller çalıştırmak istiyorsanız (Kimi K3, DeepSeek V4, Mixtral): DGX Spark. CUDA optimizasyonu MoE’lerde avantaj sağlıyor.
Büyük modeller (70B-120B): DGX Spark. 128 GB unified memory, M2 Max’in 96 GB’ından fazla. GPT-OSS 120B gibi “M2 Max’a sığmayan” modelleri çalıştırabilirsiniz.
Production API server (batch inference, multi-user): DGX Spark, CUDA ekosistem sayesinde tek doğru cevap.
Sadece MacBook alternatifi arayan geliştirici: M2 Max. Diğer tüm Mac özelliklerine de sahip — sadece LLM için ayrı kutu almak istemeyenler için.
Eski M1 Max satın almak mı, yoksa?
İkinci el M1 Max Mac Studio’lar bugün ~$1,200-1,500 civarı. M2 Max ~$2,000-2,500. DGX Spark ~$4,000.
Fiyat/performans:
- M1 Max: En ucuz. Dense modellerde decode hızı M2 Max’in %90-95’i. Prompt processing zayıf ama tek kullanıcı chat için sorun değil. Bütçe için ideal.
- M2 Max: Orta fiyat. Dense modellerde decode hızı en iyi. 96 GB büyük modelleri kaldırabilir.
- DGX Spark: En pahalı ama farklı bir kategori — MoE, uzun bağlam, CUDA ekosistem, batch inference — hepsi için tek doğru cevap.
Sonuç: bir cevap değil, kategori bazlı öneri
M1 Max ≈ M2 Max > DGX Spark — dense model interactive token generation için.
DGX Spark >>> M1/M2 Max — prompt processing, batch inference, CUDA workload için.
DGX Spark >>> M1/M2 Max — 128 GB model kapasitesi için (M1 64 GB, M2 96 GB, DGX 128 GB).
Yani “hangisi daha hızlı?” sorusu tek başına yanıltıcı. Doğru soru: ne yapmak istiyorsunuz?
Yalnız kullanıcı, dense model chat: M2 Max. Uzun bağlam agentic workflow, MoE, veya production API: DGX Spark. Bütçe kısıtı ile başlayan hobici: M1 Max ikinci el.
Genel eğilim: 2026-2027 arasında MoE modeller giderek daha yaygın hale gelecek (DeepSeek, Kimi, Qwen, Ling — hepsi MoE). Bu, DGX Spark’ın konumunu güçlendirecek. Apple da MLX ekosistemini geliştirmeye devam ediyor — 2027’deki M4/M5 Max modelleri tabloyu tekrar sarsabilir. Ama şu anki kesitte, kategori bazlı seçim üstteki gibi.

Bir yanıt yazın