Local AI inference cephesinde 2026’nın en dikkat çekici quantization gelişmesi: EXL3. ExLlamaV3 kütüphanesinin öz format’ı. Şimdi SparkInfer (vLLM’in fork’u) içine entegre edildi ve ExLlamaV3’teki hızın 3 katında çalışıyor.
Kime hitap ediyor? Blackwell mimarisine sahip herkes:
- NVIDIA DGX Spark (GB10, SM121)
- RTX 5090
- RTX 4000/5000/6000 Blackwell serisi
- RTX 6000 Pro (Blackwell)
Ve bir bonus: tek/çift/üç kart konfigürasyonlarının hepsinde iyi çalışıyor — çoğu quantization scheme’nin aksine tek sayıda kart ile de performans kaybı olmadan çalışıyor.
Bu yazıda EXL3’ün ne olduğunu, neden Blackwell donanımı için özellikle iyi olduğunu, SparkInfer entegrasyonunun ne kazandırdığını ve pratik olarak nasıl kullanılacağını inceleyeceğiz.
EXL3 nedir?
ExLlamaV3, turboderp tarafından geliştirilen consumer GPU’lar için optimize edilmiş inference ve quantization kütüphanesi. EXL3, bu kütüphanenin öz quantization formatı.
Kritik teknik detay: EXL3, Cornell RelaxML’in QTIP’inin (Quantization Trellis Instruction Prediction) sadeleştirilmiş bir varyantı. Kullandığı iki ana mimari yenilik:
1. Procedural codebook. Klasik quantization’da ağırlıklar sabit bir codebook’a mapping edilir (INT4, INT8 gibi). EXL3, procedural olarak üretilen bir codebook kullanıyor. Yani sıkıştırma sırasında codebook, ağırlıkların dağılımına adapte oluyor.
2. Tail-biting trellis encoding. Yüksek boyutlu vektörleri optimal tail-biting trellis yapılarına encode ediyor. Bu, bilgi teorisi cephesinden convolutional codes ile ilgili — Shannon limit’e daha yakın sıkıştırma sağlıyor.
3. Trellis allocation. Quantization precision’i uniform değil, önem seviyesine göre dağıtıyor. Kritik ağırlıklara daha fazla bit, marjinal ağırlıklara daha az bit veriyor. Aynı ortalama bit bütçesinde daha fazla kalite korunuyor.
Pratik sonuç: 1.6 bit/parametre bile kullanılabilir
EXL3’ün gerçek gücü kalite/boyut oranında ortaya çıkıyor. Kritik örnek:
- Llama-3.1-70B EXL3, 1.6 bit/parametre: hala tutarlı çıktı üretiyor.
- Output layer 3 bit’e quantize edildiğinde + 4096 token cache: 16 GB VRAM altında inference mümkün.
Karşılaştırma için:
- GGUF Q4_K_M (Llama-3.1-70B): ~40 GB. Neredeyse H100 seviyesi donanım gerekli.
- AWQ INT4: ~35 GB. Yine büyük GPU.
- EXL3 1.6-bit + 3-bit output: ~15 GB. RTX 4080 seviyesinde çalışır.
Yani 70B modeli consumer donanımda çalıştırmanın yolu, bugün EXL3’ten geçiyor.
Community konsensüsü: 2 ile 3 bit/parametre EXL3 formatları giderek daha kullanılabilir hale geliyor. Bu, aynı VRAM’de 2 kat daha büyük model çalıştırmak demek.
SparkInfer entegrasyonu: 3x hızlanma
ExLlamaV3, tek başına iyi bir inference engine. Ama SparkInfer, bir üst katman ekliyor.
SparkInfer nedir? Vöylo topluluğunun (formerly b12x) geliştirdiği bir vLLM fork’u. SM120/SM121 mimarisi (yani Blackwell) için özel CuTe DSL kernel’leri içeriyor.
Hedef donanım:
- NVIDIA DGX Spark (GB10, SM121)
- RTX 5090 (Blackwell consumer)
- RTX 6000 Pro Blackwell
- RTX 4000/5000 Blackwell workstation cards
SparkInfer + EXL3 kombinasyonunun sağladığı avantajlar:
1. Ham hız: 3x ExLlamaV3. Aynı model, aynı ağırlıklar, aynı donanım. Sadece SparkInfer üzerinde çalıştırılınca 3 kat hızlı.
2. vLLM ekosistem uyumluluğu. vLLM fork’u olduğu için, OpenAI-compatible API server, batch inference, tensor parallelism, prefix caching — hepsi hazır.
3. Multi-GPU scaling. vLLM’in tensor parallelism’i ile 1-2-3-N kart konfigürasyonlarında ölçeklenir.
4. CUDA graph optimizations. Blackwell mimarisinin özel özelliklerinden yararlanmak için CuTe DSL kernel’ler.
Tek sayıda kart avantajı
Klasik multi-GPU inference’ta genel bir problem: tensor parallelism için kart sayısının modeli eşit bölecek şekilde tam bölünen bir sayı olması gerekir. 32 attention head’li bir model için 1, 2, 4, 8, 16 kart uygun; 3, 5, 6, 7 zorlu.
Bu, pratik deployment’ta önemli bir kısıt. Bir kullanıcının 3 GPU’su varsa, klasik olarak sadece 2’sini kullanmak zorunda kalıyor.
SparkInfer + EXL3, tek sayıda kart konfigürasyonlarında da iyi çalışıyor. Nedeni: EXL3’ün trellis-based encoding’i, ağırlıkları daha esnek şekilde parçalayabiliyor. Dahili scheduling, kart sayısına göre optimize.
Pratik senaryolar:
- 3x RTX 4090: Klasik vLLM ile sadece 2 kart kullanabilirdiniz. SparkInfer + EXL3 ile 3’ü de aktif.
- 1x DGX Spark + 1x RTX 5090: Karışık konfigürasyonlarda bile çalışıyor.
- 3x DGX Spark: Direkt QSFP cable veya switched fabric ile.
Bu esneklik, home lab ve small startup ortamları için değerli. Sadece ideal 2/4/8 kart konfigürasyonu almak zorunda kalmıyorsunuz.
Nasıl kullanılır? Pratik deployment
Bir örnek deployment senaryosu: DeepSeek V4 Flash 0731 modelini tek DGX Spark üzerinde EXL3 + SparkInfer ile çalıştırma.
# SparkInfer + EXL3 image indirilir (GB10 için pinned)
docker pull ghcr.io/0xsero/deepseek-v4-flash-0731-spark-sparkinfer:latest
# İlk çalıştırma:
# - 107 GB source weights indirir
# - Rank-sliced EXL3 archive'i TP1'e coalesce eder
# - Checksums doğrular
# - 3.0 GB K64 DSpark draft (speculative decoding) build eder
# - SparkInfer CUDA-graph self-test
# - OpenAI-compatible server başlar
docker run --gpus all \
-p 8000:8000 \
ghcr.io/0xsero/deepseek-v4-flash-0731-spark-sparkinfer:latest
# API endpoint: localhost:8000/v1/chat/completions
Bu, sadece tek DGX Spark’ta 262K NVFP4 MLA KV cache ile DeepSeek V4 Flash 0731 çalıştırmayı mümkün kılıyor. Klasik vLLM ile bu senaryo mümkün değil — 128 GB unified memory yetersiz.
EXL3 vs diğer quantization formatları
2026’da mevcut ana quantization seçenekleri:
| Format | Ana avantaj | Ana dezavantaj | En iyi kullanım |
|---|---|---|---|
| EXL3 | En düşük bit/parametre, kalite korunumu | Blackwell’e özel optimizasyon | Consumer GPU + büyük model |
| GGUF (llama.cpp) | Cross-platform, CPU dahil her donanımda | GPU hızı vLLM’den düşük | Mac, laptop, CPU inference |
| AWQ | Olgun tool ekosistem | Sadece INT4, esnek değil | Standart enterprise deployment |
| GPTQ | İlk yaygın quantization | Kalite kaybı yüksek | Legacy uygulamalar |
| MXFP4 / NVFP4 | Blackwell hardware desteği | Sadece Blackwell donanım | Datacenter Blackwell GPU |
| BitsAndBytes NF4 | Transformers library entegre | Ham hız yavaş | Hızlı prototip |
EXL3’ün konumu net: Blackwell donanım + büyük model + minimum bit sayısı senaryosunda en iyi seçenek. Diğer senaryolar için diğer formatlar hala geçerli.
Modeller ve topluluk
Community, EXL3 quantized modelleri Hugging Face’e hızla yüklemeye başladı. Ama ilk durak: EXL3’ün mucidi turboderp’ın kendi Hugging Face koleksiyonu: huggingface.co/turboderp.
turboderp, ExLlamaV3’ün kurucu geliştiricisi. Hugging Face’te 138 EXL3 modeli paylaşmış. Öne çıkan model ailesi:
Qwen 3.6 27B varyantları
- turboderp/Qwen3.6-27B-exl3_3.30bpw — 3.30 bit/parametre. Multimodal (image-text-to-text). En son güncellenen (8 gün önce). Bir 27B modelinin ~11 GB VRAM ile çalışabilir hale gelmesi.
- turboderp/Qwen3.6-27B-MTP-exl3 — Multi-Token Prediction varyantı. Speculative decoding için özel format.
- turboderp/Qwen3.6-27B-DFlash-exl3 — DFlash (Meta’nın speculative decoding drafter’ı) entegre. 110 indirme, 14 like — koleksiyonun en popüler modellerinden.
Gemma 4 ailesi
- turboderp/gemma-4-12B-it-exl3 — Google Gemma 4 12B instruction-tuned. 209 indirme (en yüksek), 6 like. EXL3 formatındaki en popüler Gemma varyantı.
- turboderp/gemma4-31b-it-DFlash-exl3 — 31B DFlash entegre versiyonu.
- turboderp/gemma-4-26B-A4B-it-exl3 — MoE varyantı (26B toplam, A4B aktif). 88 indirme, 15 like.
Küçük ve verimli modeller
- turboderp/LFM2.5-8B-A1B-exl3 — Liquid AI’ın 8B modeli (1B aktif MoE). Edge deployment için ideal.
- turboderp/MiniCPM5-1B-exl3 — 1B küçük model.
- turboderp/Step-3.7-Flash-exl3 — StepFun’un modeli.
- turboderp/zeta-2-exl3 — Deneysel model.
turboderp’ın koleksiyonundaki dikkat çekici teknik yönler:
1. DFlash entegrasyonu. Meta’nın Muse Glimmer için tanıttığı speculative decoding drafter’ı, turboderp Qwen ve Gemma modellerine de uyarlamış. Bu, 3x hızlanma sağlıyor (Meta’nın kendi RTX 5090 benchmark’ında).
2. MTP (Multi-Token Prediction) desteği. Klasik autoregressive generation’ın yerine, bir tokenda birden fazla token tahmin etme. Inference hızını daha da artıran ikinci bir yaklaşım.
3. Model çeşitliliği. Qwen, Gemma, Liquid AI LFM2.5, StepFun Step 3.7 Flash, MiniCPM — farklı üretici ve mimarilerden model. Kullanıcının seçim özgürlüğü.
4. Bit-per-weight varyantları. Aynı modelin farklı sıkıştırma seviyeleri (2.0, 2.5, 3.0, 3.3, 4.0 bpw gibi). Kullanıcı VRAM bütçesine göre optimum bit-per-weight seçebilir.
Diğer community EXL3 modelleri
- mratsim/GLM-4.7-EXL3 — GLM 4.7’nin EXL3 quantized versiyonu.
- Llama 3.1 70B EXL3 — çeşitli bit-per-weight varyantları.
- DeepSeek V4 Flash 0731 — SparkInfer entegre versiyon (0xSero’dan).
Model kartlarına bakıldığında turboderp’ın disiplinli belgeleme sağladığı görülüyor: her modelin bit-per-weight seviyesi net, quantization method açıklamalı, deployment örnekleri var. EXL3 formatına yeni başlayanlar için turboderp koleksiyonu doğru başlangıç noktası.
EXL3 formatına converted model sayısı hızla artıyor. GGUF sayısını yakın vadede geçmesi beklenmez ama Blackwell donanım sahipleri için giderek daha çok seçenek olacak.
Kim için ideal?
RTX 5090 sahipleri. 32 GB VRAM ile 70B modelleri çalıştırma imkanı. Klasik olarak imkansızdı, EXL3 ile pratik.
DGX Spark sahipleri. SparkInfer, tam olarak GB10 için optimize edilmiş. 128 GB unified memory ile birleşince, DeepSeek V4 Flash 0731 gibi devasa modeller bile çalışabiliyor.
Home lab kurucular. Tek sayıda kart konfigürasyonlarında da iyi çalışması, esneklik sağlıyor. 3x RTX 4090 rig, artık “3. karta gerek yok” değil, tam kapasitede kullanılabilir.
Küçük startup’lar. Datacenter GPU (H100/H200) satın alamayan ama frontier modelleri kullanmak isteyenler için EXL3 + Blackwell consumer GPU en ekonomik yol.
Sınırlamalar
EXL3, mucize değil. Bilinen kısıtlar:
1. Blackwell odaklı. SparkInfer’ın 3x hız avantajı Blackwell mimarisine bağlı. Ada Lovelace (RTX 4090), Hopper (H100), Ampere (A100) üzerinde ExLlamaV3 klasik hızlarında çalışır.
2. Kurulum karmaşık. Docker image, CUDA graph self-test, checksum doğrulama — standart llama.cpp basitliğinde değil. Teknik kullanıcı gerekli.
3. Model coverage sınırlı. Popüler modeller EXL3 formatında var, ama her yeni release hemen EXL3’e gelmiyor. Community conversion beklenmesi gerekli.
4. Ağırlık kayıp riski. 1.6 bit/parametre gibi agresif seviyelerde, edge case’lerde kalite kaybı olabilir. Production için önce evaluate edin.
5. SparkInfer henüz genç proje. vLLM fork’u olarak aktif ama upstream vLLM ile feature parity yok. Bazı özellikler (özellikle newer scheduling algorithms) SparkInfer’a gecikmeli gelebilir.
Sonuç: Blackwell + EXL3, local AI için altın standart oluyor
2024-2025 arası consumer local AI, çoğunlukla GGUF üzerinden yapıldı. llama.cpp’nin ekosistemi olgun, cross-platform, kolay kullanım. Ama Blackwell mimarisi ile birlikte tablo değişiyor.
EXL3 quantization + SparkInfer inference kombinasyonu, Blackwell donanımın performansını maksimize eden bir stack. RTX 5090 veya DGX Spark sahipleri için, 2026’nın en iyi local AI yaklaşımı.
Konkret öneri:
- RTX 5090 sahibi: ExLlamaV3 + EXL3 formatındaki 32-70B modellerle deneyimleyin. Örnek başlangıç: github.com/turboderp-org/exllamav3.
- DGX Spark sahibi: SparkInfer + EXL3 kombinasyonu kritik. Örnek deployment: github.com/0xSero/deepseek-v4-flash-0731-spark-sparkinfer.
- Blackwell workstation (RTX 4000-6000 Pro): SparkInfer, bu kartları da destekliyor. Enterprise deployment için değerli.
Önümüzdeki aylarda EXL3 formatındaki model sayısı hızla artacak. Popüler her yeni model release’i (Kimi K3-tiny, DeepSeek V5, Qwen 3.7) 1-2 hafta içinde EXL3’e converted olarak Hugging Face’te belirir. SparkInfer geliştirmeye devam ediyor; upstream vLLM ile feature parity 2026 sonuna doğru tamamlanabilir.
Local AI’ın 2026-2027 çağı, cloud API’lere olan bağımlılığı azaltmanın en pratik yolu. EXL3 + Blackwell donanım, bu geçişin teknik altyapısını sunuyor.

Bir yanıt yazın