Açık kaynak AI cephesinde bir başka önemli hamle: AMD, kendi ilk tamamen açık Mixture-of-Experts (MoE) dil modelini yayınladı. Instella-MoE. 16 milyar toplam parametre, token başına sadece 2.8 milyar aktif parametre. Kendi AMD Instinct MI300X ve MI325X GPU’larında, kendi AMD-Primus ve Miles framework’leri ile sıfırdan eğitildi.
Ama asıl haber model boyutu değil. Asıl haber ne kadar açık yayınlandığı. AMD, sadece son model ağırlıklarını değil, uçtan uca eğitim pipeline’ını tamamen paylaşıyor:
- Pre-training → Mid-training → Long-context extension → SFT → DPO → RL — her aşamanın checkpoint’leri
- Eğitim reçeteleri ve konfigürasyonları
- Veri karışımları (data mixtures)
- Eğitim ve inference kodu
Bu, açık ağırlıklı model tanımının çok ötesinde bir açıklık. Genelde “open weights” modeli sadece son safetensors dosyalarını yayınlar. Instella-MoE ise fully reproducible research package. Aynı reçeteyi izleyerek modeli sıfırdan yeniden üretebilirsiniz.
Bu yazıda Instella-MoE’nin mimari yeniliklerini, AMD’nin bu radikal açıklık stratejisinin arkasındaki motivasyonu, NVIDIA-dominated AI ekosisteminde AMD’nin nerede durduğunu inceleyeceğiz.
Model spec’leri
Instella-MoE’nin teknik profili:
- Toplam parametre: 16 milyar.
- Aktif parametre: 2.8 milyar (token başına).
- Aktif oran: ~%17.5 — MoE için orta seviye sparse.
- Mimari: Sparsely activated MoE + iki yenilik: Gated Multi-head Latent Attention (Gated MLA) ve FarSkip-Collective.
- Eğitim donanımı: AMD Instinct MI300X (192 GB HBM3) ve MI325X (256 GB HBM3e).
- Eğitim framework’leri: AMD-Primus (kendi distributed training stack’i) ve Miles.
- Performans: AMD’ye göre, ölçeği bazında fully open modeller arasında state-of-the-art.
Rakip karşılaştırma (fully open + benzer aktif parametre sınıfı):
| Model | Toplam | Aktif | Açıklık seviyesi |
|---|---|---|---|
| Instella-MoE | 16B | 2.8B | Fully open (data + code + weights) |
| OLMo 2 32B | 32B dense | 32B | Fully open |
| Apertus 70B | 70B dense | 70B | Fully open |
| DeepSeek V3.2 | 671B | 37B | Weights + tech report |
| Kimi K3 | 2.8T | ~50B | Weights + tech report |
| Llama 4 | ~2T | 288B | Weights only, kısıtlı lisans |
“Fully open” kategorisi burada kritik. Kimi K3 ve DeepSeek gibi “open weights” modeller, ağırlıkları paylaşır ama eğitim verisi ve pipeline’ı vermez. Instella-MoE, OLMo ve Apertus ile aynı sınıfta — her şey açık.
Mimari yenilikler
Instella-MoE, iki mimari inovasyon getiriyor:
1. Gated Multi-head Latent Attention (Gated MLA). DeepSeek’in MLA (Multi-head Latent Attention) mekanizmasının bir varyantı. MLA, KV cache boyutunu radikal düşürüyor — her token için ayrı KV vektörleri saklamak yerine, sıkıştırılmış latent temsil kullanıyor. Gated MLA’nın farkı: bu latent temsil üzerinde bir gating mechanism ekleniyor. Muhtemel amaç: hangi latent boyutların hangi bağlamda ön plana çıkacağını dinamik seçmek.
Pratik sonuç: uzun bağlamlarda daha az bellek, daha hızlı inference. Bu, 16B modelin edge deployment için (tek H100 veya MI300X) kullanılabilir olmasını sağlıyor.
2. FarSkip-Collective. Skip connection’ların uzak katmanlar arasında collective (grup) olarak kullanılması. Klasik ResNet skip connection’ları komşu katmanlar arasında; FarSkip ise 10-20 katman ötede olan katmanları birbirine bağlıyor. “Collective” kısmı, birden fazla uzak katmanın toplu olarak bir başka katmana skip edilmesi anlamına geliyor.
Muhtemel amaç: gradient flow’u iyileştirmek, uzun katmanlı derin modellerin eğitim stabilitesini artırmak. MoE modellerinde gradient sinyali sparse aktivasyon nedeniyle zayıflayabiliyor — FarSkip bu sinyali güçlendiriyor.
Detaylı teknik makale AMD Rocm bloğunda: rocm.blogs.amd.com/artificial-intelligence/instella-moe.
Neden bu kadar açık? AMD’nin stratejisi
Data + code + weights = fully open bir modele yayınlamak, ciddi bir taahhüt. Neden AMD bunu yaptı?
1. NVIDIA CUDA hegemonyasına karşı. AI cephesinde NVIDIA’nın en büyük avantajı sadece donanım değil, CUDA + PyTorch + Triton stack’i. AMD, ROCm ile alternatif sunuyor ama adoption yavaş. Instella-MoE’yi MI300X/MI325X üzerinde sıfırdan eğitip tüm pipeline’ı yayınlaması, ROCm stack’inin frontier AI için gerçekten kullanılabilir olduğunu kanıtlıyor. Araştırmacılar “ROCm da işe yarıyor” demeye başlarsa, AMD GPU satışlarına doğrudan etki eder.
2. AMD-Primus framework’ünü tanıtma. Primus, AMD’nin distributed training stack’i. NVIDIA’nın NeMo, DeepSpeed, Megatron alternatifi. Kimse bilmiyor. Instella-MoE lansmanı, Primus’u bir örnek proje ile ekosisteme sunuyor.
3. Talent attraction. AMD’nin AI research ekibi, NVIDIA ve OpenAI’dan yetenek çekmeye çalışıyor. Fully open bir flagship model, akademik prestij yaratıyor. Yeni ML mühendislerini “AMD’de research yaparsan işin dünyaya açık” mesajıyla çekiyor.
4. Enterprise satış kanıt. AMD, MI300X/MI325X satmak istiyor. Ama enterprise müşteri “bunlar NVIDIA H100 gibi çalışıyor mu?” sorusunu soruyor. Sıfırdan eğitilmiş 16B model + tam pipeline, bu soruya somut cevap: “Evet, işte kanıt.”
5. AI safety ve reproducibility hikayesi. Regülatörler ve akademik camia, AI modellerin nasıl eğitildiğinin şeffaf olmasını istiyor. AMD, tam pipeline yayınlayarak bu talep dalgasının doğru tarafında konumlanıyor.
MI300X vs H100: gerçek durum
Instella-MoE, AMD’nin flagship GPU’ları MI300X ve MI325X üzerinde eğitildi. Bu donanımlar NVIDIA H100’e karşı nerede duruyor?
| Özellik | MI300X | MI325X | NVIDIA H100 | NVIDIA H200 |
|---|---|---|---|---|
| HBM kapasite | 192 GB HBM3 | 256 GB HBM3e | 80 GB HBM3 | 141 GB HBM3e |
| Memory bandwidth | 5.3 TB/s | 6 TB/s | 3.35 TB/s | 4.8 TB/s |
| FP16 TFLOPS | ~1300 | ~1300 | ~1000 | ~1000 |
| Fiyat (yaklaşık) | $15-20K | $18-25K | $25-30K | $30-40K |
| Software ekosistem | ROCm (gelişiyor) | ROCm (gelişiyor) | CUDA (olgun) | CUDA (olgun) |
Yani donanım cephesinde AMD’nin bir sürü avantajı var: daha fazla RAM, daha yüksek memory bandwidth, daha ucuz fiyat. Ama software ekosistem tarafında CUDA yıllardır bir başlangıç avantajı taşıyor.
Instella-MoE, tam olarak bu boşluğu kapatma projesi. Eğer AMD, MI300X’in en az H100 kadar kolay kullanıldığını gösterirse, cost/performance tarafındaki avantajı satışa dönüşür.
“Fully open” ne demek pratik olarak?
Ağırlıkları yayınlamak vs eğitim pipeline’ını yayınlamak arasında fark ne?
Sadece ağırlıklar (Kimi K3, DeepSeek V3, Llama 4): Modeli indirebilir, çalıştırabilir, fine-tune edebilirsiniz. Ama model nasıl eğitildi bilmezsiniz. Hangi veriler, hangi hyperparametre’ler, hangi curriculum — hepsi kara kutu. Kendi modelinizi eğitmek isteseniz de recipe eksik.
Fully open (Instella-MoE, OLMo, Apertus): Ağırlıklar + eğitim kodu + veri karışımları + reçete + checkpoint’ler. Bir doktora öğrencisi, aynı süreci tekrarlayabilir. Küçük bir varyant üretebilir. Data karışımını değiştirip A/B karşılaştırması yapabilir.
Araştırma için ikincisi çok daha değerli. Ama rekabet için ikincisi daha zayıf — rakipler senin işini tekrarlayabilir. AMD, bu risk almayı tercih etmiş.
Instella-MoE’nin gerçek kullanım senaryoları
16B model / 2.8B aktif parametre, teknik olarak nasıl kullanılabilir?
1. Edge deployment. 2.8B aktif parametre, INT4 quantize edildiğinde ~1.4 GB. Consumer GPU üzerinde çalışır. Hatta yeterli CPU ile bile inference mümkün. Local AI ürünler için pratik.
2. Research baseline. Fully open olması, akademik gruplar için ideal. Kendi mimari denemelerinizi Instella-MoE baseline’ı üzerinde yapabilirsiniz. LoRA ve tam fine-tune workflow’ları için mükemmel test bed.
3. MoE mimari öğrenme. MoE mekanizmalarını öğrenmek isteyen mühendisler için Instella-MoE’nin tam kodu ders kitabı gibi. Router logic, load balancing, expert routing — hepsi görülebilir.
4. AMD ekosistem geliştiriciler. ROCm üzerinde model geliştirmek isteyen mühendisler için gerçek bir vaka çalışması. NVIDIA’dan AMD’ye geçiş yapan ekipler, Instella-MoE’yi izleyerek best practice öğrenebilir.
Beklentiler ve gerçekçilik
Instella-MoE, ne olduğu ile ne olmadığı konusunda net olmak lazım.
Ne değil:
- Frontier model değil. Kimi K3, Fable 5, GPT-5.6 seviyesinde değil.
- Genel amaçlı en iyi 16B model değil. Qwen 3.6, Mistral, Phi ailesinden bazı 14-16B modeller MMLU/HumanEval’da daha iyi puan alabilir.
- Production-ready cloud inference için optimum değil. vLLM native desteği henüz yok muhtemelen.
Ne:
- Fully open kategorisinde ölçek için state-of-the-art.
- AMD’nin CUDA hegemonyasına karşı ilk somut hamle.
- MoE research için mükemmel bir açık kaynak baseline.
- ROCm ekosisteminin frontier AI için yeterliğinin kanıtı.
Yani Instella-MoE’yi “Kimi K3 alternatifi” olarak beklemek yanlış. “OLMo 2 rakibi + AMD ekosistem stimulator” olarak beklemek doğru.
Sonuç: donanım savaşı software tarafına kayıyor
Instella-MoE, tek başına değil bir strateji parçası. AMD, AI cephesinde NVIDIA hegemonyasına karşı çok cepheli bir savaş veriyor: donanım (MI300X/MI325X vs H100/H200), software (ROCm vs CUDA), framework (Primus vs Megatron), model (Instella vs kapalı frontier). Her cephede küçük ilerlemeler, kümüle olarak büyük bir etki yaratabilir.
Ama gerçekçi olmak gerekirse: NVIDIA’nın CUDA + PyTorch olgunluğu, 15 yılın birikimi. AMD’nin ROCm 2-3 yıllık bir yatırım. Yakalamak zaman alacak.
Yine de Instella-MoE gibi hamleler önemli. Her bir açık model, ekosistem büyüklüğüne katkı sağlıyor. Araştırmacılar “bir sonraki modelimi ROCm üzerinde de eğitebilirim” demeye başlıyor. Bu, uzun vadeli platform savaşının en kritik boyutu.
Modeli denemek isteyenler:
- Hugging Face collection: huggingface.co/collections/amd/instella-moe
- GitHub: github.com/AMD-AGI/Instella-MoE
- AMD Rocm blog: rocm.blogs.amd.com/artificial-intelligence/instella-moe
MoE + fully open kombinasyonu, 2026’nın en ilginç açık kaynak AI araştırma paketlerinden biri. AMD, doğru zamanda doğru hamle yaptı.

Bir yanıt yazın