Bugün (31 Temmuz 2026), açık ağırlıklı AI cephesinde iki büyük duyuru aynı gün geldi. İkisi de aynı temayı taşıyor: daha küçük ve ucuz modeller, çok daha büyük öncüllerine yaklaşıyor — hatta bazı benchmark’larda geçiyor.
Thinking Machines Lab — Inkling-Small. Sadece 2 hafta önce lanse ettikleri 975B parametreli Inkling’in küçük kardeşi. 276B toplam, 12B aktif MoE. Yani orijinal Inkling’in ~1/4 boyutunda. Ama Artificial Analysis Intelligence Index’te 1 puan farkla peşinde. SWE-bench Verified’te ise büyük Inkling’i geçiyor.
DeepSeek — V4-Flash yeniden eğitimi. Nisan 2026’da yayınlanan V4 ailesinin küçük kardeşi V4-Flash (284B), bugün yeniden post-training aldı. Sonuç: V4-Pro-Preview’u dokuz agent benchmark’ının hepsinde geçiyor. DeepSWE’de %645 sıçrama gibi olağanüstü rakamlar.
İki hikayenin ortak dersi: “daha büyük daha iyi” formülü çöküyor. Post-training + akıllı distillation + mimari optimizasyon, brute-force parametre büyütmesinden daha etkili olabiliyor. Bu yazıda iki release’i detaylı inceleyip birbirleriyle ve rakiplerle karşılaştıralım.
Inkling-Small: 4x küçük, aynı performans
Thinking Machines Lab, orijinal Inkling’i 16 Temmuz 2026’da tanıtmıştı. 975B toplam, 41B aktif, Apache 2.0. Bugün, 15 gün sonra Inkling-Small geldi.
Rakamlar:
- Toplam parametre: 276B.
- Aktif parametre: 12B.
- Modalite: Metin + görsel + ses reasoning.
- Controllable effort levels — kullanıcı reasoning derinliğini ayarlayabiliyor.
- Lisans: Apache 2.0.
- Distribution: Hugging Face full weights + Tinker API üzerinden fine-tuning.
Benchmark karşılaştırması Inkling vs Inkling-Small:
| Benchmark | Inkling (975B) | Inkling-Small (276B) | Kazanan |
|---|---|---|---|
| AA Intelligence Index | 41 | 40 | Inkling (1 puan fark) |
| SWE-bench Verified | 77.6% | 80.2% | Inkling-Small |
| Terminal Bench 2.1 | 63.8% | 64.7% | Inkling-Small |
Yani agentic coding cephesinde küçük model, büyük öncülünü geçiyor. General intelligence tarafında (AA Index) 1 puan geride, ama pratik olarak eşdeğer.
Bu nasıl mümkün? Muhtemel açıklamalar:
1. Distillation. Inkling’in çıktı token’ları, Inkling-Small’un eğitiminde “öğretmen sinyali” olarak kullanılmış olabilir. Big-to-small distillation, klasik bir teknik ama iyi uygulandığında büyük modelin kalitesinin çoğu küçük modele aktarılabilir.
2. Daha odaklı eğitim veri. Small model, sadece coding/agentic tasks için özel olarak curate edilmiş veri kümesi üzerinde eğitilmiş olabilir. Bu, SWE-bench avantajını açıklar.
3. Mimari iyileştirme. Inkling’in mimarisindeki (relative attention, short convolutions, MoE expert sinks) yenilikler, Small versiyonda daha optimize edilmiş.
4. RL katmanı. Small model, extensive RL fine-tuning almış olabilir. Agentic task performansı bunu destekliyor.
Inkling-Small’un ekonomik anlamı
276B / 12B MoE model, deployment olarak dramatik daha ucuz:
| Metrik | Inkling (975B) | Inkling-Small (276B) |
|---|---|---|
| BF16 disk | ~2 TB | ~552 GB |
| INT4 quantized | ~500 GB | ~138 GB |
| Minimum inference donanım | 4x H200 (141 GB) | 2x H200 veya 1x B200 |
| Aktif parametre latency | 41B aktif | 12B aktif (3.4x daha hızlı) |
| Tahmini API fiyat (Together) | $3-4/M output | $0.8-1.5/M output |
Yani ~2-3x daha hızlı, ~2-3x daha ucuz — ama aynı kalite. Enterprise için karar açık: Inkling-Small tercih edilir. Sadece 1M+ context’te reasoning derinliği kritik olan senaryolarda büyük Inkling gerekli.
Thinking Machines Lab’ın 2 hafta içinde bu “small” versiyonu çıkarması hızlı iterasyon kabiliyetini gösteriyor. Mira Murati ekibinin frontier ile efficiency’yi eşzamanlı takip ettiği anlamına geliyor.
DeepSeek V4-Flash: post-training gücü
DeepSeek V4 ailesi, Nisan 2026’da yayınlandı. İki üye:
- V4-Pro: 1.6T toplam parametre, MoE. Flagship.
- V4-Flash: 284B toplam parametre, MoE. Budget/hızlı.
Nisan’dan bu güne V4-Pro benchmark liderliğini korudu. SWE-bench Verified’te %80.6 — en yüksek açık ağırlıklı skor, Gemini 3.1 Pro ile eşit. Ama V4-Flash, tam olarak “küçük kardeş” profiliyle kalmıştı — daha ucuz ama daha az yetenekli.
Bugün (31 Temmuz 2026) DeepSeek, V4-Flash’i yeniden post-training’e aldı. Sonuç şok edici:
- 9 agent benchmark’ının hepsinde V4-Pro-Preview’u geçiyor.
- DeepSWE benchmark’ında %645 sıçrama.
Bu, mimari değişiklik değil — ağırlıklar aynı boyutta. Sadece post-training pipeline’ının iyileştirmesi. Muhtemel bileşenler:
- Daha kaliteli SFT verisi.
- Genişletilmiş RL (RLHF veya RLAIF) turu.
- Agent-specific fine-tuning (tool use, chain-of-thought reasoning).
- Curriculum learning — kolaydan zora doğru task ağırlığı ayarlama.
%645 gibi bir sıçrama DeepSWE gibi bir benchmark’ta olağanüstü. Bu, DeepSeek’in post-training methodology’sinin frontier seviyeye ulaştığının kanıtı.
V4-Flash vs V4-Pro: hangi model kim için?
DeepSeek şu an ilginç bir seçimle karşı karşıya bırakıyor kullanıcıyı:
| Model | V4-Pro | V4-Flash (yeniden eğitilmiş) |
|---|---|---|
| Toplam parametre | 1.6T | 284B (5.6x küçük) |
| Context | 1M | 1M |
| SWE-bench Verified | ~%80.6 | V4-Pro-Preview’dan üstün |
| Agent benchmark (9 test) | Baseline | Hepsinde geçiyor |
| Genel MMLU/reasoning | Daha yüksek | Muhtemelen daha düşük |
| API fiyat (tahmini) | $0.87/M output | ~$0.30/M output |
Yani agent workflow’ları için V4-Flash artık daha ucuz + daha iyi. Sadece “klasik” LLM görevleri için (uzun yazım, karmaşık reasoning) V4-Pro tercih edilir.
Bu, DeepSeek’in klasik “flagship büyük, budget küçük” hiyerarşisini kısmen bozan bir gelişme. V4-Flash artık, spesifik senaryolarda V4-Pro’yu geride bırakıyor.
İki release, aynı ders
Inkling-Small ve V4-Flash yeniden eğitimi, aynı temayı farklı şekilde tekrarlıyor:
Model kalitesi = parametre sayısı’na indirgenemez.
Klasik ölçekleme kanunu “daha çok parametre = daha iyi model” diyordu. Ama son 12 ayda görüyoruz ki:
- Distillation, büyük modelin kalitesinin çoğunu küçük modele aktarabilir.
- Post-training, aynı ağırlık boyutunda dramatik iyileştirme sağlayabilir.
- Task-specific fine-tuning, general-purpose bir modeli belirli alanda güçlü hale getirir.
- RL + curriculum learning, agent workflow performansını büyük sıçramalarla artırabilir.
Sonuç: 2026 sonuna doğru middleweight modeller (100-300B) heavyweight’lardan (700B-2T) daha çekici hale geliyor. Sebep basit: benzer kalite + çok daha ucuz + çok daha hızlı deployment.
İki modeli doğrudan karşılaştırma
| Metrik | Inkling-Small | DeepSeek V4-Flash |
|---|---|---|
| Toplam parametre | 276B | 284B |
| Aktif parametre | 12B | ~15B (tahmini) |
| Modalite | Metin + görsel + ses | Metin |
| Context window | Bilinmiyor (muhtemelen 1M) | 1M |
| SWE-bench Verified | 80.2% | ~80% (Pro seviyesi) |
| Lisans | Apache 2.0 | MIT |
| Yayın tarihi | 31 Temmuz 2026 | Nisan 2026 (bugün yeniden train) |
| Ana rota | Fully open (weights + fine-tune API) | Weights + tech report |
| Ana avantaj | Multimodal + fine-tuning kolaylığı | Genel maturity, agent optimization |
| Ana dezavantaj | Yeni ekosistem (Tinker platform) | Multimodal yok |
Aynı ağırlıkta iki model, benzer benchmark performansında. Ama farklı DNA:
- Inkling-Small — Amerikan lab, multimodal, Apache 2.0, fully open ekosistem.
- V4-Flash — Çinli lab, metin odaklı, MIT, agent workflow uzman.
Kim hangisini seçer?
Inkling-Small tercih edilir:
- Görsel veya ses işleme gerekli.
- Enterprise Amerikan compliance (jeopolitik nedenlerle Çinli model istenmiyorsa).
- Tinker platform üzerinden hızlı fine-tuning yapmak.
V4-Flash tercih edilir:
- Sadece text/code workflow’u.
- Agent tasks (SWE-bench, DeepSWE, Terminal Bench).
- En düşük API fiyatı.
- Olgun DeepSeek ekosistemi ve topluluk desteği.
Frontier oyuncular için ne demek?
Bu iki hamle, kapalı frontier lab’lara (OpenAI, Anthropic, Google) mesaj gönderiyor:
OpenAI: GPT-5.6 Terra ($2/$12), Inkling-Small ve V4-Flash ile doğrudan rekabet ediyor. Dün fiyatları düşürdüler ama muhtemelen yeterli değil. Terra’nın Kimi K3 + V4-Flash + Inkling-Small üçlüsü karşısındaki değer önerisi zayıflıyor.
Anthropic: Claude Sonnet 5, agent workflow segmentinde hala güçlü. Ama V4-Flash’in agent performance sıçraması + fiyat avantajı, Sonnet 5’in enterprise adoption’unu baskılıyor. Anthropic’in cevabı muhtemelen “Claude Code + Claude Cowork ecosystem” premium’u üzerinden gelecek.
Google: Gemini 3.1 Pro, V4-Pro ile SWE-bench Verified’te eşit (%80.6). Ama fiyat cephesinde Google agresif değil. Gemini 3.6 Flash zaten zayıf performans ve pahalı fiyat ile eleştirilmişti. V4-Flash lansmanı bu tabloyu daha da kötüleştirdi.
Ekosistem etkisi: middleweight çağı
2024-2025 dönemi “bigger is better” çağıydı. GPT-4 → Claude 3.5 Opus → Gemini Ultra → GPT-5 → Claude Opus → Kimi K3 (2.8T). Her 6 ayda parametre boyutu 2-3x artıyordu.
2026 ikinci yarısı, farklı bir tema getiriyor: middleweight optimizasyonu. Aynı ekosistemde büyük ve küçük varyantların paralel gelişimi. Ama küçük olan, spesifik senaryolarda büyükü geçebiliyor.
Nedeni açık: enterprise müşteri, marj ve latency önemli. 2T parametreli bir modeli çalıştırmak $10-15/M token demek. 276B model $0.5-1/M token yapabiliyor. Aynı kalite için 10x maliyet farkı, karar açık.
Önümüzdeki aylarda benzer “small” versiyonlar bekleyebiliriz:
- Kimi K3-Small — Moonshot, muhtemelen 500B civarı bir versiyon çıkaracak.
- Qwen 3.7 Small — Alibaba’dan.
- Claude Sonnet 6 — Anthropic’in orta segmentine odaklanma.
Sonuç: aynı gün iki kanıt
31 Temmuz 2026, açık ağırlıklı AI cephesinde önemli bir gün. Aynı gün içinde iki farklı lab, farklı yöntemlerle aynı ana mesajı verdi: daha ucuz, daha küçük modellerde frontier kalite mümkün.
Inkling-Small — distillation + mimari optimizasyon.
V4-Flash — post-training + agent specialization.
İkisi de aynı sonuca ulaşıyor: middleweight modeller (250-300B), spesifik senaryolarda 1T+ heavyweight’ları geçiyor. Cost/performance oranı radikal iyileşiyor.
Enterprise kullanıcı için pratik tavsiye: mevcut GPT-5.6 Terra veya Claude Sonnet 5 workflow’larınızı bu iki yeni modele karşı test edin. Muhtemelen benzer kalite, %60-80 tasarruf. Özellikle agent-heavy workload’lar için V4-Flash, multimodal workload’lar için Inkling-Small ilk deneme adayı.
Model provider cephesinde 2026 sonuna doğru middleweight savaşı sertleşecek. Winner: kullanıcı. Loser: klasik “bigger is better” retoriğine bağlı kalan kapalı frontier lab’lar.
Modelleri denemek için:
- Inkling-Small: huggingface.co/thinkingmachines + tinker.thinkingmachines.ai
- DeepSeek V4-Flash: huggingface.co/deepseek-ai + api-docs.deepseek.com

Bir yanıt yazın