Aynı gün iki büyük hamle: Inkling-Small ve DeepSeek V4-Flash — 1/4 boyutta aynı performans, agent benchmark’larda %645 sıçrama. Middleweight modeller çağı başladı

Bugün (31 Temmuz 2026), açık ağırlıklı AI cephesinde iki büyük duyuru aynı gün geldi. İkisi de aynı temayı taşıyor: daha küçük ve ucuz modeller, çok daha büyük öncüllerine yaklaşıyor — hatta bazı benchmark’larda geçiyor.

Thinking Machines Lab — Inkling-Small. Sadece 2 hafta önce lanse ettikleri 975B parametreli Inkling’in küçük kardeşi. 276B toplam, 12B aktif MoE. Yani orijinal Inkling’in ~1/4 boyutunda. Ama Artificial Analysis Intelligence Index’te 1 puan farkla peşinde. SWE-bench Verified’te ise büyük Inkling’i geçiyor.

DeepSeek — V4-Flash yeniden eğitimi. Nisan 2026’da yayınlanan V4 ailesinin küçük kardeşi V4-Flash (284B), bugün yeniden post-training aldı. Sonuç: V4-Pro-Preview’u dokuz agent benchmark’ının hepsinde geçiyor. DeepSWE’de %645 sıçrama gibi olağanüstü rakamlar.

İki hikayenin ortak dersi: “daha büyük daha iyi” formülü çöküyor. Post-training + akıllı distillation + mimari optimizasyon, brute-force parametre büyütmesinden daha etkili olabiliyor. Bu yazıda iki release’i detaylı inceleyip birbirleriyle ve rakiplerle karşılaştıralım.

Inkling-Small: 4x küçük, aynı performans

Thinking Machines Lab, orijinal Inkling’i 16 Temmuz 2026’da tanıtmıştı. 975B toplam, 41B aktif, Apache 2.0. Bugün, 15 gün sonra Inkling-Small geldi.

Rakamlar:

  • Toplam parametre: 276B.
  • Aktif parametre: 12B.
  • Modalite: Metin + görsel + ses reasoning.
  • Controllable effort levels — kullanıcı reasoning derinliğini ayarlayabiliyor.
  • Lisans: Apache 2.0.
  • Distribution: Hugging Face full weights + Tinker API üzerinden fine-tuning.

Benchmark karşılaştırması Inkling vs Inkling-Small:

Benchmark Inkling (975B) Inkling-Small (276B) Kazanan
AA Intelligence Index 41 40 Inkling (1 puan fark)
SWE-bench Verified 77.6% 80.2% Inkling-Small
Terminal Bench 2.1 63.8% 64.7% Inkling-Small

Yani agentic coding cephesinde küçük model, büyük öncülünü geçiyor. General intelligence tarafında (AA Index) 1 puan geride, ama pratik olarak eşdeğer.

Bu nasıl mümkün? Muhtemel açıklamalar:

1. Distillation. Inkling’in çıktı token’ları, Inkling-Small’un eğitiminde “öğretmen sinyali” olarak kullanılmış olabilir. Big-to-small distillation, klasik bir teknik ama iyi uygulandığında büyük modelin kalitesinin çoğu küçük modele aktarılabilir.

2. Daha odaklı eğitim veri. Small model, sadece coding/agentic tasks için özel olarak curate edilmiş veri kümesi üzerinde eğitilmiş olabilir. Bu, SWE-bench avantajını açıklar.

3. Mimari iyileştirme. Inkling’in mimarisindeki (relative attention, short convolutions, MoE expert sinks) yenilikler, Small versiyonda daha optimize edilmiş.

4. RL katmanı. Small model, extensive RL fine-tuning almış olabilir. Agentic task performansı bunu destekliyor.

Inkling-Small’un ekonomik anlamı

276B / 12B MoE model, deployment olarak dramatik daha ucuz:

Metrik Inkling (975B) Inkling-Small (276B)
BF16 disk ~2 TB ~552 GB
INT4 quantized ~500 GB ~138 GB
Minimum inference donanım 4x H200 (141 GB) 2x H200 veya 1x B200
Aktif parametre latency 41B aktif 12B aktif (3.4x daha hızlı)
Tahmini API fiyat (Together) $3-4/M output $0.8-1.5/M output

Yani ~2-3x daha hızlı, ~2-3x daha ucuz — ama aynı kalite. Enterprise için karar açık: Inkling-Small tercih edilir. Sadece 1M+ context’te reasoning derinliği kritik olan senaryolarda büyük Inkling gerekli.

Thinking Machines Lab’ın 2 hafta içinde bu “small” versiyonu çıkarması hızlı iterasyon kabiliyetini gösteriyor. Mira Murati ekibinin frontier ile efficiency’yi eşzamanlı takip ettiği anlamına geliyor.

DeepSeek V4-Flash: post-training gücü

DeepSeek V4 ailesi, Nisan 2026’da yayınlandı. İki üye:

  • V4-Pro: 1.6T toplam parametre, MoE. Flagship.
  • V4-Flash: 284B toplam parametre, MoE. Budget/hızlı.

Nisan’dan bu güne V4-Pro benchmark liderliğini korudu. SWE-bench Verified’te %80.6 — en yüksek açık ağırlıklı skor, Gemini 3.1 Pro ile eşit. Ama V4-Flash, tam olarak “küçük kardeş” profiliyle kalmıştı — daha ucuz ama daha az yetenekli.

Bugün (31 Temmuz 2026) DeepSeek, V4-Flash’i yeniden post-training’e aldı. Sonuç şok edici:

  • 9 agent benchmark’ının hepsinde V4-Pro-Preview’u geçiyor.
  • DeepSWE benchmark’ında %645 sıçrama.

Bu, mimari değişiklik değil — ağırlıklar aynı boyutta. Sadece post-training pipeline’ının iyileştirmesi. Muhtemel bileşenler:

  • Daha kaliteli SFT verisi.
  • Genişletilmiş RL (RLHF veya RLAIF) turu.
  • Agent-specific fine-tuning (tool use, chain-of-thought reasoning).
  • Curriculum learning — kolaydan zora doğru task ağırlığı ayarlama.

%645 gibi bir sıçrama DeepSWE gibi bir benchmark’ta olağanüstü. Bu, DeepSeek’in post-training methodology’sinin frontier seviyeye ulaştığının kanıtı.

V4-Flash vs V4-Pro: hangi model kim için?

DeepSeek şu an ilginç bir seçimle karşı karşıya bırakıyor kullanıcıyı:

Model V4-Pro V4-Flash (yeniden eğitilmiş)
Toplam parametre 1.6T 284B (5.6x küçük)
Context 1M 1M
SWE-bench Verified ~%80.6 V4-Pro-Preview’dan üstün
Agent benchmark (9 test) Baseline Hepsinde geçiyor
Genel MMLU/reasoning Daha yüksek Muhtemelen daha düşük
API fiyat (tahmini) $0.87/M output ~$0.30/M output

Yani agent workflow’ları için V4-Flash artık daha ucuz + daha iyi. Sadece “klasik” LLM görevleri için (uzun yazım, karmaşık reasoning) V4-Pro tercih edilir.

Bu, DeepSeek’in klasik “flagship büyük, budget küçük” hiyerarşisini kısmen bozan bir gelişme. V4-Flash artık, spesifik senaryolarda V4-Pro’yu geride bırakıyor.

İki release, aynı ders

Inkling-Small ve V4-Flash yeniden eğitimi, aynı temayı farklı şekilde tekrarlıyor:

Model kalitesi = parametre sayısı’na indirgenemez.

Klasik ölçekleme kanunu “daha çok parametre = daha iyi model” diyordu. Ama son 12 ayda görüyoruz ki:

  • Distillation, büyük modelin kalitesinin çoğunu küçük modele aktarabilir.
  • Post-training, aynı ağırlık boyutunda dramatik iyileştirme sağlayabilir.
  • Task-specific fine-tuning, general-purpose bir modeli belirli alanda güçlü hale getirir.
  • RL + curriculum learning, agent workflow performansını büyük sıçramalarla artırabilir.

Sonuç: 2026 sonuna doğru middleweight modeller (100-300B) heavyweight’lardan (700B-2T) daha çekici hale geliyor. Sebep basit: benzer kalite + çok daha ucuz + çok daha hızlı deployment.

İki modeli doğrudan karşılaştırma

Metrik Inkling-Small DeepSeek V4-Flash
Toplam parametre 276B 284B
Aktif parametre 12B ~15B (tahmini)
Modalite Metin + görsel + ses Metin
Context window Bilinmiyor (muhtemelen 1M) 1M
SWE-bench Verified 80.2% ~80% (Pro seviyesi)
Lisans Apache 2.0 MIT
Yayın tarihi 31 Temmuz 2026 Nisan 2026 (bugün yeniden train)
Ana rota Fully open (weights + fine-tune API) Weights + tech report
Ana avantaj Multimodal + fine-tuning kolaylığı Genel maturity, agent optimization
Ana dezavantaj Yeni ekosistem (Tinker platform) Multimodal yok

Aynı ağırlıkta iki model, benzer benchmark performansında. Ama farklı DNA:

  • Inkling-Small — Amerikan lab, multimodal, Apache 2.0, fully open ekosistem.
  • V4-Flash — Çinli lab, metin odaklı, MIT, agent workflow uzman.

Kim hangisini seçer?

Inkling-Small tercih edilir:

  • Görsel veya ses işleme gerekli.
  • Enterprise Amerikan compliance (jeopolitik nedenlerle Çinli model istenmiyorsa).
  • Tinker platform üzerinden hızlı fine-tuning yapmak.

V4-Flash tercih edilir:

  • Sadece text/code workflow’u.
  • Agent tasks (SWE-bench, DeepSWE, Terminal Bench).
  • En düşük API fiyatı.
  • Olgun DeepSeek ekosistemi ve topluluk desteği.

Frontier oyuncular için ne demek?

Bu iki hamle, kapalı frontier lab’lara (OpenAI, Anthropic, Google) mesaj gönderiyor:

OpenAI: GPT-5.6 Terra ($2/$12), Inkling-Small ve V4-Flash ile doğrudan rekabet ediyor. Dün fiyatları düşürdüler ama muhtemelen yeterli değil. Terra’nın Kimi K3 + V4-Flash + Inkling-Small üçlüsü karşısındaki değer önerisi zayıflıyor.

Anthropic: Claude Sonnet 5, agent workflow segmentinde hala güçlü. Ama V4-Flash’in agent performance sıçraması + fiyat avantajı, Sonnet 5’in enterprise adoption’unu baskılıyor. Anthropic’in cevabı muhtemelen “Claude Code + Claude Cowork ecosystem” premium’u üzerinden gelecek.

Google: Gemini 3.1 Pro, V4-Pro ile SWE-bench Verified’te eşit (%80.6). Ama fiyat cephesinde Google agresif değil. Gemini 3.6 Flash zaten zayıf performans ve pahalı fiyat ile eleştirilmişti. V4-Flash lansmanı bu tabloyu daha da kötüleştirdi.

Ekosistem etkisi: middleweight çağı

2024-2025 dönemi “bigger is better” çağıydı. GPT-4 → Claude 3.5 Opus → Gemini Ultra → GPT-5 → Claude Opus → Kimi K3 (2.8T). Her 6 ayda parametre boyutu 2-3x artıyordu.

2026 ikinci yarısı, farklı bir tema getiriyor: middleweight optimizasyonu. Aynı ekosistemde büyük ve küçük varyantların paralel gelişimi. Ama küçük olan, spesifik senaryolarda büyükü geçebiliyor.

Nedeni açık: enterprise müşteri, marj ve latency önemli. 2T parametreli bir modeli çalıştırmak $10-15/M token demek. 276B model $0.5-1/M token yapabiliyor. Aynı kalite için 10x maliyet farkı, karar açık.

Önümüzdeki aylarda benzer “small” versiyonlar bekleyebiliriz:

  • Kimi K3-Small — Moonshot, muhtemelen 500B civarı bir versiyon çıkaracak.
  • Qwen 3.7 Small — Alibaba’dan.
  • Claude Sonnet 6 — Anthropic’in orta segmentine odaklanma.

Sonuç: aynı gün iki kanıt

31 Temmuz 2026, açık ağırlıklı AI cephesinde önemli bir gün. Aynı gün içinde iki farklı lab, farklı yöntemlerle aynı ana mesajı verdi: daha ucuz, daha küçük modellerde frontier kalite mümkün.

Inkling-Small — distillation + mimari optimizasyon.

V4-Flash — post-training + agent specialization.

İkisi de aynı sonuca ulaşıyor: middleweight modeller (250-300B), spesifik senaryolarda 1T+ heavyweight’ları geçiyor. Cost/performance oranı radikal iyileşiyor.

Enterprise kullanıcı için pratik tavsiye: mevcut GPT-5.6 Terra veya Claude Sonnet 5 workflow’larınızı bu iki yeni modele karşı test edin. Muhtemelen benzer kalite, %60-80 tasarruf. Özellikle agent-heavy workload’lar için V4-Flash, multimodal workload’lar için Inkling-Small ilk deneme adayı.

Model provider cephesinde 2026 sonuna doğru middleweight savaşı sertleşecek. Winner: kullanıcı. Loser: klasik “bigger is better” retoriğine bağlı kalan kapalı frontier lab’lar.

Modelleri denemek için:

Comments

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir