Qwen 3.8-27B, Laguna S 2.1 ve DeepSeek V4 Flash 0731 karşılaştırması: aynı gün üç farklı hikaye — DeepSeek sessiz bir sıçrama yaptı, Qwen multimodal’de öne çıktı

Bugün Qwen 3.8-27B yayınlandı ve ilk benchmark’lar dikkat çekici bir tablo ortaya koyuyor: aynı gün içinde karşılaştırma yapılan iki farklı model — Poolside’ın Laguna S 2.1’i ve DeepSeek’in güncellenmiş V4 Flash 0731 checkpoint’i — birbirinden çok farklı sonuçlar veriyor. Qwen 3.8-27B küçük dense bir model olarak MoE devlerine kafa tutarken, DeepSeek’in 0731 güncellemesi ise agentic coding’de resmen sıçrama yapmış durumda.

Coding / agent benchmark’ları

Benchmark Qwen 3.8-27B Laguna S 2.1 DeepSeek V4 Flash 0731 Kazanan
Terminal-Bench 2.1 73.0 70.2 82.7 DeepSeek
DeepSWE 42.2¹ 40.4 54.4 DeepSeek
SWE-bench Pro 61.7 59.4 Qwen*
NL2Repo 42.3 54.2 DeepSeek
Toolathlon Verified 49.7 70.3 DeepSeek
Agents’ Last Exam (Pass@1) 20.4 25.2 DeepSeek²

Qwen’in resmi kartı 73.0 Terminal-Bench 2.1, 61.7 SWE-bench Pro, 42.3 NL2Repo ve 42.2 DeepSWE 1.1 rapor ediyor. Poolside, Laguna için 70.2 Terminal-Bench 2.1, 59.4 SWE-bench Pro, 40.4 DeepSWE ve 49.7 Toolathlon bildiriyor. DeepSeek ise 0731 checkpoint’i için 82.7 Terminal-Bench 2.1, 54.2 NL2Repo, 54.4 DeepSWE ve 70.3 Toolathlon açıklıyor.

¹ Qwen kendi testini açıkça DeepSWE 1.1 olarak etiketliyor, yani üç DeepSWE rakamını birebir aynı değerlendirme seti olarak okumak riskli olabilir.
² Aynı şekilde agent benchmark’larında bazı vendor değerlendirmeleri farklı harness/scaffold kullanıyor. Yön anlamlı ama küçük puan farklarını fazla yorumlamamak lazım.

En çarpıcı sonuç: Terminal-Bench

  • DeepSeek 0731: 82.7
  • Qwen 3.8-27B: 73.0
  • Laguna S 2.1: 70.2

Yani DeepSeek, Qwen’i 9.7 puan, Laguna’yı 12.5 puan farkla geçiyor. Qwen ise Laguna’yı sadece 2.8 puan farkla geçiyor — ki bu, model boyutları göz önüne alındığında oldukça dikkat çekici. Qwen 27B parametrelik dense bir model. Laguna ise 118B toplam / ~8B aktif parametreli bir MoE.

DeepSeek 0731’in sıçraması özellikle çarpıcı çünkü önceki Flash checkpoint’i Terminal-Bench 2.1’de sadece 61.8 alıyordu. 0731 checkpoint’i bunu 82.7’ye taşımış — üstelik DeepSeek bunu yeni ve daha büyük bir model olarak sunmadan, salt post-training güncellemesiyle yapmış.

Qwen 3.8-27B yine de son derece etkileyici

Benchmark Qwen 3.8-27B
Terminal-Bench 2.1 73.0
SWE-bench Pro 61.7
NL2Repo 42.3
DeepSWE 1.1 42.2
QwenSWEBench 79.0
LiveCodeBench v6 90.3
GPQA Diamond 89.2
HLE 30.8
IFBench 79.5

Qwen 3.6-27B ile karşılaştırıldığında sıçrama gerçekten büyük: Terminal-Bench 63.4 → 73.0, SWE-Pro 53.5 → 61.7, DeepSWE ise 13.3 → 42.2. Aynı nominal dense parametre sayısında bu kadar büyük bir iyileştirme az görülür.

Ne Laguna’da ne DeepSeek 0731’de olan bir şey: native multimodal

Qwen 3.8-27B’nin model kartı görsel ve video desteğini açıkça listeliyor, agentic vision sonuçları da şaşırtıcı derecede güçlü:

Benchmark Qwen 3.8-27B
OSWorld-Verified 84.3
WebArena-Verified 64.8
AndroidWorld 81.9
SWE-MM 38.6
Vision2Web 62.9

Qwen kendini görsel encoder’lı 27B causal LM olarak tanımlıyor. Laguna S 2.1 modalitesini açıkça text-to-text olarak listeliyor, DeepSeek 0731 ise text-generation modeli olarak yayınlandı.

Sıralama

Saf coding / terminal agent için:

  1. DeepSeek V4 Flash 0731 — açık ara
  2. Qwen 3.8-27B
  3. Laguna S 2.1

Model boyutuna göre performans için:

  1. Qwen 3.8-27B ≈ Laguna S 2.1 (DeepSeek çok daha ağır)

Görsel + kod + tool kullanımı gereken genel bir local browser agent için:

  1. Qwen 3.8-27B — kolaylıkla

Sonuç

En çarpıcı nokta şu: Laguna S 2.1, ~8B aktif parametre için zaten alışılmadık derecede iyiydi, ama Qwen 3.8-27B onu MoE’ye özgü inference avantajlarına özel önem vermeyen kullanıcılar için büyük ölçüde cazibesiz bıraktı. Aynı anda DeepSeek 0731, saf metin/kod-agent zekasında ikisinin de epey üzerine çıktı. Üç model de aynı gün gündemdeydi ama hikayeleri çok farklı: Qwen genelci ve multimodal bir sıçrama, DeepSeek ise post-training ile elde edilen sessiz ama devasa bir agentic coding atılımı.

Comments

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir