Bugün Qwen 3.8-27B yayınlandı ve ilk benchmark’lar dikkat çekici bir tablo ortaya koyuyor: aynı gün içinde karşılaştırma yapılan iki farklı model — Poolside’ın Laguna S 2.1’i ve DeepSeek’in güncellenmiş V4 Flash 0731 checkpoint’i — birbirinden çok farklı sonuçlar veriyor. Qwen 3.8-27B küçük dense bir model olarak MoE devlerine kafa tutarken, DeepSeek’in 0731 güncellemesi ise agentic coding’de resmen sıçrama yapmış durumda.
Coding / agent benchmark’ları
| Benchmark | Qwen 3.8-27B | Laguna S 2.1 | DeepSeek V4 Flash 0731 | Kazanan |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 73.0 | 70.2 | 82.7 | DeepSeek |
| DeepSWE | 42.2¹ | 40.4 | 54.4 | DeepSeek |
| SWE-bench Pro | 61.7 | 59.4 | — | Qwen* |
| NL2Repo | 42.3 | — | 54.2 | DeepSeek |
| Toolathlon Verified | — | 49.7 | 70.3 | DeepSeek |
| Agents’ Last Exam (Pass@1) | 20.4 | — | 25.2 | DeepSeek² |
Qwen’in resmi kartı 73.0 Terminal-Bench 2.1, 61.7 SWE-bench Pro, 42.3 NL2Repo ve 42.2 DeepSWE 1.1 rapor ediyor. Poolside, Laguna için 70.2 Terminal-Bench 2.1, 59.4 SWE-bench Pro, 40.4 DeepSWE ve 49.7 Toolathlon bildiriyor. DeepSeek ise 0731 checkpoint’i için 82.7 Terminal-Bench 2.1, 54.2 NL2Repo, 54.4 DeepSWE ve 70.3 Toolathlon açıklıyor.
¹ Qwen kendi testini açıkça DeepSWE 1.1 olarak etiketliyor, yani üç DeepSWE rakamını birebir aynı değerlendirme seti olarak okumak riskli olabilir.
² Aynı şekilde agent benchmark’larında bazı vendor değerlendirmeleri farklı harness/scaffold kullanıyor. Yön anlamlı ama küçük puan farklarını fazla yorumlamamak lazım.
En çarpıcı sonuç: Terminal-Bench
- DeepSeek 0731: 82.7
- Qwen 3.8-27B: 73.0
- Laguna S 2.1: 70.2
Yani DeepSeek, Qwen’i 9.7 puan, Laguna’yı 12.5 puan farkla geçiyor. Qwen ise Laguna’yı sadece 2.8 puan farkla geçiyor — ki bu, model boyutları göz önüne alındığında oldukça dikkat çekici. Qwen 27B parametrelik dense bir model. Laguna ise 118B toplam / ~8B aktif parametreli bir MoE.
DeepSeek 0731’in sıçraması özellikle çarpıcı çünkü önceki Flash checkpoint’i Terminal-Bench 2.1’de sadece 61.8 alıyordu. 0731 checkpoint’i bunu 82.7’ye taşımış — üstelik DeepSeek bunu yeni ve daha büyük bir model olarak sunmadan, salt post-training güncellemesiyle yapmış.
Qwen 3.8-27B yine de son derece etkileyici
| Benchmark | Qwen 3.8-27B |
|---|---|
| Terminal-Bench 2.1 | 73.0 |
| SWE-bench Pro | 61.7 |
| NL2Repo | 42.3 |
| DeepSWE 1.1 | 42.2 |
| QwenSWEBench | 79.0 |
| LiveCodeBench v6 | 90.3 |
| GPQA Diamond | 89.2 |
| HLE | 30.8 |
| IFBench | 79.5 |
Qwen 3.6-27B ile karşılaştırıldığında sıçrama gerçekten büyük: Terminal-Bench 63.4 → 73.0, SWE-Pro 53.5 → 61.7, DeepSWE ise 13.3 → 42.2. Aynı nominal dense parametre sayısında bu kadar büyük bir iyileştirme az görülür.
Ne Laguna’da ne DeepSeek 0731’de olan bir şey: native multimodal
Qwen 3.8-27B’nin model kartı görsel ve video desteğini açıkça listeliyor, agentic vision sonuçları da şaşırtıcı derecede güçlü:
| Benchmark | Qwen 3.8-27B |
|---|---|
| OSWorld-Verified | 84.3 |
| WebArena-Verified | 64.8 |
| AndroidWorld | 81.9 |
| SWE-MM | 38.6 |
| Vision2Web | 62.9 |
Qwen kendini görsel encoder’lı 27B causal LM olarak tanımlıyor. Laguna S 2.1 modalitesini açıkça text-to-text olarak listeliyor, DeepSeek 0731 ise text-generation modeli olarak yayınlandı.
Sıralama
Saf coding / terminal agent için:
- DeepSeek V4 Flash 0731 — açık ara
- Qwen 3.8-27B
- Laguna S 2.1
Model boyutuna göre performans için:
- Qwen 3.8-27B ≈ Laguna S 2.1 (DeepSeek çok daha ağır)
Görsel + kod + tool kullanımı gereken genel bir local browser agent için:
- Qwen 3.8-27B — kolaylıkla
Sonuç
En çarpıcı nokta şu: Laguna S 2.1, ~8B aktif parametre için zaten alışılmadık derecede iyiydi, ama Qwen 3.8-27B onu MoE’ye özgü inference avantajlarına özel önem vermeyen kullanıcılar için büyük ölçüde cazibesiz bıraktı. Aynı anda DeepSeek 0731, saf metin/kod-agent zekasında ikisinin de epey üzerine çıktı. Üç model de aynı gün gündemdeydi ama hikayeleri çok farklı: Qwen genelci ve multimodal bir sıçrama, DeepSeek ise post-training ile elde edilen sessiz ama devasa bir agentic coding atılımı.

Bir yanıt yazın