Dünyanın en popüler açık kaynak browser agent’ı WebBrain, Amerikan ve Çinli açık ağırlıklı modelleri karşılaştıran yeni bir benchmark araştırması yayınladı. Sonuç: iki büyük AI boşluğu aynı anda kapanıyor.
Birincisi, Amerikan açık ağırlıklı cephesi. Thinking Machines ve Poolside’ın son sürümleri, ucuz ve self-host edilebilir model konuşmasını nihayet tek taraflı olmaktan çıkarıyor. İkincisi, Çinli lab’ların frontier tarafı: Kimi K3 ve GLM-5.2, Claude, Gemini, Grok ve GPT’nin işlettiği operasyonel bölgeye çok daha yakın konumdalar.
WebBrain ekibi 13 farklı OpenRouter modelini, aynı 100 vakalı browser-planner payload üzerinde test etti. Toplam 1,300 karşılaştırılabilir istek. Ve kritik yenilik: sonuçları Sonnet 5 (ya da başka herhangi bir tek model) “yargıç” olarak alınmadan sıraladılar. Bunun yerine peer consensus — her modelin diğer 12 modelle uyumu — kullanıldı.
Sonuç: cesaret verici, karmaşık ve tek-rakamlı bir leaderboard’dan çok daha yararlı. Ucuz Çinli text planlar first-action consensus’ta önde, Gemini 3.6 Flash operasyonel olarak “spotless”, Poolside Laguna XS gerçek bir Amerikan değer sonucu, Kimi K3 Sonnet 5’in dispatch güvenilirliğine yakın, ve Qwen 3.6 27B hala tek RTX 5090 workstation için tercih edilecek model.
Kısa özet
Ana bulgular:
- DeepSeek V4 Flash 0731 exact-action peer consensus’ta birinci, Tencent HY3 ikinci. İkisi de test edilen route’larda son derece ucuz text-only planlar — yani tam browser-agent sıralaması değil.
- Claude Sonnet 5 hala en temiz dispatcher basit harness ölçümlerine göre: 98 schema-valid action, 47 ideal tool tercihi — ikisi de gruptaki en iyi. Bu replay $7.22’ye mal oldu çünkü prompt-cache reads raporlanmadı.
- Gemini 3.6 Flash operasyonel sürpriz. 100 schema-valid call, exact peer consensus’ta dördüncü, 1.96 saniye median latency — ve metin, görsel, video, ses, dosya kabul ediyor.
- Poolside Laguna XS 2.1 Amerikan açık ağırlıklı sürpriz. 33B/3B-active text modeli yedinci, 1.15 saniye median, replay $0.073. Argument precision hala çalışmayı gerektiriyor ama artık “novelty row” değil.
- Kimi K3, Çinli frontier boşluğunun kapandığının en güçlü kanıtı. 97 valid call, 44 ideal tool choice — Sonnet’in 98/47’sine yakın. Ayrıca 100 vakada Sonnet’in tool family’siyle 86’sında uyuşuyor. Yavaş çalıştı ama.
- MiniMax M3 hala en dengeli Claude-benzeri value generalist, first-action ölçümünde Sonnet’e en yakın olmamasına rağmen. 1M context, image+video input, 23B-active MoE, 2.85s median latency, $0.504 replay.
- GPT-5.6’nın dismissal değil, iki-turn testi lazım. Luna ve özellikle Terra sık sık `get_accessibility_tree`’yi seçti — ihtiyatlı bir observation adımı. Bu first-action-only harness bunu cezalandırıyor.
- Qwen 3.6 27B hala tek RTX 5090 için tercih. Bu gruptaki tek dense 27B model, 32GB consumer GPU’ya rahatça quantize edilebilir, görsel ve video destekli, per-token API maliyeti yok.
Test edilen 13 model
“Open source” model tartışmalarında sık sık gevşek kullanılıyor. WebBrain, indirilebilir checkpoint’ler için open-weight tanımını kullanıp hosted closed modelleri ayrı tutuyor.
| Model | Lab / erişim | Mimari | Toplam / aktif parametre | Girdi (test edilen route) |
|---|---|---|---|---|
| GPT-5.6 Luna Pro | OpenAI, ABD, kapalı | Açıklanmadı | — | Text, image, file |
| MiniMax M3 | MiniMax, Çin, open-weight | Sparse-attention MoE | 428B / ~23B | Text, image, video |
| Claude Sonnet 5 | Anthropic, ABD, kapalı | Açıklanmadı | — | Text, image, file |
| Gemini 3.6 Flash | Google, ABD, kapalı | Açıklanmadı | — | Text, image, video, audio, file |
| Grok 4.5 | xAI, ABD, kapalı | Açıklanmadı | — | Text, image, file |
| Poolside Laguna XS 2.1 | Poolside, ABD, open-weight | Mixed-attention MoE | 33B / 3B | Yalnızca text |
| GLM-5.2 | Z.ai, Çin, open-weight | MoE + MLA + DSA | 744B / 40B | Yalnızca text (bu route’ta) |
| DeepSeek V4 Flash | DeepSeek, Çin, open-weight | MoE | 284B / 13B | Yalnızca text |
| Inkling Small | Thinking Machines, ABD, preview | MoE | 276B / 12B | Text, image, audio |
| Qwen 3.6 27B | Alibaba Qwen, Çin, open-weight | Dense | 27B / 27B | Text, image, video |
| Kimi K3 | Moonshot AI, Çin, open-weight | MoE | 2.8T / 104B | Text + image |
| GPT-5.6 Terra Pro | OpenAI, ABD, kapalı | Açıklanmadı | — | Text, image, file |
| Tencent HY3 | Tencent, Çin, open-weight | MoE | 295B + 3.8B MTP / 21B | Yalnızca text |
Parametre tablosu, “küçük” kavramının neden yanıltıcı olabileceğini gösteriyor. Laguna XS, 33B checkpoint’ten yalnızca 3B parametre aktif ediyor. Inkling Small, 276B toplam MoE ama 12B aktif. DeepSeek 284B’den 13B, HY3 295B’den 21B, MiniMax M3 428B’den ~23B aktif ediyor. Kimi K3 farklı bir altyapı sınıfında: 2.8 trilyon toplam, 104B aktif. Qwen ise diğer yönde outlier: 27B parametrenin hepsi participation gösteriyor, ama model tümüyle quantize sonrası tek-kutu local inference için pratik yeterlilikte.
Consensus rank, Sonnet rank değil
Her vaka için, bir model diğer 12 modelle karşılaştırıldı. Ana skor: 1,200 pairwise karşılaştırmanın, iki modelin aynı normalize edilmiş action seçtiği oranı (tool name + normalize edilmiş argümanlar). İkincil skor sadece tool name karşılaştırıyor.
Bu leave-one-out consensus. Sonnet, başka bir model puanlandığında bir peer oyu katkı yapıyor — her model gibi — ve kendini not veremez. Hiçbir model referans olarak imtiyazlı değil.
| Sıra | Model | Exact-action consensus | Tool-name consensus | Schema-valid / emitted | Ideal tool | Median | Replay maliyet |
|---|---|---|---|---|---|---|---|
| 1 | DeepSeek V4 Flash 0731 | %51.8 | %79.8 | 90/90 | 39 | 1.56s | $0.050 |
| 2 | Tencent HY3 | %48.3 | %78.3 | 90/90 | 41 | 5.12s | $0.246 |
| 3 | Claude Sonnet 5 | %44.0 | %74.6 | 98/98 | 47 | 4.06s | $7.222 |
| 4 | Gemini 3.6 Flash | %43.5 | %74.7 | 100/100 | 36 | 1.96s | $1.209 |
| 5 | GLM-5.2 | %43.3 | %76.3 | 86/89 | 39 | 1.73s | $0.545 |
| 6 | MiniMax M3 | %41.6 | %74.8 | 86/89 | 33 | 2.85s | $0.504 |
| 7 | Poolside Laguna XS 2.1 | %41.3 | %73.5 | 88/89 | 31 | 1.15s | $0.073 |
| 8 | Kimi K3 | %41.0 | %78.4 | 97/97 | 44 | 7.54s | $1.563 |
| 9 | Qwen 3.6 27B | %38.1 | %74.3 | 83/92 | 36 | 2.23s | $0.670 |
| 10 | xAI Grok 4.5 | %34.8 | %79.7 | 94/94 | 36 | 2.61s | $2.274 |
| 11 | Inkling Small | %34.8 | %74.2 | 84/84 | 32 | 1.05s | $0.243 |
| 12 | GPT-5.6 Luna Pro | %13.5 | %75.2 | 89/89 | 32 | 5.12s | $0.228 |
| 13 | GPT-5.6 Terra Pro | %8.6 | %58.8 | 94/94 | 12 | 4.91s | $2.238 |
Bazı pairwise tool-family agreement’lar özellikle güçlü:
| İkili | Aynı tool family |
|---|---|
| GLM-5.2 ↔ DeepSeek V4 Flash | %87 |
| Claude Sonnet 5 ↔ Kimi K3 | %86 |
| DeepSeek V4 Flash ↔ Grok 4.5 | %86 |
| Kimi K3 ↔ Tencent HY3 | %85 |
| DeepSeek V4 Flash ↔ Tencent HY3 | %84 |
Ana frontier sonuç: Kimi K3 ve Sonnet 5, 100 prompt’un 86’sında bağımsız olarak aynı ilk tool’u seçtiler.
Kimi K3 frontier-gap sonucu
Kimi K3 çok büyük: 2.8T toplam parametre, 104B aktif, 93 katman, 1M context mimarisi. Route, 100 vakanın 97’sini valid tool call ile tamamladı, 44 ideal tool seçti, Sonnet’in tool family’siyle 86 vakada uyuştu.
Sonnet hala temel dispatch metriklerinde önde — 98 valid call ve 47 ideal tool — ve bu örneklemede median’da 3 saniyeden fazla hızlıydı. Kimi’nin 7.54 saniyelik median’ı ve 26.15 saniyelik p95’i gruptaki en yavaşıydı. Ama kalite boşluğu artık kategorisel değil. Bu görevde Kimi, daha kötü serving profili olan bir frontier multimodal peer gibi görünüyor — ayrı bir model tier değil.
Maliyet dikkatli yazım gerektiriyor. Kimi’nin gözlemlenen replay maliyeti $1.563, Sonnet’in $7.222 — ama bu Kimi’nin daha düşük list fiyatı olduğu anlamına gelmez. Test sırasında OpenRouter, Kimi’yi $3/$15 per milyon input/output token, Sonnet 5’i tanıtım $2/$10 fiyatıyla listeliyordu. Kimi’nin çalışması prompt token’larının %91’ini cache reads olarak raporladı; Sonnet hiç raporlamadı. Workload faturası Kimi’yi avantajlı çıkardı çünkü route tekrarlayan tool-schema input’u cache’ledi.
MiniMax M3: hala en dengeli Claude-benzeri value generalist
WebBrain ekibinin subjektif ürün görüşü hala MiniMax M3’ü en cazip Claude-benzeri value generalist olarak konumlandırıyor. Ama bu, bu tabloyu kazandığı anlamına gelmez.
M3’ün gerekçesi geniş:
- 428B toplam parametre, sadece ~23B aktif per token;
- Test edilen route’ta text, image, video input;
- Yaklaşık 1M token context;
- 2.85 saniyelik median latency;
- 89 emitted call, 86 schema-valid;
- $0.504 gözlemlenen replay maliyeti.
M3 consensus winner değil ve first action’larda Sonnet’e en yakın değil, ama Claude-benzeri agent davranışı, multimodality, latency, context ve hosted cost dengesinde en iyi genel karışım. Daha uzun trajectory&rler, prose kalitesi, görsel iş ve recovery davranışı farklı bir benchmark gerektiriyor.
GPT-5.6 dikkatli, basitçe fail etmiyor
Ham rank GPT-5.6 Luna ve Terra’yı en alta koyuyor. Ama günlük kullanımda bu şekilde hissettirmezler. WebBrain’in empirik gündelik deneyiminde GPT-5.6 çok iyi — bazen aşırı iyi — performans gösteriyor; state inspection, tool result alma ve trajectory sürdürme mümkün olduğunda.
| GPT-5.6 route | get_accessibility_tree ilk | Direkt action vakaları | Direct action’lar arasında ideal tool |
|---|---|---|---|
| Luna Pro | 54 | 46 | 32/46 (%69.6) |
| Terra Pro | 80 | 20 | 12/20 (%60.0) |
Suite’in ideal first action’ı hiçbir zaman `get_accessibility_tree` değil; prompt’ta zaten mevcut state’ten hareket etmesini bekliyor. GPT-5.6 sık sık yine de fresh accessibility snapshot istiyor. Diğer modeller sık sık aynı fikirde: Luna’nın observation adımı 54 tree call’ının 43’ünde peer plurality ile eşleşti. Terra’nın 80’in 46’sında eşleşti. Gemini 59’un 46’sında, Grok 49’un 45’inde eşleşti.
Doğru follow-up: observation-tolerant iki-turn evaluation. Bir de API mismatch var: OpenAI’ın reasoning guide’ı, reasoning modellerinin Chat Completions yerine Responses API üzerinden daha iyi intelligence ve performance elde ettiğini söylüyor.
Reliability: mükemmel API delivery mükemmel tool delivery değil
13 karşılaştırılabilir sonuç seti, her HTTP isteğini final API error olmadan tamamladı. Tool-level dispatch daha az uniform.
| Model | Tool emit edilmedi | Schema-invalid call | Ana defekt |
|---|---|---|---|
| Gemini 3.6 Flash | 0 | 0 | — |
| Claude Sonnet 5 | 2 | 0 | — |
| Kimi K3 | 3 | 0 | — |
| GPT-5.6 Terra Pro | 6 | 0 | — |
| xAI Grok 4.5 | 6 | 0 | — |
| Qwen 3.6 27B | 8 | 9 | Çoğunlukla quoted accessibility filter |
| DeepSeek V4 Flash | 10 | 0 | — |
| Tencent HY3 | 10 | 0 | — |
| GPT-5.6 Luna Pro | 11 | 0 | — |
| MiniMax M3 | 11 | 3 | Invalid enum/options/key |
| GLM-5.2 | 11 | 3 | Stray quote accessibility filter’da |
| Poolside Laguna XS 2.1 | 11 | 1 | Invalid press_keys key |
| Inkling Small | 16 | 0 | — |
Maliyet: list price ve workload price farklı hikayeler anlatıyor
| Model | Input / output per 1M token | Cache’lenen prompt tokens | Gerçek 100-call maliyet |
|---|---|---|---|
| DeepSeek V4 Flash 0731 | $0.09 / $0.18 | %96.8 | $0.050 |
| Poolside Laguna XS 2.1 | $0.06 / $0.12 | %98.6 | $0.073 |
| GPT-5.6 Luna Pro | $0.10 / $0.60 | %80.0 | $0.228 |
| Inkling Small | $0.50 / $1.20 | %98.3 | $0.243 |
| Tencent HY3 | $0.132 / $0.528 | %32.6 | $0.246 |
| MiniMax M3 | $0.30 / $1.20 | %36.3 | $0.504 |
| GLM-5.2 | $0.42 / $1.32 | %91.0 | $0.545 |
| Qwen 3.6 27B | $0.30 / $2.00 | %87.4 | $0.670 |
| Gemini 3.6 Flash | $1.50 / $7.50 | %75.0 | $1.209 |
| Kimi K3 | $3.00 / $15.00 | %91.0 | $1.563 |
| GPT-5.6 Terra Pro | $1.00 / $6.00 | %80.3 | $2.238 |
| xAI Grok 4.5 | $2.00 / $6.00 | %62.9 | $2.274 |
| Claude Sonnet 5 | $2.00 / $10.00 tanıtım | %0 | $7.222 |
13 karşılaştırılabilir replay toplamda $17.065. Sonnet tek başına o faturanın %42.3’ünü aldı. DeepSeek en yüksek exact-consensus skorunu Sonnet’in gözlemlenen maliyetinin %0.7’sinde teslim etti — ama bu oran büyük ölçüde DeepSeek’in %96.8 cache-read payına ve Sonnet’in sıfır cache’ine bağlı.
Amerikan open weights geri döndü
Laguna XS 2.1, Amerikan open-weight iddiasını çok daha somut hale getiriyor. Poolside’ın model kartı, 33B-total 3B-active MoE modeli, 40 katman, 256 uzman + 1 shared expert, 262K context, indirilebilir quantization’lar ve 36GB RAM’li Mac üzerinde lokal operasyon tanımlıyor. Aynı-payload run’ında yedinci sırada, 88 schema-valid call, 1.15 saniye median, $0.073 maliyet.
Bu, olağanüstü verimli bir satır. Sadece text-to-text kod uzmanı, 31 ideal tool seçiyor, sadece 5 exact ideal action’a ulaşıyor. Bir press_keys argümanı schema-invalid. Yani Laguna XS universal browser modeli veya argument precision şampiyonu değil. Ama bu, aynı anda rekabetçi, hızlı, lokal olarak plausible ve host etmesi neredeyse bedava olan bu cohorttaki ilk compact Amerikan open-weight modeli.
Inkling Small exact consensus’ta on birinci, 84 tool call yayınlıyor, skor şampiyonu değil. Önemi farklı bir capability surface’ından geliyor: text + image + audio input ile 276B-total/12B-active open-weight preview, 1.05 saniye median, $0.243 maliyet.
Boşluk kapanıyor. Kapanmadı. Çinli open-weight modeller ilk iki pozisyonu ve top 9’un 6’sını elinde tutuyor, Kimi ise en güçlü open-weight multimodal frontier satırını sağlıyor. Ama Poolside artık MiniMax M3 ile Kimi K3 arasında $0.073’lük bir Amerikan modeli oturtuyor exact peer consensus’ta. Bu, birkaç model kuşağı önce hayal edilemezdi.
Çinli frontier modeller farklı bir boşluğu kapatıyor
İkinci boşluk, Çinli lab’lar ile lider kapalı ABD frontier API’leri arasında. Bu test üç tür kanıt sağlıyor:
- Kimi K3 Sonnet’in dispatch reliability’sine neredeyse ulaşıyor ve first tool’u %86 vakada uyuşuyor.
- GLM-5.2 her modelde exact-ideal count’ta lider, peer consensus’ta beşinci, ve vision’a kredibil released path’i var.
- DeepSeek V4 Flash ve HY3, güçlü planner agreement’ını commodity-priced inference’a çeviriyor.
Bu convergence, equivalence değil. Ama “Çinli modeller daha ucuz ama açıkça bir tier geride” artık yararlı bir default değil.
Her iş için ne deploy ederdik?
| Deployment ihtiyacı | Bu grupdan tercih | Neden |
|---|---|---|
| En ucuz hosted text-state planner | DeepSeek V4 Flash | En yüksek exact consensus, 1.56s median, $0.050 |
| İhtiyatlı text-only alternatif | Tencent HY3 | İkinci consensus, 41 ideal tool, temiz schema |
| Kapalı multimodal dispatch reliability | Claude Sonnet 5 | 98 valid call, 47 ideal tool |
| Hızlı kapalı multimodal loop | Gemini 3.6 Flash | 100 valid call, 1.96s median, geniş modaliteler |
| Open-weight multimodal frontier | Kimi K3 | 97 valid, 44 ideal, %86 tool agreement Sonnet’le |
| En dengeli Claude-benzeri value generalist | MiniMax M3 | Image/video, 1M context, 23B active |
| Compact ABD open-weight text/kod | Poolside Laguna XS 2.1 | 33B/3B, 1.15s median, $0.073 |
| Yüksek hacim iki-turn testi için | GPT-5.6 Luna | Çok düşük fiyat; direct action’lar sensible |
| Tek RTX 5090, private ve offline | Qwen 3.6 27B quantized | Dense 27B, multimodal, pratik 32GB deployment |
Son satır vurgu hak ediyor. Qwen 3.6 27B, bu setteki consumer RTX 5090 box’ında çalıştırılabilecek en iyi model. Bu grup içindeki tek dense 27B model, gerçekçi olarak 32GB consumer GPU’ya quantize edilebilir, vision ve video destekli, API token faturası yok.
Sonuç: haritayı gör, tek rakamı değil
Bu benchmark tek bir universal winner üretmiyor. Çok daha ilginç bir harita üretiyor.
DeepSeek V4 Flash ve Tencent HY3, reference-free first-action consensus’ta lider, ama test edilen route’ları text-only. Claude Sonnet 5, en yüksek gözlemlenen replay maliyetinde ideal-tool lideri. Gemini 3.6 Flash dördüncü, perfect 100-call validity ve geniş multimodality ile. GLM-5.2 beşinci, exact-ideal action’larda lider. Kimi K3, dispatch davranışında Sonnet’e yeterince yakın — Çinli frontier convergence somut hale geliyor. MiniMax M3 hala en dengeli Claude-benzeri multimodal value generalist.
Jeopolitik sonuç aynı ölçüde net olmalı: Amerikan ve Çinli open-weight ekosistemleri yakınlaşıyor çünkü Laguna XS artık 33B/3B-active $0.073 text planner olarak yedinci sırada ve Inkling multimodal breadth sağlıyor. Çinli ekosistem hala bu belirli planner tablosunda önde ve daha güçlü open-weight multimodal frontier var. Aynı zamanda Çinli lab’lar frontier-model boşluğunu kapatıyor: Kimi K3 Sonnet’in action reliability’sine yaklaşıyor; GLM, DeepSeek ve Tencent güçlü planlamayı dramatik daha ucuz yapıyor.
Hosted sistem için: modality, latency, cache behavior ve tool reliability’e göre seçin — milliyet veya tek bir benchmark rakamına göre değil. Consumer workstation için: Qwen 3.6 27B hala tek RTX 5090 için en ikna edici model. En büyük veya en yüksek skorlu route değil. Ama capability, modality, ownership ve donanım gereksinimlerinin bir insanın gerçekten masaüstüne koyabileceği bir makinede buluştuğu model.
Detaylı benchmark methodolojisi, raw sonuçlar ve tam analiz için: webbrain.one/blog/american-chinese-open-model-frontier-gap-benchmark.
WebBrain MIT lisanslıdır ve GitHub’da açıktır.

Bir yanıt yazın