Çinliler ve Amerikalılar kıran kırana yapay zeka mücadelesi: WebBrain’in 13 model üzerinde yaptığı browser-agent benchmark’ından iki büyük bulgu

Dünyanın en popüler açık kaynak browser agent’ı WebBrain, Amerikan ve Çinli açık ağırlıklı modelleri karşılaştıran yeni bir benchmark araştırması yayınladı. Sonuç: iki büyük AI boşluğu aynı anda kapanıyor.

Birincisi, Amerikan açık ağırlıklı cephesi. Thinking Machines ve Poolside’ın son sürümleri, ucuz ve self-host edilebilir model konuşmasını nihayet tek taraflı olmaktan çıkarıyor. İkincisi, Çinli lab’ların frontier tarafı: Kimi K3 ve GLM-5.2, Claude, Gemini, Grok ve GPT’nin işlettiği operasyonel bölgeye çok daha yakın konumdalar.

WebBrain ekibi 13 farklı OpenRouter modelini, aynı 100 vakalı browser-planner payload üzerinde test etti. Toplam 1,300 karşılaştırılabilir istek. Ve kritik yenilik: sonuçları Sonnet 5 (ya da başka herhangi bir tek model) “yargıç” olarak alınmadan sıraladılar. Bunun yerine peer consensus — her modelin diğer 12 modelle uyumu — kullanıldı.

Sonuç: cesaret verici, karmaşık ve tek-rakamlı bir leaderboard’dan çok daha yararlı. Ucuz Çinli text planlar first-action consensus’ta önde, Gemini 3.6 Flash operasyonel olarak “spotless”, Poolside Laguna XS gerçek bir Amerikan değer sonucu, Kimi K3 Sonnet 5’in dispatch güvenilirliğine yakın, ve Qwen 3.6 27B hala tek RTX 5090 workstation için tercih edilecek model.

Kısa özet

Ana bulgular:

  • DeepSeek V4 Flash 0731 exact-action peer consensus’ta birinci, Tencent HY3 ikinci. İkisi de test edilen route’larda son derece ucuz text-only planlar — yani tam browser-agent sıralaması değil.
  • Claude Sonnet 5 hala en temiz dispatcher basit harness ölçümlerine göre: 98 schema-valid action, 47 ideal tool tercihi — ikisi de gruptaki en iyi. Bu replay $7.22’ye mal oldu çünkü prompt-cache reads raporlanmadı.
  • Gemini 3.6 Flash operasyonel sürpriz. 100 schema-valid call, exact peer consensus’ta dördüncü, 1.96 saniye median latency — ve metin, görsel, video, ses, dosya kabul ediyor.
  • Poolside Laguna XS 2.1 Amerikan açık ağırlıklı sürpriz. 33B/3B-active text modeli yedinci, 1.15 saniye median, replay $0.073. Argument precision hala çalışmayı gerektiriyor ama artık “novelty row” değil.
  • Kimi K3, Çinli frontier boşluğunun kapandığının en güçlü kanıtı. 97 valid call, 44 ideal tool choice — Sonnet’in 98/47’sine yakın. Ayrıca 100 vakada Sonnet’in tool family’siyle 86’sında uyuşuyor. Yavaş çalıştı ama.
  • MiniMax M3 hala en dengeli Claude-benzeri value generalist, first-action ölçümünde Sonnet’e en yakın olmamasına rağmen. 1M context, image+video input, 23B-active MoE, 2.85s median latency, $0.504 replay.
  • GPT-5.6’nın dismissal değil, iki-turn testi lazım. Luna ve özellikle Terra sık sık `get_accessibility_tree`’yi seçti — ihtiyatlı bir observation adımı. Bu first-action-only harness bunu cezalandırıyor.
  • Qwen 3.6 27B hala tek RTX 5090 için tercih. Bu gruptaki tek dense 27B model, 32GB consumer GPU’ya rahatça quantize edilebilir, görsel ve video destekli, per-token API maliyeti yok.

Test edilen 13 model

“Open source” model tartışmalarında sık sık gevşek kullanılıyor. WebBrain, indirilebilir checkpoint’ler için open-weight tanımını kullanıp hosted closed modelleri ayrı tutuyor.

Model Lab / erişim Mimari Toplam / aktif parametre Girdi (test edilen route)
GPT-5.6 Luna Pro OpenAI, ABD, kapalı Açıklanmadı Text, image, file
MiniMax M3 MiniMax, Çin, open-weight Sparse-attention MoE 428B / ~23B Text, image, video
Claude Sonnet 5 Anthropic, ABD, kapalı Açıklanmadı Text, image, file
Gemini 3.6 Flash Google, ABD, kapalı Açıklanmadı Text, image, video, audio, file
Grok 4.5 xAI, ABD, kapalı Açıklanmadı Text, image, file
Poolside Laguna XS 2.1 Poolside, ABD, open-weight Mixed-attention MoE 33B / 3B Yalnızca text
GLM-5.2 Z.ai, Çin, open-weight MoE + MLA + DSA 744B / 40B Yalnızca text (bu route’ta)
DeepSeek V4 Flash DeepSeek, Çin, open-weight MoE 284B / 13B Yalnızca text
Inkling Small Thinking Machines, ABD, preview MoE 276B / 12B Text, image, audio
Qwen 3.6 27B Alibaba Qwen, Çin, open-weight Dense 27B / 27B Text, image, video
Kimi K3 Moonshot AI, Çin, open-weight MoE 2.8T / 104B Text + image
GPT-5.6 Terra Pro OpenAI, ABD, kapalı Açıklanmadı Text, image, file
Tencent HY3 Tencent, Çin, open-weight MoE 295B + 3.8B MTP / 21B Yalnızca text

Parametre tablosu, “küçük” kavramının neden yanıltıcı olabileceğini gösteriyor. Laguna XS, 33B checkpoint’ten yalnızca 3B parametre aktif ediyor. Inkling Small, 276B toplam MoE ama 12B aktif. DeepSeek 284B’den 13B, HY3 295B’den 21B, MiniMax M3 428B’den ~23B aktif ediyor. Kimi K3 farklı bir altyapı sınıfında: 2.8 trilyon toplam, 104B aktif. Qwen ise diğer yönde outlier: 27B parametrenin hepsi participation gösteriyor, ama model tümüyle quantize sonrası tek-kutu local inference için pratik yeterlilikte.

Consensus rank, Sonnet rank değil

Her vaka için, bir model diğer 12 modelle karşılaştırıldı. Ana skor: 1,200 pairwise karşılaştırmanın, iki modelin aynı normalize edilmiş action seçtiği oranı (tool name + normalize edilmiş argümanlar). İkincil skor sadece tool name karşılaştırıyor.

Bu leave-one-out consensus. Sonnet, başka bir model puanlandığında bir peer oyu katkı yapıyor — her model gibi — ve kendini not veremez. Hiçbir model referans olarak imtiyazlı değil.

Sıra Model Exact-action consensus Tool-name consensus Schema-valid / emitted Ideal tool Median Replay maliyet
1 DeepSeek V4 Flash 0731 %51.8 %79.8 90/90 39 1.56s $0.050
2 Tencent HY3 %48.3 %78.3 90/90 41 5.12s $0.246
3 Claude Sonnet 5 %44.0 %74.6 98/98 47 4.06s $7.222
4 Gemini 3.6 Flash %43.5 %74.7 100/100 36 1.96s $1.209
5 GLM-5.2 %43.3 %76.3 86/89 39 1.73s $0.545
6 MiniMax M3 %41.6 %74.8 86/89 33 2.85s $0.504
7 Poolside Laguna XS 2.1 %41.3 %73.5 88/89 31 1.15s $0.073
8 Kimi K3 %41.0 %78.4 97/97 44 7.54s $1.563
9 Qwen 3.6 27B %38.1 %74.3 83/92 36 2.23s $0.670
10 xAI Grok 4.5 %34.8 %79.7 94/94 36 2.61s $2.274
11 Inkling Small %34.8 %74.2 84/84 32 1.05s $0.243
12 GPT-5.6 Luna Pro %13.5 %75.2 89/89 32 5.12s $0.228
13 GPT-5.6 Terra Pro %8.6 %58.8 94/94 12 4.91s $2.238

Bazı pairwise tool-family agreement’lar özellikle güçlü:

İkili Aynı tool family
GLM-5.2 ↔ DeepSeek V4 Flash %87
Claude Sonnet 5 ↔ Kimi K3 %86
DeepSeek V4 Flash ↔ Grok 4.5 %86
Kimi K3 ↔ Tencent HY3 %85
DeepSeek V4 Flash ↔ Tencent HY3 %84

Ana frontier sonuç: Kimi K3 ve Sonnet 5, 100 prompt’un 86’sında bağımsız olarak aynı ilk tool’u seçtiler.

Kimi K3 frontier-gap sonucu

Kimi K3 çok büyük: 2.8T toplam parametre, 104B aktif, 93 katman, 1M context mimarisi. Route, 100 vakanın 97’sini valid tool call ile tamamladı, 44 ideal tool seçti, Sonnet’in tool family’siyle 86 vakada uyuştu.

Sonnet hala temel dispatch metriklerinde önde — 98 valid call ve 47 ideal tool — ve bu örneklemede median’da 3 saniyeden fazla hızlıydı. Kimi’nin 7.54 saniyelik median’ı ve 26.15 saniyelik p95’i gruptaki en yavaşıydı. Ama kalite boşluğu artık kategorisel değil. Bu görevde Kimi, daha kötü serving profili olan bir frontier multimodal peer gibi görünüyor — ayrı bir model tier değil.

Maliyet dikkatli yazım gerektiriyor. Kimi’nin gözlemlenen replay maliyeti $1.563, Sonnet’in $7.222 — ama bu Kimi’nin daha düşük list fiyatı olduğu anlamına gelmez. Test sırasında OpenRouter, Kimi’yi $3/$15 per milyon input/output token, Sonnet 5’i tanıtım $2/$10 fiyatıyla listeliyordu. Kimi’nin çalışması prompt token’larının %91’ini cache reads olarak raporladı; Sonnet hiç raporlamadı. Workload faturası Kimi’yi avantajlı çıkardı çünkü route tekrarlayan tool-schema input’u cache’ledi.

MiniMax M3: hala en dengeli Claude-benzeri value generalist

WebBrain ekibinin subjektif ürün görüşü hala MiniMax M3’ü en cazip Claude-benzeri value generalist olarak konumlandırıyor. Ama bu, bu tabloyu kazandığı anlamına gelmez.

M3’ün gerekçesi geniş:

  • 428B toplam parametre, sadece ~23B aktif per token;
  • Test edilen route’ta text, image, video input;
  • Yaklaşık 1M token context;
  • 2.85 saniyelik median latency;
  • 89 emitted call, 86 schema-valid;
  • $0.504 gözlemlenen replay maliyeti.

M3 consensus winner değil ve first action’larda Sonnet’e en yakın değil, ama Claude-benzeri agent davranışı, multimodality, latency, context ve hosted cost dengesinde en iyi genel karışım. Daha uzun trajectory&rler, prose kalitesi, görsel iş ve recovery davranışı farklı bir benchmark gerektiriyor.

GPT-5.6 dikkatli, basitçe fail etmiyor

Ham rank GPT-5.6 Luna ve Terra’yı en alta koyuyor. Ama günlük kullanımda bu şekilde hissettirmezler. WebBrain’in empirik gündelik deneyiminde GPT-5.6 çok iyi — bazen aşırı iyi — performans gösteriyor; state inspection, tool result alma ve trajectory sürdürme mümkün olduğunda.

GPT-5.6 route get_accessibility_tree ilk Direkt action vakaları Direct action’lar arasında ideal tool
Luna Pro 54 46 32/46 (%69.6)
Terra Pro 80 20 12/20 (%60.0)

Suite’in ideal first action’ı hiçbir zaman `get_accessibility_tree` değil; prompt’ta zaten mevcut state’ten hareket etmesini bekliyor. GPT-5.6 sık sık yine de fresh accessibility snapshot istiyor. Diğer modeller sık sık aynı fikirde: Luna’nın observation adımı 54 tree call’ının 43’ünde peer plurality ile eşleşti. Terra’nın 80’in 46’sında eşleşti. Gemini 59’un 46’sında, Grok 49’un 45’inde eşleşti.

Doğru follow-up: observation-tolerant iki-turn evaluation. Bir de API mismatch var: OpenAI’ın reasoning guide’ı, reasoning modellerinin Chat Completions yerine Responses API üzerinden daha iyi intelligence ve performance elde ettiğini söylüyor.

Reliability: mükemmel API delivery mükemmel tool delivery değil

13 karşılaştırılabilir sonuç seti, her HTTP isteğini final API error olmadan tamamladı. Tool-level dispatch daha az uniform.

Model Tool emit edilmedi Schema-invalid call Ana defekt
Gemini 3.6 Flash 0 0
Claude Sonnet 5 2 0
Kimi K3 3 0
GPT-5.6 Terra Pro 6 0
xAI Grok 4.5 6 0
Qwen 3.6 27B 8 9 Çoğunlukla quoted accessibility filter
DeepSeek V4 Flash 10 0
Tencent HY3 10 0
GPT-5.6 Luna Pro 11 0
MiniMax M3 11 3 Invalid enum/options/key
GLM-5.2 11 3 Stray quote accessibility filter’da
Poolside Laguna XS 2.1 11 1 Invalid press_keys key
Inkling Small 16 0

Maliyet: list price ve workload price farklı hikayeler anlatıyor

Model Input / output per 1M token Cache’lenen prompt tokens Gerçek 100-call maliyet
DeepSeek V4 Flash 0731 $0.09 / $0.18 %96.8 $0.050
Poolside Laguna XS 2.1 $0.06 / $0.12 %98.6 $0.073
GPT-5.6 Luna Pro $0.10 / $0.60 %80.0 $0.228
Inkling Small $0.50 / $1.20 %98.3 $0.243
Tencent HY3 $0.132 / $0.528 %32.6 $0.246
MiniMax M3 $0.30 / $1.20 %36.3 $0.504
GLM-5.2 $0.42 / $1.32 %91.0 $0.545
Qwen 3.6 27B $0.30 / $2.00 %87.4 $0.670
Gemini 3.6 Flash $1.50 / $7.50 %75.0 $1.209
Kimi K3 $3.00 / $15.00 %91.0 $1.563
GPT-5.6 Terra Pro $1.00 / $6.00 %80.3 $2.238
xAI Grok 4.5 $2.00 / $6.00 %62.9 $2.274
Claude Sonnet 5 $2.00 / $10.00 tanıtım %0 $7.222

13 karşılaştırılabilir replay toplamda $17.065. Sonnet tek başına o faturanın %42.3’ünü aldı. DeepSeek en yüksek exact-consensus skorunu Sonnet’in gözlemlenen maliyetinin %0.7’sinde teslim etti — ama bu oran büyük ölçüde DeepSeek’in %96.8 cache-read payına ve Sonnet’in sıfır cache’ine bağlı.

Amerikan open weights geri döndü

Laguna XS 2.1, Amerikan open-weight iddiasını çok daha somut hale getiriyor. Poolside’ın model kartı, 33B-total 3B-active MoE modeli, 40 katman, 256 uzman + 1 shared expert, 262K context, indirilebilir quantization’lar ve 36GB RAM’li Mac üzerinde lokal operasyon tanımlıyor. Aynı-payload run’ında yedinci sırada, 88 schema-valid call, 1.15 saniye median, $0.073 maliyet.

Bu, olağanüstü verimli bir satır. Sadece text-to-text kod uzmanı, 31 ideal tool seçiyor, sadece 5 exact ideal action’a ulaşıyor. Bir press_keys argümanı schema-invalid. Yani Laguna XS universal browser modeli veya argument precision şampiyonu değil. Ama bu, aynı anda rekabetçi, hızlı, lokal olarak plausible ve host etmesi neredeyse bedava olan bu cohorttaki ilk compact Amerikan open-weight modeli.

Inkling Small exact consensus’ta on birinci, 84 tool call yayınlıyor, skor şampiyonu değil. Önemi farklı bir capability surface’ından geliyor: text + image + audio input ile 276B-total/12B-active open-weight preview, 1.05 saniye median, $0.243 maliyet.

Boşluk kapanıyor. Kapanmadı. Çinli open-weight modeller ilk iki pozisyonu ve top 9’un 6’sını elinde tutuyor, Kimi ise en güçlü open-weight multimodal frontier satırını sağlıyor. Ama Poolside artık MiniMax M3 ile Kimi K3 arasında $0.073’lük bir Amerikan modeli oturtuyor exact peer consensus’ta. Bu, birkaç model kuşağı önce hayal edilemezdi.

Çinli frontier modeller farklı bir boşluğu kapatıyor

İkinci boşluk, Çinli lab’lar ile lider kapalı ABD frontier API’leri arasında. Bu test üç tür kanıt sağlıyor:

  1. Kimi K3 Sonnet’in dispatch reliability’sine neredeyse ulaşıyor ve first tool’u %86 vakada uyuşuyor.
  2. GLM-5.2 her modelde exact-ideal count’ta lider, peer consensus’ta beşinci, ve vision’a kredibil released path’i var.
  3. DeepSeek V4 Flash ve HY3, güçlü planner agreement’ını commodity-priced inference’a çeviriyor.

Bu convergence, equivalence değil. Ama “Çinli modeller daha ucuz ama açıkça bir tier geride” artık yararlı bir default değil.

Her iş için ne deploy ederdik?

Deployment ihtiyacı Bu grupdan tercih Neden
En ucuz hosted text-state planner DeepSeek V4 Flash En yüksek exact consensus, 1.56s median, $0.050
İhtiyatlı text-only alternatif Tencent HY3 İkinci consensus, 41 ideal tool, temiz schema
Kapalı multimodal dispatch reliability Claude Sonnet 5 98 valid call, 47 ideal tool
Hızlı kapalı multimodal loop Gemini 3.6 Flash 100 valid call, 1.96s median, geniş modaliteler
Open-weight multimodal frontier Kimi K3 97 valid, 44 ideal, %86 tool agreement Sonnet’le
En dengeli Claude-benzeri value generalist MiniMax M3 Image/video, 1M context, 23B active
Compact ABD open-weight text/kod Poolside Laguna XS 2.1 33B/3B, 1.15s median, $0.073
Yüksek hacim iki-turn testi için GPT-5.6 Luna Çok düşük fiyat; direct action’lar sensible
Tek RTX 5090, private ve offline Qwen 3.6 27B quantized Dense 27B, multimodal, pratik 32GB deployment

Son satır vurgu hak ediyor. Qwen 3.6 27B, bu setteki consumer RTX 5090 box’ında çalıştırılabilecek en iyi model. Bu grup içindeki tek dense 27B model, gerçekçi olarak 32GB consumer GPU’ya quantize edilebilir, vision ve video destekli, API token faturası yok.

Sonuç: haritayı gör, tek rakamı değil

Bu benchmark tek bir universal winner üretmiyor. Çok daha ilginç bir harita üretiyor.

DeepSeek V4 Flash ve Tencent HY3, reference-free first-action consensus’ta lider, ama test edilen route’ları text-only. Claude Sonnet 5, en yüksek gözlemlenen replay maliyetinde ideal-tool lideri. Gemini 3.6 Flash dördüncü, perfect 100-call validity ve geniş multimodality ile. GLM-5.2 beşinci, exact-ideal action’larda lider. Kimi K3, dispatch davranışında Sonnet’e yeterince yakın — Çinli frontier convergence somut hale geliyor. MiniMax M3 hala en dengeli Claude-benzeri multimodal value generalist.

Jeopolitik sonuç aynı ölçüde net olmalı: Amerikan ve Çinli open-weight ekosistemleri yakınlaşıyor çünkü Laguna XS artık 33B/3B-active $0.073 text planner olarak yedinci sırada ve Inkling multimodal breadth sağlıyor. Çinli ekosistem hala bu belirli planner tablosunda önde ve daha güçlü open-weight multimodal frontier var. Aynı zamanda Çinli lab’lar frontier-model boşluğunu kapatıyor: Kimi K3 Sonnet’in action reliability’sine yaklaşıyor; GLM, DeepSeek ve Tencent güçlü planlamayı dramatik daha ucuz yapıyor.

Hosted sistem için: modality, latency, cache behavior ve tool reliability’e göre seçin — milliyet veya tek bir benchmark rakamına göre değil. Consumer workstation için: Qwen 3.6 27B hala tek RTX 5090 için en ikna edici model. En büyük veya en yüksek skorlu route değil. Ama capability, modality, ownership ve donanım gereksinimlerinin bir insanın gerçekten masaüstüne koyabileceği bir makinede buluştuğu model.

Detaylı benchmark methodolojisi, raw sonuçlar ve tam analiz için: webbrain.one/blog/american-chinese-open-model-frontier-gap-benchmark.

WebBrain MIT lisanslıdır ve GitHub’da açıktır.

Comments

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir