Bonsai 2 27B: Gerçekten Qwen3.8 27B Başarısının Yüzde 98,2’sine Sahip mi?

Yeni sürümü ele almadan önce, önceki incelememde tespit ettiklerimi kısaca hatırlatmakta fayda var:

Bonsai 27B İncelemesi: 3,9 GB’lık 1-Bit Model Qwen3.6 27B ile Eşleşebilir mi?

Önceki 1-bit Bonsai etkileyici bir sıkıştırma başarısı sunsa da, üretim ortamları için önerebileceğim bir model değildi. Düşünme modu açıkken, düşünme modu kapalı durumdaki Qwen3.6 27B’ye yaklaşabiliyordu. Her iki modelin de akıl yürütmesine izin verildiğinde ise orijinal model açıkça daha üstün kalıyordu.

Daha da önemlisi, elde edilen bellek tasarrufu ciddi bir belirteç verimsizliğini beraberinde getirdi. Kodlama problemlerinde Bonsai’nin yanıtlarının yaklaşık %18’i 128K belirteç sınırını tamamen tüketirken, orijinal modelde bu oran yalnızca %4 civarındaydı.

Bu yeni sürümü değerlendirirken temel aldığım arka plan tam olarak bu. Daha yüksek bir test ortalaması elbette olumlu bir adım, ancak bu aksaklıkların giderildiğine dair somut kanıtlar görmek gerekiyor.

Süreçte Neler Değişti?

İlk olarak, temel alınan model artık Qwen3.6 27B yerine Qwen3.8 27B. İkinci olarak, bu sürüm önceki incelememin ana konusunu oluşturan 1-bit varyant değil, yalnızca üçlü (ternary) yapıya sahip.

İkili (binary) bir ağırlığın iki seçeneği varken, üçlü bir ağırlığın ortak bir ölçekle çarpılan üç seçeneği bulunuyor: negatif, sıfır ve pozitif. Buradaki fazladan sıfır durumu, temsile belirgin bir esneklik kazandırıyor.

Bonsai 2’de teknik olarak paylaşılan yeni detay, blok bazlı Hadamard rotasyonu. Bonsai 2, üçlü değerleri atamadan önce ağırlık matrislerini dönüştürüyor ve çalışma zamanı da etkinleştirmelere aynı dönüşümü uyguluyor. Model halen ortak FP16 ölçeklerine sahip 128 ağırlıktan oluşan grupları kullanıyor.

Hadamard rotasyonları, nicemleme (quantization) doğruluğunu artırmak için sıklıkla tercih edilen köklü bir yöntemdir. Orijinal koordinatları doğrudan nicemlemek yerine, önce farklı bir koordinat sisteminde harmanlarsınız. Matris çarpımının diğer tarafında eşleşen bir dönüşümle, nicemlenmemiş hesaplama eşdeğer kalabilirken değerler düşük hassasiyette daha kolay temsil edilebilir hale gelir.

Bu yöntem, kısıtlayıcı bir sayısal temsilin yarattığı kayıpları azaltmanın etkili bir yoludur.

Ayrıca üçlü değerlerin paketlenme biçiminde de pratik bir iyileştirme bulunuyor. Sürümde yaklaşık 5,9 GB boyutunda yoğun bir PTQ1_0 formatı ve yaklaşık 7,2 GB boyutunda bir PQ2_0 formatı yer alıyor. İkincisi daha fazla depolama alanı kaplıyor ancak komut istemi işlemeyi hızlandırıyor. Bunlar farklı depolama düzenleridir; en küçük dosyanın otomatik olarak en iyi dağıtım tercihi olduğu anlamına gelmez.

Önemli bir sonuç: Prism ML’in çalışma zamanı yönergelerini uygulayın. Bonsai 2 eşleşen etkinleştirme dönüşümüne ihtiyaç duyar ve bu yapı standart llama.cpp tarafından henüz desteklenmemektedir. Projenin kurulum adımları uygun çatallanmış ikili dosyaları indirir.

Aşağıda kendi değerlendirmem değil, Prism ML’in duyurusundan seçilen sonuçlar yer almaktadır (makaleden xhigh düşünme moduyla alınmıştır):

Bu sıkıştırma seviyesi için elde edilen değerler gerçekten cesaret verici.

Duyurulan %98,2’lik koruma oranı, test ortalamaları arasındaki bir orandır; tüm yeteneklerin eşit ölçüde korunduğunun garantisi değildir.

Zorlu Otonom (Agentic) Kodlama Nerede?

Raporda derinlere gizlenmiş… Neredeyse otonom kodlama değerlendirmelerinin yapılmadığını yazarak bu makaleyi yayımlayacaktım. Değerlendirmeleri yapmışlar, ancak bu sayıları ana değerlendirmeye dahil etmemişler.

Otonom kodlama yetenekleri, Qwen3.6’dan Qwen3.8’e geçişteki en bariz gelişmelerden biriydi. Bu kabiliyetler düşük bitli nicemleme altında sert bir şekilde gerileyebilir.

Bu sonuçlar ana kıyaslama ortalamasından ayrı tutulmuş ve model kartındaki kıyaslama tablosunda yer almıyor. Bu durum, %98,2 oranının uzun soluklu kodlama görevleri için pek de gerçeği yansıtmadığını gösteriyor.

Bu durum, X üzerinde gün boyu karşılaştığım olumsuz topluluk tepkilerini de açıklıyor. Çoğu kişi makaleyi okumadı ve muhtemelen yalnızca reklamı yapılan “%98,2 korunan doğruluk” ifadesini gördü.

Deneysel Ortam Detayları

Model kartı; H100 üzerinde EvalScope ve vLLM ile yapılan doğruluk testlerini, eşleşen ayarlar ve düşünme moduyla aktarıyor. Listelenen örnekleme parametreleri arasında 1.0 sıcaklık, 0.95 top-p ve 20 top-k yer alıyor.

Aynı altyapıyı kullanmak iyi bir başlangıç noktasıdır. Yine de doğruluk deneyini, paketlenmiş modelin yerel çalışma ortamındaki uçtan uca değerlendirmesinden ayrı tutmak gerekir.

İlk Bonsai incelememde de benzer bir ayrım yapmıştım: Ölçümlerim gerçek paketlenmiş GGUF ya da MLX dağıtımı yerine, vLLM üzerinden açılmış FP16 sürümlerini kullanmıştı. Bu sonuçlar model davranışını incelemek açısından faydalıydı, ancak düşük bellekli çıkarım yığınının tam bir ölçümü değildi. Paketlenmemiş bir FP16 modelini çalıştırmak, çalışma zamanına özgü GGUF sürümlerini kullanmakla birebir aynı değildir.

Model kartında ayrıca çıktı bütçeleri, tekrarlanan test belirsizlikleri, toplam belirteç sayıları veya zaman aşımı oranları belirtilmemiş. Makalede ise daha fazla ayrıntı mevcut:

Yürüttükleri tüm değerlendirmelerde maksimum çıktı belirteç sınırı 82K olarak belirlenmiş. Düşünme modu analizimde gördüğümüz gibi, özellikle xhigh düşünme seviyesi için bu sınır oldukça düşüktür.

Diğer bir deyişle, referans aldıkları temel Qwen3.8 27B olması gerekenden daha zayıf kalmış. Üstelik üretilen dizi uzadıkça nicemleme hatalarının daha belirgin hale geldiği bilinmektedir.

Toparlamak gerekirse, bunlar kulağa oldukça eleştirel gelebilir. Ancak eleştirilerimin büyük kısmı modelin kendisinden ziyade değerlendirme sürecine ve sonuçların sunuluş biçimine yöneliktir. Bonsai 2 27B, 6 GB altında çalıştırabileceğiniz muhtemelen en başarılı modeldir.

Comments

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir