Qwen 3.6 35B-A3B’yi bedavaya A6B’ye çevirmek: hikarioyama’nın MoE router-tail-scale deneyi — sıfır ek eğitim, top-k 8’i 32’ye çıkarma ve softmax renormalization tuzağı
Mixture-of-Experts (MoE) mimarisinde eğlenceli bir soru var: bir modelin router’ını çalıştırırken top-k değerini artırırsan ne olur? Yani her token için 8 uzman yerine 32 uzman aktif etsen? Teoride bu, aktif parametre sayısını 2-3 kat artırır — ekstra kapasitede genelleştirme, daha iyi cevaplar beklenir. Pratikte ise çoğu zaman daha kötü sonuçlar geliyor. Neden? GitHub üzerinde hikarioyama’nın…
