Reflection AI, kodlama, akıl yürütme ve ajantik iş yükleri için geliştirilen ilk açık ağırlıklı modeli Beam‘i tanıttı. Toplam 501 milyar parametreye ve token başına 23 milyar aktif parametreye sahip seyrek bir Uzman Karışımı (Mixture-of-Experts – MoE) modeli olan Beam, hem ön eğitim hem de yüksek hesaplamalı pekiştirmeli öğrenme (RL) yatırımlarının bir ürünü olarak öne çıkıyor.
Model, web kaynaklarından ve lisanslı özel veri kümelerinden derlenen 23,8 trilyon yüksek kaliteli token ile ön eğitimden geçirildi. Buna paralel olarak, 10.500 adet NVIDIA GB300 GPU üzerinde dört hafta boyunca yürütülen pekiştirmeli öğrenme sürecinde 100 milyondan fazla deneme (rollout) üretildi. Son kırmızı takım (red-teaming) testleri devam eden modelin ağırlıkları, teknik raporu, model kartı ve geliştirici araçları bu ay içinde Apache 2.0 lisansıyla paylaşılacak.
Model Yetenekleri ve Çıkarım Verimliliği
Özellikle kodlama ve ajantik görevlere odaklanılarak eğitilen Beam, Batı dünyasındaki açık ağırlıklı modellerin sınırını ileri taşıyor. Kodlama ve ajan görevlerinde GLM 5.2 gibi daha büyük açık modellerle rekabet eden model, Qwen 3.8-Max seviyesine yaklaşıyor. Ham kapasitede Kimi K3 gibi modeller önde kalsa da Beam, çıkarım (inference) sırasındaki hesaplama verimliliğiyle fark yaratıyor.
İleri düzey akıl yürütme testlerinde GLM-5.2 ile benzer puanlar elde eden Beam, bunu 3 ila 4 kat daha az çıkarım hesaplaması kullanarak başarıyor. Token başına çok daha fazla hesaplama gerektiren 2 trilyon üstü parametreli Qwen 3.8-Max gibi modellerle kıyaslandığında bu verimlilik farkı daha da belirginleşiyor. Temel kıyaslama sonuçlarından bazıları şöyle:
- SWE-bench Verified: %80,9
- SWE-bench Multilingual: %78,0
- SWE Bench Pro v2-Hard: %77,2
- Terminal Bench v2.1: %80,1
- AIME 2026: %97,8
- GPQA Diamond: %90,5
- MCP Atlas: %78,7
- DeepSearchQA (bağlam yönetimiyle): %80,1
Yüksek Hesaplamalı Pekiştirmeli Öğrenme (RL)
Reflection AI, yüksek hesaplamalı pekiştirmeli öğrenmeyi Beam için temel bir ölçekleme ekseni haline getirdi. Dört hafta boyunca 10.500 NVIDIA GB300 GPU kullanılarak 256K maksimum bağlam uzunluğuyla 100 milyondan fazla rollout üretildi. Eğitim ve değerlendirme aşamalarında yaklaşık 1,3 milyar izole çalışma alanı (sandbox) kullanıldı ve bu süreci beslemek için kodlama, ajan görevleri ve STEM alanlarında bir milyon yüksek kaliteli ortam oluşturuldu.
Model, asenkron politika gradyanları ile eğitildi. Büyük ölçekte uzun süren görevlerde ortaya çıkan politika eskimesi (policy staleness) ve eğitim ile çıkarım motorları arasındaki sayısal uyumsuzluk sorunlarını aşmak için yeni algoritmalar geliştirildi. Bu sayede, bir günden daha eski etkileşimlerden öğrenirken bile kararlılığını koruyan tam asenkron bir RL altyapısı kuruldu.
Verimli Akıl Yürütme ve Genelleme
Beam, başarılı çözümleri ödüllendirirken gereksiz token kullanımını azaltan kontrol edilebilir bir uzunluk cezası ile eğitildi. Kullanıcılar, modelin akıl yürütme eforu (reasoning effort) parametresini ayarlayarak hız ve maliyet bütçelerine göre kısa yanıtlar veya zorlu görevler için daha uzun düşünme süreçleri arasında tercih yapabiliyor.
Ayrıca RL eğitimi sırasında tarayıcı kullanımı doğrudan eğitim karışımında yer almamasına rağmen, modelin web gezinme görevlerinde düzenli gelişim gösterdiği gözlemlendi. Web erişimi verildiğinde başka dil modellerini sorgulamayı ve belgeleri okumak için OCR API’lerini kullanmayı kendiliğinden öğrendi. Yalnızca metin tabanlı olmasına rağmen p5.js ile 3 boyutlu astronot oyunu geliştirme, açık NYC MTA verileriyle canlı metro haritası oluşturma ve Unsloth kullanarak Gemma-4 modeli için Text2SQL ince ayar (fine-tuning) defteri hazırlama gibi farklı alanlardaki görevleri başarıyla tamamladı.
Ölçeklenebilir RL Altyapısı
Eğitim boyunca ortalama 110 bin eşzamanlı rollout sürecini yürüten asenkron platform, yedi temel teknik yetenek üzerine kuruldu:
- Tam asenkron yürütme: Ajanlar rollout üretirken eğitici sistem yeni model sürümlerini öğrenip yayınlar; her token kendisini üreten sürümle etiketlenir.
- Esnek hesaplama tahsisi: Çıkarım ve eğitim GPU oranları iş yüküne göre 3,9:1 ile 5,4:1 arasında dinamik olarak ayarlandı.
- Hızlı model güncellemeleri: Yeni ağırlıklar RoCE ve NVLink üzerinden hiyerarşik dağıtımla çıkarım filosuna medyan 12 saniyede ulaştı.
- Arızalara dayanıklılık: Eğitim süresince yaşanan 71 çıkarım kesintisi işi durdurmadan yönetildi; kapasite medyan 8 dakikada toparlandı.
- Ölçeklenebilir ortamlar: Aynı anda 170 bine kadar sandbox desteklendi ve yeni ortamların %90’ı 10 saniyenin altında hazır hale getirildi.
- Verimli eğitici paketleme: Dinamik paketleme sayesinde eğitim grupları ortalama %99,99 dolulukla çalıştı.
- Gözlemlenebilirlik ve ödül bütünlüğü: Token bazlı kayıtlar eğitim ve çıkarım arasındaki sayısal tutarlılığı denetlerken, bağımsız hakem modeller doğrulayıcı açıklarını engelledi.
Akıl Yürütme İçin Ön Eğitim Temeli
Beam’in temel modeli, yerel ve küresel dikkat (attention) mekanizmalarını, ince taneli yönlendirilen uzmanları ve kontrollü kalıntı akışını (residual stream) bir araya getiriyor. Yardımcı kayıp gerektirmeyen yük dengeleme (auxiliary-loss-free load balancing) yaklaşımı üzerine inşa edilen mimaride, eğitim sonunda en yoğun uzmanın yükü ortalamanın yalnızca 1,04 katına ulaşarak neredeyse tamamen dengeli bir dağılım sağladı. Derinlik tabanlı ölçekleme, SandwichNorm ve FP32 kalıntı birikimi sayesinde 52 katmanın tamamında sinyal yayılımı kararlı tutuldu.
Veri tarafında ise ham internet verilerinin yaklaşık %95’i ayrıştırma, tekilleştirme ve kalite filtreleriyle elendi. Öte yandan geleneksel filtrelerin gözden kaçıracağı 1,8 trilyon yüksek kaliteli token özel sınıflandırıcılar sayesinde korundu. STEM alanındaki PDF belgelerini işlemek için binlerce GPU üzerinde çalışan görsel-dil tabanlı bir OCR hattı kuruldu. Ön eğitim süreci, 6.144 adet NVIDIA GB300 NVL72 GPU’dan oluşan kümede dört haftadan kısa sürede ve %92,3 verimli çalışma süresi (goodput) oranıyla tamamlandı.
Ön eğitim ile RL arasındaki orta eğitim (midtraining) aşamasında ise modelin etkin bağlam uzunluğu 1 milyon tokena çıkarıldı. Yapılandırılmış kod depoları, uzun ufuklu görevler ve kapsamlı belgelerle modelin uzun diziler boyunca bilgiyi birbirine bağlama yeteneği güçlendirildi.
Güvenlik, Hizalama ve Gelecek Planları
Güvenlik ve hizalama çalışmaları kapsamında, büyük ölçekli RL öğretmeni ile özel güvenlik öğretmeninin yetenekleri çoklu öğretmen politika içi damıtma (MOPD) yöntemiyle birleştirildi. Beam’in çalışma ilkeleri; ihlal edilmemesi gereken güvenlik kuralları, doğruluk ve belirsizliği kabul etme gibi kalite standartları ile doğrudan ve proaktif iletişim tarzı olmak üzere üç katmanda yapılandırıldı. Ayrıca güvenlik politikalarını doğrudan modelin akıl yürütme sürecine dahil etmek için müzakereci hizalama (deliberative alignment) tekniklerinden yararlanıldı.
Reflection AI, bu ay içinde Beam’in model ağırlıklarını, çalıştırma ve ince ayar araçlarıyla birlikte Apache 2.0 lisansı altında herkesin erişimine açacak. Şirket ayrıca dahili olarak geliştirdiği güvenlik değerlendirme standartlarını da açık kaynak olarak paylaşmayı planlıyor.

Bir yanıt yazın