Cepteki AI modelleri, tarihsel olarak boyut-kalite dengesinde sıkışmıştı. Küçük modeller (2B, 4B, 8B) telefona sığdı ama kalite düşük. Büyük modeller (30B+) kaliteli ama telefona sığmıyor. Ta ki geçen hafta — startup PrismML, Bonsai 27B’yi duyurdu. 27 milyar parametreli multimodal bir modeli, iPhone 17 Pro gibi üst düzey telefonlarda çalıştırma iddiası.
Rakamlar çarpıcı:
- Orijinal Qwen 3.6 tabanı: 54 GB (BF16).
- PrismML advanced low-bit quantization sonrası: 3,9 GB.
- Performans korunumu: %90-95 (orijinal Qwen 3.6’ya göre, matematik/kod/reasoning benchmark’larında).
- Hız (iPhone 17 Pro): 11 token/saniye.
- Hız (laptop): 66 token/saniye’e kadar.
Yani ~13,8 kat boyut küçültme, kalite %5-10 kaybı. Karşılığında telefonda çalışan bir 27B modeli. Bu, edge AI cephesinde önemli bir eşik.
Bu yazıda Bonsai 27B’nin nasıl çalıştığını, low-bit quantization tekniklerini, Apple ile ilk görüşmelerin ne anlama geldiğini ve on-device AI ekonomisi için ne demek olduğunu inceleyeceğiz.
PrismML kim?
PrismML, quantization ve model compression’a odaklanmış nispeten yeni bir startup. Bonsai serisi, şirketin ilk büyük ürün lansmanı. Ekip, önceki yıllarda Apple, Meta ve Qualcomm’da model efficiency araştırması yapmış mühendislerden oluşuyor.
Şirket felsefesi net: frontier kalitesini edge donanıma taşımak. Kendi model eğitmek yerine (Qwen, Llama, Mistral gibi devlerin bıraktığı) mevcut modellerin boyutunu radikal biçimde küçültmek üzerine çalışıyor.
Bonsai 27B nedir?
Bonsai 27B, aslında yeni bir model değil. Alibaba’nın Qwen 3.6 serisinin 27B varyantının PrismML tarafından quantize edilmiş versiyonu.
Ürünün 3 katmanı:
1. Base model: Qwen 3.6 27B — Alibaba’nın açık ağırlık modeli. Multimodal (metin + görsel), 128K context.
2. Quantization pipeline: PrismML’nin özel “advanced low-bit” algoritması. Ağırlıkları ~2 bit/parametre’e düşürüyor (klasik INT4’te 4 bit, INT8’de 8 bit).
3. Optimized runtime: iOS ve Android için özel çalışma zamanı. Apple Neural Engine ve Qualcomm Adreno GPU’yu kullanan native inference.
Sonuç: 54 GB modeli, 3,9 GB dosyaya sıkıştırma. Bu, iPhone 17 Pro’nun 256 GB depolama ve 12 GB RAM’i içinde makul bir alan.
Hız: 11 token/saniye iPhone’da
Kalite korunumu yeterli değil; kullanılabilir hız da gerekli. Bonsai 27B’nin performans profili:
- iPhone 17 Pro: 11 token/saniye. Kullanıcı için pratik — bir paragraf yazması yaklaşık 15-20 saniye.
- iPhone 17 Pro Max (belki): daha yüksek RAM ile daha hızlı.
- Yüksek uçlu laptop: 66 token/saniye. GPT-4 seviyesi kullanıcı deneyimi.
- Apple M4/M5 Mac: 30-50 token/saniye tahmini (kesin rakam paylaşılmadı).
Kıyaslama için: Liquid AI’ın LFM2.5-230M modeli Samsung Galaxy S25 Ultra’da 213 token/saniye veriyor — ama sadece 230 milyon parametre. Bonsai’nin 27 milyar parametre ile 11 token/saniye vermesi, model kalitesinden ödün vermeden edge’e taşımanın maliyetini gösteriyor.
“Advanced low-bit”: teknik olarak ne yapıyor?
Quantization, yıllardır AI verimliliğinin ana araçlarından biri. Klasik yaklaşımlar:
- FP16: Half precision, 16 bit/parametre. Genelde eğitim için.
- INT8: 8 bit integer. Kalite kaybı yaklaşık %1-2, boyut %50 düşüyor.
- INT4: 4 bit integer. Kalite kaybı %3-5, boyut %75 düşüyor.
- INT2 (tartışmalı): 2 bit. Kalite kaybı %10-30, boyut %87 düşüyor.
Bonsai’nin 54 GB → 3,9 GB düşüşü (13,8x sıkıştırma), yaklaşık ~1.15 bit/parametre anlamına geliyor. Bu, klasik INT2’den bile agresif.
Muhtemel teknikler:
- Mixed-precision quantization: Kritik katmanlar (dikkat matrisleri) daha yüksek precision, diğerleri daha düşük.
- Vector quantization: Ağırlıkları grup halinde codebook’a mapping.
- Learnable quantization: Distillation ile birlikte, öğrenilmiş bir quantization pattern.
- Sparse-plus-lowbit: Bazı ağırlıklar 0’a set edilip, kalanlar low-bit encode edilir.
Teknik makale yakında yayınlanacak; şu an sonuçların rakamsal etkileri paylaşılmış durumda.
%90-95 kalite korunumu: gerçek mi?
Bir 13,8x sıkıştırma sonrasında %5-10 kalite kaybı iddiası ambitiyoz. Şüpheci bir bakış gerektiriyor.
PrismML’nin sunduğu benchmark’lar (matematik, kod, reasoning) üzerinden değerlendirme:
- MMLU (genel bilgi): Orijinal Qwen 3.6 27B: 79.8; Bonsai 27B: 74.2 (%93 korunum).
- HumanEval (kod): Orijinal: 82.5; Bonsai: 78.3 (%95 korunum).
- GSM-8K (matematik): Orijinal: 91.2; Bonsai: 84.6 (%93 korunum).
Bu rakamlar geçerlidir. Ama önemli bir uyarı: sıkıştırma kaybı genelde uniform değil. Bazı görevlerde %2, bazılarında %20 kayıp yaşanabilir. Özellikle:
- Long-form yazım: Tutarlılık zayıflayabilir.
- Nadir bilgi: Model uzun kuyruk bilgileri unutabilir.
- Karmaşık reasoning: Multi-step düşünme zayıflayabilir.
- Non-İngilizce diller: Türkçe, Almanca gibi düşük veri temsili olan diller daha çok etkilenebilir.
Bağımsız 3rd party benchmark testleri yayınlandığında Bonsai’nin gerçek pozisyonu netleşecek. Şu ana kadar paylaşılan veri PrismML’in kendi ölçümü.
Apple-PrismML görüşmeleri
Duyuruda dikkat çeken bir detay: Apple ile erken aşama görüşmeler. Detay paylaşılmadı, ama olası senaryolar:
1. Siri’nin on-device enhancement’ı. Apple Intelligence, karmaşık sorgular için ChatGPT’ye yönlendiriyor (bulut). Ama Apple, mahremiyet felsefesi gereği daha çok on-device çalışmak istiyor. PrismML’nin quantization teknolojisi, 27B kalitesinde bir modelin iPhone’da lokal çalışmasını sağlar. Bu, Siri’yi “yerel LLM”e dönüştürebilir.
2. Bir başka bulut ortaklığından çıkış. Apple’ın OpenAI ile ortaklığı gerginleşti (bu haftaki dava haberini takip edenler bilir). Apple, ChatGPT-alternative bir on-device çözüm arıyor. PrismML+Qwen kombinasyonu, Apple Intelligence’ın backend model bağımlılığından kurtulmasını sağlar.
3. Acquihire. Apple, PrismML ekibinin quantization uzmanlarını satın alarak kendi on-device model efficiency çalışmasına dahil edebilir. Apple’ın klasik acquihire modeli.
Hangi senaryo gerçekleşirse, on-device AI ekonomisi için önemli. Apple’ın 1.5 milyar iPhone kullanıcısına ulaşmak, PrismML gibi bir startup için transformatif.
Bonsai’nin ekosistemdeki yeri
On-device AI kategorisinde Bonsai 27B’nin konumu:
| Model | Parametre | Boyut | iPhone hız | Kalite |
|---|---|---|---|---|
| Bonsai 27B | 27B | 3.9 GB | 11 tok/s | ~%92 (Qwen 3.6’nın) |
| Liquid LFM2.5-8B-A1B | 8B | ~4 GB | ~25 tok/s (M5 Max) | ~%75 (frontier’a göre) |
| Liquid LFM2.5-230M | 230M | ~200 MB | 213 tok/s | ~%50 (tool use uzman) |
| Apple Intelligence (~3B) | 3B | ~2 GB | Bilinmiyor | Bilinmiyor |
| Gemini Nano 2 (~4B) | ~4B | ~2.5 GB | ~30 tok/s (Pixel) | ~%80 |
| Phi-4 mini (~4B) | 4B | ~2.5 GB | ~40 tok/s | ~%85 |
Bonsai’nin diferansiyeli: yüksek toplam kalite, orta hız. Diğerleri hız için kalitede ödün veriyor; Bonsai kalitede ödün vermeden hızı düşürmüş.
Hangi seçim doğru? Kullanım senaryosuna bağlı:
- Karmaşık yaratıcı yazım, uzun cevap: Bonsai 27B tercih edilir.
- Kısa asistan cevabı, hızlı UX: Liquid LFM2.5, Phi-4 mini.
- Tool use ajanlığı: LFM2.5-8B-A1B.
- Basit dil işleme: LFM2.5-230M yeter.
Türk kullanıcılar için pratik değer
1. Ekonomik on-device çözüm. Türkiye’deki üst-orta gelirli iPhone 17 Pro kullanıcıları, Bonsai 27B ile ChatGPT Plus aboneliği ödemeden benzer kalitede sohbet erişebilir. Fiyat noktası önemli — TRY $/ay giderleri düşürme fırsatı.
2. Offline erişim. Türkiye’de internet kısıtlaması veya yavaşlığı yaşanan bölgelerde on-device AI kritik. Uçak modunda, dolaylı ADSL sorunlarında, ya da yurt dışında pahalı roaming senaryolarında Bonsai gibi bir model tam işlevsel.
3. Mahremiyet. Türkçe kullanıcı verisinin ABD veya Çin sunucularına gönderilmesi endişesi olanlar için on-device çözüm ideal. KVKK uyum için de kolaylaştırıcı.
4. Türkçe performans belirsiz. Bonsai’nin temel modeli Qwen 3.6 — Türkçe için oldukça iyi. Ama %90-95 korunum iddiası, ağırlıklı olarak İngilizce benchmark’larda test edilmiş. Türkçe için gerçek kalite, ilk kullanıcı testleri ile öğrenilecek.
Açık ağırlık olması
Bonsai 27B, açık kaynak olarak yayınlandı. Bu, birkaç önemli anlam taşıyor:
- Bağımsız geliştiriciler, kendi uygulamalarına entegre edebilir (App Store rehberliği çerçevesinde).
- Türk startup’lar, Bonsai’yi ürünlerinde kullanıp fine-tune edebilir.
- Akademik araştırma için quantization tekniklerini incelemek mümkün.
- Apple ile ortaklık çalışırsa bile, bağımsız Bonsai versiyonu çalışmaya devam eder.
Bu, klasik “kapalı startup teknolojisi”nin aksine bir yaklaşım. PrismML’in stratejisi belli: quantization tekniğini açık paylaşarak topluluk desteği kazanmak, gelir modeli olarak enterprise deployment ve custom quantization hizmetleri satmak.
Sonuç: cepteki 27B milada eşik
Bonsai 27B, on-device AI için önemli bir milat. 2024’te Apple Intelligence’ın 3B modeli piyasaya geldiğinde, o dönem “telefonda 3B çalışıyor” büyük bir başarıydı. 2026 ortasında, aynı telefonlarda 27B çalışıyor. On-device AI kapasitesi 9 kat büyüdü.
Bu trend devam edecek. 2027-2028 arasında telefonlarda 70B+ modellerin çalışması muhtemel. Bu noktada, cloud AI’a bağımlılık büyük ölçüde azalır. Kullanıcılar için mahremiyet, offline erişim ve maliyet açısından devrim.
PrismML, bu geleceği hızlandıran şirketlerden biri olarak konumlanıyor. Apple ile ilk görüşmeler doğrulanırsa, önümüzdeki bir yıl içinde iPhone 18’in dahili AI motoru Bonsai teknolojisi tarafından güçlendirilebilir.
Türk kullanıcılar için pratik tavsiye: iPhone 17 Pro sahibi olan Türk kullanıcılar, Bonsai 27B’yi TestFlight veya benzeri deployment kanalıyla erken deneyebilir. Sonuçlar Türkçe için gerçek kaliteyi netleştirecek. Bağımsız Türk geliştiriciler için ise Bonsai, kendi uygulamalarına premium AI entegre etmenin ekonomik yolu.
Modeli denemek isteyenler için: PrismML’in resmi web sitesi ve Hugging Face üzerinden Bonsai serisi ağırlıkları erişilebilir. iOS uygulaması test için TestFlight’ta bekleme listesi mevcut.

Bir yanıt yazın