Bu hafta AI cephesinde iki paralel haber geldi ve ikisi de aynı temayı işaret ediyor: küçük, verimli, açık kaynak modeller giderek daha büyük modelleri hangi belirli senaryolarda geçtiğine.
Aynı gün duyurulan iki release:
Ant Ling — Ling-3.0-tiny. 7.9 milyar parametre, token başına sadece 1.3 milyar aktif. GPQA Diamond’da 73.4, IMO-AnswerBench’te 71.0 — reasoning benchmark’larında rekabetçi rakamlar. Hugging Face’te açık lisans.
webAI — TwiL-LM3. 3 milyar parametrelik uzmanlık modeli. Formal logic testlerinin 5’inden 4’ünde OpenAI’ın 120B modelini geçiyor. Küçük varyantı iPhone üzerinde çalışıyor.
İkisi de open license altında. İkisi de geliştiricinin consumer donanımda — laptop, hatta telefon — local çalıştırmasına izin veriyor. Yani “datacenter-scale AI” anlatısının tam tersi bir hikaye.
Bu, izole bir moment değil. Örüntünün parçası. Detaylara bakalım.
Ling-3.0-tiny: 1.3B aktif ile GPQA 73.4
InclusionAI/Ant grubunun geçen hafta duyurduğu Ling-3.0-Flash’in küçük kardeşi. Özellikler:
- Toplam parametre: 7.9B.
- Aktif parametre: 1.3B per token.
- Aktivasyon oranı: %16.5 — agresif sparse.
- Mimari: Hybrid-linear MoE (Ling 3.0 ailesinin karakteristik yapısı).
Benchmark rakamları:
- GPQA Diamond: 73.4 — grad-level bilim sorularında rekabetçi. Karşılaştırma için: GPT-4 (2023) GPQA’da ~35, Claude 3.5 Sonnet ~65, Gemini 2.5 Pro ~78. Yani Ling-3.0-tiny, 1.3B aktif parametre ile GPT-4’ün iki katı skorda.
- IMO-AnswerBench: 71.0 — International Mathematical Olympiad tarzı sorular. 1.3B aktif ile matematik olimpiyat seviyesinde performans.
1.3B aktif parametrenin ekonomik anlamı:
- Inference hızı çok yüksek — token başına çok az compute.
- Memory footprint yönetilebilir (INT4’te ~4 GB).
- Modern laptop CPU üzerinde bile makul hızda çalışır.
- Edge deployment (mobil, IoT) için mümkün.
Ama uyarı: 1.3B aktif = 1.3B memory değil. Toplam 7.9B ağırlık disk ve RAM’de olmalı. Yani “telefonda 1.3B model” değil, “telefonda 7.9B model, ama token başına 1.3B çalışıyor” anlamı.
TwiL-LM3: 3B model, 120B modeli geçiyor
webAI’ın TwiL-LM3 daha radikal bir iddia taşıyor: formal logic testlerinin 5’inden 4’ünde OpenAI’ın 120B modelini geçiyor. Yani 40 kat daha küçük bir model, spesifik bir alanda büyük modeli yeniyor.
Ana özellikler:
- Toplam parametre: 3B.
- Mimari: Dense (MoE değil).
- Uzmanlık alanı: Formal logic reasoning.
- Küçük varyant: iPhone’da çalışır (muhtemelen 1B veya daha az).
3B modelin 120B modeli geçmesi imkansız gibi görünüyor — ama specialized domain’lerde mümkün. Nasıl?
1. Fine-tune specialization. TwiL-LM3 muhtemelen çok sayıda formal logic verisiyle özel eğitim aldı. General purpose modeli (120B GPT-oss gibi) bu spesifik dağılıma bu kadar odaklanmıyor.
2. Reasoning chain optimization. Formal logic’te doğru cevap için doğru chain of thought gerekiyor. Küçük model, bu chain’i özel eğitildiği için daha güvenilir üretiyor.
3. Benchmark selection. webAI, TwiL-LM3’ün güçlü olduğu 5 formal logic testini seçti. Diğer benchmark’larda 120B model muhtemelen açık ara üstün.
Yine de: 3B model iPhone’da çalışıyor ve bir domain’de 120B modeli geçiyor. Bu, edge AI için önemli bir concept proof.
Ortak hikaye: küçük modeller, büyük etki
2024-2025 arası AI cephesindeki hakim anlatı: “daha büyük daha iyi”. GPT-4 → Claude Opus → Gemini Ultra → 1T+ MoE’ler. Her yeni model daha çok parametre.
2026’da paralel bir alt-örüntü belirginleşiyor: küçük ama akıllı modeller giderek daha yaygın.
Bu haftaki iki release, bu örüntünün son somut kanıtları. Ama liste uzun:
- Liquid AI LFM2 serisi (Türkiye’deki geliştiriciler için) — 230M’den 8B’ye kadar edge-optimized.
- Microsoft Phi-4 serisi — küçük ama code + reasoning odaklı.
- Apple Foundation Models — iPhone içi 3B model, on-device Siri intelligence.
- Google Gemini Nano — Pixel telefonlarda çalışıyor.
- Mistral’in küçük varyantları — Ministral 3B, 8B.
- Ling-3.0-tiny ve TwiL-LM3 — bugünkü haber.
Neden bu trend var?
1. Edge deployment ekonomisi. Her cloud API çağrısı para. Yıllık milyonlarca istek yapan uygulama için on-device model, cloud API’den çok daha ucuz.
2. Gizlilik. Kullanıcı verisi cihazdan çıkmıyor. GDPR, KVKK, HIPAA compliance kolaylaşıyor.
3. Offline. İnternet yoksa çalışıyor. Uçakta, güvenilmez ağda, seyahatte.
4. Latency. Ağ round-trip yok. Yerel model milisaniye seviyesinde cevap veriyor.
5. Uzmanlaşma pratik. Küçük model, bir domain’e derin fine-tune ile büyük general model’i geçebilir. TwiL-LM3 bunu gösteriyor.
Consumer hardware üzerinde çalıştırma
İki yeni model için pratik deployment senaryoları:
Ling-3.0-tiny (7.9B toplam):
- INT4 quantized: ~4 GB disk. Ortalama laptop’a rahat sığar.
- RTX 4090: ~150-200 tok/s inference bekleniyor.
- M4 MacBook Pro: ~50-80 tok/s.
- Yüksek uçlu Android telefon: mümkün ama ~5-10 tok/s (kullanılabilir değil).
TwiL-LM3 (3B):
- INT4 quantized: ~1.5 GB. Neredeyse her cihaza sığar.
- iPhone 15 Pro+: native çalışıyor (webAI iddiası).
- RTX 4090: ~300+ tok/s.
- MacBook Air M3: ~100+ tok/s.
Yani her ikisi de gerçek anlamda consumer donanımda çalışabilir. Datacenter GPU gerektirmez.
Türk geliştiriciler için ne demek?
Türk startup’lar ve bireysel geliştiriciler için bu trend özellikle önemli:
1. Dolar-tabanlı cloud API maliyetlerinden kaçış. ChatGPT API, Claude API — hepsi USD faturalı. TL kurundaki dalgalanma, Türk startup’lar için AI maliyet yönetimini zorlaştırıyor. On-device modeller bu problemi çözer.
2. KVKK uyumu. Sağlık, finans, hukuk alanında çalışan Türk şirketler için kullanıcı verisinin ABD sunucularına gitmesi problematik. Ling-3.0-tiny veya TwiL-LM3 tarzı on-device modeller bu problemi çözer.
3. Mobile-first uygulamalar. Türk startup ekosisteminin çoğu mobile-first. Getir, Trendyol, Peak Games, Insider — hepsinin mobil uygulamaları var. AI özellikleri on-device çalışırsa hem UX daha hızlı hem maliyet düşük.
4. Türkçe fine-tune fırsatı. 3B ve 7.9B modeller, akademik grupların ve küçük startup’ların LoRA/QLoRA ile Türkçe için fine-tune edebileceği ölçekte. Boğaziçi, ODTÜ, Sabancı NLP gruplarının bu alanda yayın üretme fırsatı.
Ekosistemdeki daha büyük soru
Bu iki release, daha büyük bir sorunun parçası: frontier AI’ın gerçek anlamı ne?
“En büyük model = en iyi AI” anlatısı, cloud API sağlayıcıları (OpenAI, Anthropic, Google) için avantajlı. Çünkü büyük modeller local çalıştırılamıyor — kullanıcı zorunlu olarak API’ye para ödemek zorunda.
Ama “akıllı specialized küçük model + on-device deployment” anlatısı, bu iş modelini erozyona uğratıyor. Kullanıcı, artık “ChatGPT Plus abonesi ol veya AI kullanma” ikilemine sıkışmıyor.
Ling-3.0-tiny’nin GPQA 73.4 skoru, GPT-4 seviyesindeki bir modeli laptop’ta çalıştırma imkanı sunuyor. TwiL-LM3’ün formal logic performansı, bir specialized domain’de 40 kat büyük modeli geçme kabiliyeti gösteriyor.
Bu iki nokta, önümüzdeki 3-5 yılın AI kullanım kültürünü değiştirebilir.
Sonuç: küçük ama akıllı çağı başladı
Ling-3.0-tiny ve TwiL-LM3, iki paralel duyuruda aynı gerçeği vurguluyor: küçük, verimli, açık kaynak modeller pratik AI kullanımının merkezine oturuyor.
Bu, büyük modellerin sonu değil. Frontier reasoning, karmaşık agentic task, çoklu-modaliteli anlama — bunlar için Claude Fable 5, GPT-5.6 Sol, Kimi K3 gibi devler hala önemli. Ama günlük kullanımın büyük kısmı için (chat, özet, basit reasoning, spesifik domain görevler) küçük modeller yeterli oluyor.
Pratik öneri: geliştiriciyseniz veya AI-first bir ürün yapıyorsanız, iki model üzerinde deneyim yapın:
- Ling-3.0-tiny — genel reasoning için.
- TwiL-LM3 — formal logic senaryolarında.
Önümüzdeki aylarda daha çok bu tarz “küçük ama akıllı” model release’i bekleyebiliriz. Kimi K3-tiny, DeepSeek V4 Flash-mini, Qwen 3.6-tiny — hepsi muhtemel. Cepheye giren küçük modeller, önümüzdeki dönemin en aktif open source alanı olacak.
Bir de büyük şirket cephesinden bakış: OpenAI, Anthropic, Google için tehdit. Kullanıcı laptop’unda ücretsiz çalışan bir Ling-3.0-tiny’nin GPT-4 seviyesinde reasoning yapması, cloud API subscription modelinin sürdürülebilirliğini uzun vadede sorguya çekiyor. Yakın vadede consumer segment kayması, orta vadede enterprise segmentte fiyat baskısı.
Küçük ama akıllı çağı başladı. Ve nerede duracağını henüz bilmiyoruz.

Bir yanıt yazın