MiniMax, 31 Temmuz 2026’da MiniMax H3’ü duyurdu. Yaygın olarak Hailuo 3.0 (veya Hailuo 03) olarak da bilinen aynı model — MiniMax’in tüketici video uygulaması Hailuo AI’dan miras alınan takma ad. Kritik yenilik: bu, video modelinden çok daha fazlası. Tek bir transformer, metin + görsel + video + ses girdilerini ortak bağlam olarak anlıyor, çıktı olarak 2K çözünürlükte, 4-15 saniye uzunluğunda, native stereo ses ile birlikte üretilmiş video veriyor.
Yani ne demek? Şu ana kadar bir video üretmek için stack’iniz şöyleydi: metin-to-video için bir model, ses üretmek için ayrı bir TTS, background music için başka bir model, ses efektleri için bir kütüphane, sonra hepsini Premiere/DaVinci’de birleştirme. H3 ile tek API çağrısında görüntü + diyalog + oda sesi + efektler beraber çıkıyor. Aynı prompt içinde referans imaj (9 taneye kadar), referans video (3 taneye kadar), referans ses (3 taneye kadar) kullanabilirsiniz.
Örnek prompt (MiniMax’in kendi verdiği): “Video 1’deki Hitchcock kamera hareketini referans al, Image 2’deki karakter söylesin, vokaller Audio 3 ile eşleşsin.”
Ama önemli bir uyarı: ağırlıklar henüz yayınlanmadı. MiniMax “önümüzdeki günlerde” açacaklarını söylüyor. Hugging Face’te MiniMaxAI/MiniMax-H3 repository’si duyuruldu ama şu an içi boş — model kartı, safetensors, config dosyaları hepsi bekleniyor. Yani “open weights model” olarak duyuruldu ama fiili olarak henüz self-host edemezsiniz.
Bu yazıda H3’ün ne olduğunu, mimari yeniliklerini, ne zaman ve hangi donanımla çalıştırabileceğinizi (tahminler dahil), ekosistemdeki yerini ve pratik karar rehberini inceleyeceğiz.
H3 vs Hailuo 2.3: paradigma değişimi
Hailuo 02 / 2.3 (önceki nesil) klasik bir video modeli: prompt veya tek görsel alır, video üretir. 1080p, ~10 saniye, ses yok.
H3, tamamen farklı bir sınıf:
| Hailuo 2.3 | MiniMax H3 | |
|---|---|---|
| Çıktı | 1080p, ~10s | 2K (1440px kısa kenar), 4-15s |
| Girdi | Prompt veya tek görsel | Metin + 9 görsel + 3 video + 3 ses |
| Ses | Yok (sessiz) | Native stereo (görüntüyle üretiliyor) |
| Editing | Yeniden çekim | Cümle-tabanlı düzenleme |
| Frame rate | 24 fps | 24 fps |
MiniMax duyurusunda enterprise-friendly bir slogan var: “task silolarını birleştirdik.” Şu ana kadar farklı görev için farklı uzman modeller vardı — görsel editing için ayrı, ses için ayrı, referans türleri için ayrı. H3 hepsini bir modele koyuyor.
Mimari: 4 temel yapı taşı
H3, birbirine yapıştırılmış uzman modeller değil. Dört isimlendirilmiş teknolojiden inşa edilmiş tek multimodal model:
1. Contextual Omni Representation. Kaynak materyali (video, ses, görsel) dile distille eden bir captioning pipeline. Örnek sample başına ~100K token inference’ı ortalama ~4K token’a düşürüyor. Dil, “bağlam ile hedef video arasındaki genelleştirilebilir köprü” oluyor.
2. H3-VAE. Yeniden inşa edilmiş tokenizer. Sıkıştırma, 4x etkili sequence length kazancı sağlıyor. Yani aynı hesaplama bütçesinde 4x daha uzun sekans işlenebiliyor. Bu, native 2K çıktıyı mümkün kılan yenilik.
3. H3-Omni Transformer. Understanding ve generation hesaplamayı ayıran training mimarisi. Multimodal bağlam, sequence-length varyansını 3x artırıyor — bu ayrım, eğitim throughput’unu neredeyse %30 artırıyor.
4. In-Context Regeneration. 2K çıktı için, ayrı bir super-resolution modülü kullanmak yerine, base model kendi düşük çözünürlüklü çıktısını in-context olarak regenerate ediyor. Bu, klasik SR’nın “tahmin etmek zorunda” olduğu ince detayları (küçük yazılar, marka işaretleri) koruyor.
Önemli detay: MiniMax, Hailuo-02 mimarisini “gereksiz karmaşıklık” olarak bir kenara bırakmış. Tam teknik rapor henüz yayınlanmadı; tüm bu bilgi vendor’ın kendi açıklamasından — bağımsız peer-reviewed spec değil.
Ağırlıklar durumu: söz verildi, teslim edilmedi
H3, “open weights” olarak pazarlanıyor ama 1 Ağustos 2026 itibarıyla:
- MiniMaxAI organization sayfası: H3 için repo listede yok.
- “minimax h3” için model araması: 0 sonuç.
- Model kartı: yok.
- Doğrulanmış parametre sayısı: yok.
- Documented VRAM floor: yok.
- Resmi benchmark tablosu: yok.
MiniMax duyurusu: “önümüzdeki günlerde ağırlıkları açacağız, geçerli yasa ve regülasyonlara tabi olarak. Donanım uyumluluğu, H3’ün en erken tasarım aşamalarından beri kilit bir değerlendirme.”
Beklenen lisans: MiniMax Community License
Artificial Analysis’in raporuna göre H3, MiniMax Community License altında yayınlanacak. Kapsam: ticari kullanım $20M gelirin altındaki kurumlar için serbest, önemli attribution şartlarıyla.
Bu, MiniMax’in önceki M-serisi modelleri için kullandığı MIT lisansından belirgin farklı. M2.7 zaten bu streak’i bozan ilk model olmuştu ve community eleştirisi almıştı. H3 aynı yolda ilerliyor.
Pratik anlamı: küçük startup veya bireysel geliştirici için ticari kullanım serbest. Enterprise (yıllık $20M+ gelirli) için MiniMax ile ayrı lisans anlaşması gerekli.
Donanım gereksinimleri: bekleyen bilgiler + eğitim tahminleri
Resmi hardware spec yok. Ama karşılaştırılabilir modellerin donanım gereksinimleri üzerinden makul tahmin yapılabilir.
Karşılaştırılabilir video generation modelleri:
| Model | Parametre (tahmini) | Inference VRAM | Hız (5s clip) |
|---|---|---|---|
| Wan 2.5 (Alibaba) | 14B | ~24 GB (FP16) | ~90s |
| Hunyuan Video (Tencent) | 13B | ~24 GB (FP16) | ~120s |
| LTX Video (Lightricks) | ~2B | ~12 GB | ~30s |
| CogVideoX-5B | 5B | ~16 GB | ~60s |
| Sora (kapalı) | ~30-50B tahmini | Bilinmiyor | Bilinmiyor |
| Kling (kapalı) | Bilinmiyor | Bilinmiyor | Bilinmiyor |
H3’ün ekstra karmaşıklığı:
- 2K çıktı (1080p yerine).
- Native audio üretimi (ayrı stream).
- Multimodal input (9 görsel + 3 video + 3 ses referans).
- 15 saniye uzunluk (10 yerine).
Bu ek yüklere göre tahmini donanım profili (kesin doğrulama sonrası revize edilecek):
| Deployment senaryosu | Minimum donanım | Tavsiye donanım | Fiyat |
|---|---|---|---|
| Bireysel deneme (kısa clip, düşük çözünürlük) | 1x RTX 4090 (24GB) + INT4 | 1x RTX 5090 (32GB) + INT8 | $1.5-2.5K |
| 2K çıktı (tam kalite) | 1x H100 (80GB) | 2x H100 veya 1x B200 | $25-40K |
| Batch üretim (birden fazla concurrent job) | 4x H100 | 8x H100 veya 4x B200 | $150-300K |
| Enterprise deployment | DGX H200 node | Multi-node H200/B200 cluster | $500K+ |
Bir uyarı: bu tahminler, comparable video generation modellerinin ölçekleme davranışına dayalı. H3’ün gerçek parametre sayısı henüz açıklanmadı. Model, muhtemelen 20-40B parametre aralığında. Ama gerçek rakamı ancak model kartı yayınlandığında öğreneceğiz.
Inference süresi tahminleri: H100 üzerinde 2K 5-saniyelik bir clip muhtemelen 2-4 dakika alır. RTX 5090 üzerinde quantized versiyon ise 8-15 dakika bekleyebilir. 15 saniyelik clip için lineer olarak ~3x daha uzun.
API ile kullanım (bugün mümkün)
Ağırlıklar gelene kadar API tek programatik yol:
- Fiyat: 2K video için $0.13/saniye ($7.80/dakika).
- 768p tier (closed beta): $0.09/saniye.
- Referans ses: ücretsiz.
- İlk 5 referans görsel: ücretsiz, sonrası $0.04 her biri.
- Input video: output tier fiyatı üzerinden süreye göre ücretlenir.
Ölçek için: 6 saniyelik 2K sesli clip $0.78. Karşılaştırma: 6 saniyelik Hailuo 2.3 768p $0.28, 1080p $0.49.
Basit Python örneği (async task pattern):
import os, time, requests
headers = {"Authorization": f"Bearer {os.environ['MINIMAX_API_KEY']}"}
payload = {
"model": "MiniMax-H3",
"content": [
{"type": "text", "text": "Karakter konuşuyor: rüzgarla akış."},
{"type": "video_url", "video_url": {"url": "https://.../motion.mp4"}, "role": "reference_video"},
{"type": "audio_url", "audio_url": {"url": "https://.../voice.mp3"}, "role": "reference_audio"},
],
"resolution": "2K",
"duration": 5,
"ratio": "adaptive",
}
task_id = requests.post("https://api.minimax.io/v2/video_generation",
headers=headers, json=payload).json()["task_id"]
while True:
time.sleep(10)
task = requests.get(f"https://api.minimax.io/v2/query/video_generation/{task_id}",
headers=headers).json()["task"]
if task["status"] == "succeeded":
open("output.mp4", "wb").write(requests.get(task["content"]["url"]).content)
break
Alternatif erişim: OpenRouter, Morphic. MiniMax Hub’da 3 ücretsiz H3 üretimi mevcut.
Benchmark: Artificial Analysis’in erken değerlendirmesi
MiniMax duyurusunda hiç benchmark tablosu yok. Teknik rapor bekleniyor. Şu ana kadar tek sistematik üçüncü taraf değerlendirmesi Artificial Analysis’den geldi (lansman günü yayınlandı):
- #1 Video Editing. Instruction-tabanlı editing kategorisinde. AA’ya göre “birkaç modelin sunduğu bir yetenek”.
- #2 Text-to-Video. Sesli üretimlerde.
- #3 Image-to-Video. Sesli üretimlerde.
AA’nın dakika başı maliyet karşılaştırması:
| Model | Çözünürlük | Dakika başı maliyet |
|---|---|---|
| MiniMax H3 | 2K + audio | ~$7.80 |
| Gemini Omni Flash | — | ~$6.00 |
| HappyHorse-1.1 | — | ~$9.90 |
| Kling 3.0 | 1080p | ~$20.16 |
| Dreamina Seedance 2.0 | 1080p | ~$22.45 |
Yani H3, kapalı frontier modelleri Kling 3.0 ve Seedance 2.0’ı 2.5-3x daha ucuza kesip üstüne native audio + editing modu ekliyor.
İki uyarı: Bu tek bir üçüncü taraf arena run’u, peer-reviewed suite değil. Ve “open weights lideri” iddiası prospektif — ağırlıklar planlanan lisans altında geldiği koşuluyla.
Referans girdi limitleri
Multimodal input için pratik sınırlar:
- Görsel: ≤ 9 (JPG/JPEG/PNG/WEBP/HEIC/HEIF, ≤ 30 MB her biri).
- Video: ≤ 3 clip (MP4/MOV, H.264/H.265, ≤ 50 MB her biri), 2-15s her biri, toplam ≤ 15s.
- Ses: ≤ 3 clip (WAV/MP3, ≤ 15 MB her biri), 2-15s her biri. Ses tek başına gönderilemez — görsel veya video ile birlikte gitmeli.
- Toplam: 12 dosya, request body ≤ 64 MB, prompt ≤ 7,000 karakter.
- Kısıt: image-to-video ve reference-to-video mutually exclusive — aynı request’te karıştırılamaz.
İçerik pratiği: tek üretim bir görsel’den yüz, bir video’dan hareket/kamera açısı, bir ses’ten ses tonu miras alabilir. Bu H3’ün ana konumlanmayı sağlayan özelliği.
Sınırlamalar ve açık sorular
- Ağırlıklar askıda. HF repo yok, model kartı yok, parametre sayısı yok, doğrulanmış donanım tabanı yok.
- Lisans belirsizliği. Community License planlaması (%$20M gelir altı + attribution) fonlanmış ekipler için gerçek bir kısıt.
- Eval eksikliği. Resmi benchmark tablosu yok, teknik rapor henüz yok.
- Kapsam sınırları. 4-15 saniye per üretim, ses referansları görsel/video ile birlikte gitmek zorunda, subscription tier yok, 768p closed beta.
- Yakında öncelikler: M-serisi LLM entegrasyonu, daha güçlü multimodal anlama, model ölçeği, daha yüksek çözünürlük.
Karar rehberi: kullanmalı mı, beklemeli mi?
| Sizin durumunuz | Tavsiye |
|---|---|
| Bugün branded/e-ticaret clip yayınlamak, tek call’da ses + editing | API’yi şimdi kullanın |
| Self-hosted veya fine-tuned video generation gerek | Ağırlıkları bekleyin; lisansı önce audit edin |
| Otomatize edit/iterasyon pipeline’ı | Güçlü aday; kendi clip’lerinizle doğrulayın |
| Kesinlikle tekrarlanabilir araştırma | Bekleyin |
| Uzun-form (>15s) çıktı | Başka yere bakın veya üretim zincirleyin |
Sorumlu kullanım uyarısı: H3’ün voice transfer ve referans-ses özellikleri güçlü. Ticari iş için birinin sesini veya benzerliğini klonlamadan önce izin alın.
Sonuç: video generation cephesinde yeni bir eşik
MiniMax H3, Hailuo hattının Hailuo 01’den bu yana en önemli yapısal değişimi. Task-siloed pipeline (T2I, I2V, editing, ses, SFX) yerine tek unified context + tek native-audio video output. Kapalı rakipler ile karşılaştırıldığında 2K’da 2.5-3x daha ucuz.
Ama önemli bir uyarı: bugün elde etmek istediğiniz ile self-host etmek istediğiniz arasında büyük fark var. API bugün mükemmel çalışıyor; open weights hala vaatte. Model kartı olmadan hangi donanımın çalıştıracağını kesin bilemiyoruz.
Muhtemel takvim:
- Aug 2-10: HF weights release, model kartı, license file.
- Aug 10-20: Community quantizations (GGUF, exl2, NF4), ComfyUI entegrasyonu.
- Sep-Oct: LoRA fine-tune workflows, ControlNet varyantları.
- Q4 2026: Consumer GPU üzerinde stable deployment (RTX 4090/5090 için optimized).
Kısa vadeli tavsiye: eğer branded content veya e-ticaret video üretimi ihtiyacınız varsa, MiniMax API’sını bugün kullanın. Eğer research veya self-hosted deployment planınız varsa, 1-2 hafta bekleyin — ağırlıklar gelene kadar altyapı seçimini yapmayın.
Hugging Face repo tracking için: huggingface.co/MiniMaxAI/MiniMax-H3. Ağırlıklar geldiğinde detaylı hardware benchmark ve local deployment rehberi ile geri döneceğiz.

Bir yanıt yazın