MiniMax H3 (Hailuo 3.0): tek transformer, metin + görsel + video + ses girdi, native stereo ses ile 2K video çıktı — donanım gereksinimleri, fiyat ve open weights durumu

MiniMax, 31 Temmuz 2026’da MiniMax H3’ü duyurdu. Yaygın olarak Hailuo 3.0 (veya Hailuo 03) olarak da bilinen aynı model — MiniMax’in tüketici video uygulaması Hailuo AI’dan miras alınan takma ad. Kritik yenilik: bu, video modelinden çok daha fazlası. Tek bir transformer, metin + görsel + video + ses girdilerini ortak bağlam olarak anlıyor, çıktı olarak 2K çözünürlükte, 4-15 saniye uzunluğunda, native stereo ses ile birlikte üretilmiş video veriyor.

Yani ne demek? Şu ana kadar bir video üretmek için stack’iniz şöyleydi: metin-to-video için bir model, ses üretmek için ayrı bir TTS, background music için başka bir model, ses efektleri için bir kütüphane, sonra hepsini Premiere/DaVinci’de birleştirme. H3 ile tek API çağrısında görüntü + diyalog + oda sesi + efektler beraber çıkıyor. Aynı prompt içinde referans imaj (9 taneye kadar), referans video (3 taneye kadar), referans ses (3 taneye kadar) kullanabilirsiniz.

Örnek prompt (MiniMax’in kendi verdiği): “Video 1’deki Hitchcock kamera hareketini referans al, Image 2’deki karakter söylesin, vokaller Audio 3 ile eşleşsin.”

Ama önemli bir uyarı: ağırlıklar henüz yayınlanmadı. MiniMax “önümüzdeki günlerde” açacaklarını söylüyor. Hugging Face’te MiniMaxAI/MiniMax-H3 repository’si duyuruldu ama şu an içi boş — model kartı, safetensors, config dosyaları hepsi bekleniyor. Yani “open weights model” olarak duyuruldu ama fiili olarak henüz self-host edemezsiniz.

Bu yazıda H3’ün ne olduğunu, mimari yeniliklerini, ne zaman ve hangi donanımla çalıştırabileceğinizi (tahminler dahil), ekosistemdeki yerini ve pratik karar rehberini inceleyeceğiz.

H3 vs Hailuo 2.3: paradigma değişimi

Hailuo 02 / 2.3 (önceki nesil) klasik bir video modeli: prompt veya tek görsel alır, video üretir. 1080p, ~10 saniye, ses yok.

H3, tamamen farklı bir sınıf:

Hailuo 2.3 MiniMax H3
Çıktı 1080p, ~10s 2K (1440px kısa kenar), 4-15s
Girdi Prompt veya tek görsel Metin + 9 görsel + 3 video + 3 ses
Ses Yok (sessiz) Native stereo (görüntüyle üretiliyor)
Editing Yeniden çekim Cümle-tabanlı düzenleme
Frame rate 24 fps 24 fps

MiniMax duyurusunda enterprise-friendly bir slogan var: “task silolarını birleştirdik.” Şu ana kadar farklı görev için farklı uzman modeller vardı — görsel editing için ayrı, ses için ayrı, referans türleri için ayrı. H3 hepsini bir modele koyuyor.

Mimari: 4 temel yapı taşı

H3, birbirine yapıştırılmış uzman modeller değil. Dört isimlendirilmiş teknolojiden inşa edilmiş tek multimodal model:

1. Contextual Omni Representation. Kaynak materyali (video, ses, görsel) dile distille eden bir captioning pipeline. Örnek sample başına ~100K token inference’ı ortalama ~4K token’a düşürüyor. Dil, “bağlam ile hedef video arasındaki genelleştirilebilir köprü” oluyor.

2. H3-VAE. Yeniden inşa edilmiş tokenizer. Sıkıştırma, 4x etkili sequence length kazancı sağlıyor. Yani aynı hesaplama bütçesinde 4x daha uzun sekans işlenebiliyor. Bu, native 2K çıktıyı mümkün kılan yenilik.

3. H3-Omni Transformer. Understanding ve generation hesaplamayı ayıran training mimarisi. Multimodal bağlam, sequence-length varyansını 3x artırıyor — bu ayrım, eğitim throughput’unu neredeyse %30 artırıyor.

4. In-Context Regeneration. 2K çıktı için, ayrı bir super-resolution modülü kullanmak yerine, base model kendi düşük çözünürlüklü çıktısını in-context olarak regenerate ediyor. Bu, klasik SR’nın “tahmin etmek zorunda” olduğu ince detayları (küçük yazılar, marka işaretleri) koruyor.

Önemli detay: MiniMax, Hailuo-02 mimarisini “gereksiz karmaşıklık” olarak bir kenara bırakmış. Tam teknik rapor henüz yayınlanmadı; tüm bu bilgi vendor’ın kendi açıklamasından — bağımsız peer-reviewed spec değil.

Ağırlıklar durumu: söz verildi, teslim edilmedi

H3, “open weights” olarak pazarlanıyor ama 1 Ağustos 2026 itibarıyla:

  • MiniMaxAI organization sayfası: H3 için repo listede yok.
  • “minimax h3” için model araması: 0 sonuç.
  • Model kartı: yok.
  • Doğrulanmış parametre sayısı: yok.
  • Documented VRAM floor: yok.
  • Resmi benchmark tablosu: yok.

MiniMax duyurusu: “önümüzdeki günlerde ağırlıkları açacağız, geçerli yasa ve regülasyonlara tabi olarak. Donanım uyumluluğu, H3’ün en erken tasarım aşamalarından beri kilit bir değerlendirme.”

Beklenen lisans: MiniMax Community License

Artificial Analysis’in raporuna göre H3, MiniMax Community License altında yayınlanacak. Kapsam: ticari kullanım $20M gelirin altındaki kurumlar için serbest, önemli attribution şartlarıyla.

Bu, MiniMax’in önceki M-serisi modelleri için kullandığı MIT lisansından belirgin farklı. M2.7 zaten bu streak’i bozan ilk model olmuştu ve community eleştirisi almıştı. H3 aynı yolda ilerliyor.

Pratik anlamı: küçük startup veya bireysel geliştirici için ticari kullanım serbest. Enterprise (yıllık $20M+ gelirli) için MiniMax ile ayrı lisans anlaşması gerekli.

Donanım gereksinimleri: bekleyen bilgiler + eğitim tahminleri

Resmi hardware spec yok. Ama karşılaştırılabilir modellerin donanım gereksinimleri üzerinden makul tahmin yapılabilir.

Karşılaştırılabilir video generation modelleri:

Model Parametre (tahmini) Inference VRAM Hız (5s clip)
Wan 2.5 (Alibaba) 14B ~24 GB (FP16) ~90s
Hunyuan Video (Tencent) 13B ~24 GB (FP16) ~120s
LTX Video (Lightricks) ~2B ~12 GB ~30s
CogVideoX-5B 5B ~16 GB ~60s
Sora (kapalı) ~30-50B tahmini Bilinmiyor Bilinmiyor
Kling (kapalı) Bilinmiyor Bilinmiyor Bilinmiyor

H3’ün ekstra karmaşıklığı:

  • 2K çıktı (1080p yerine).
  • Native audio üretimi (ayrı stream).
  • Multimodal input (9 görsel + 3 video + 3 ses referans).
  • 15 saniye uzunluk (10 yerine).

Bu ek yüklere göre tahmini donanım profili (kesin doğrulama sonrası revize edilecek):

Deployment senaryosu Minimum donanım Tavsiye donanım Fiyat
Bireysel deneme (kısa clip, düşük çözünürlük) 1x RTX 4090 (24GB) + INT4 1x RTX 5090 (32GB) + INT8 $1.5-2.5K
2K çıktı (tam kalite) 1x H100 (80GB) 2x H100 veya 1x B200 $25-40K
Batch üretim (birden fazla concurrent job) 4x H100 8x H100 veya 4x B200 $150-300K
Enterprise deployment DGX H200 node Multi-node H200/B200 cluster $500K+

Bir uyarı: bu tahminler, comparable video generation modellerinin ölçekleme davranışına dayalı. H3’ün gerçek parametre sayısı henüz açıklanmadı. Model, muhtemelen 20-40B parametre aralığında. Ama gerçek rakamı ancak model kartı yayınlandığında öğreneceğiz.

Inference süresi tahminleri: H100 üzerinde 2K 5-saniyelik bir clip muhtemelen 2-4 dakika alır. RTX 5090 üzerinde quantized versiyon ise 8-15 dakika bekleyebilir. 15 saniyelik clip için lineer olarak ~3x daha uzun.

API ile kullanım (bugün mümkün)

Ağırlıklar gelene kadar API tek programatik yol:

  • Fiyat: 2K video için $0.13/saniye ($7.80/dakika).
  • 768p tier (closed beta): $0.09/saniye.
  • Referans ses: ücretsiz.
  • İlk 5 referans görsel: ücretsiz, sonrası $0.04 her biri.
  • Input video: output tier fiyatı üzerinden süreye göre ücretlenir.

Ölçek için: 6 saniyelik 2K sesli clip $0.78. Karşılaştırma: 6 saniyelik Hailuo 2.3 768p $0.28, 1080p $0.49.

Basit Python örneği (async task pattern):

import os, time, requests
headers = {"Authorization": f"Bearer {os.environ['MINIMAX_API_KEY']}"}

payload = {
    "model": "MiniMax-H3",
    "content": [
        {"type": "text", "text": "Karakter konuşuyor: rüzgarla akış."},
        {"type": "video_url", "video_url": {"url": "https://.../motion.mp4"}, "role": "reference_video"},
        {"type": "audio_url", "audio_url": {"url": "https://.../voice.mp3"}, "role": "reference_audio"},
    ],
    "resolution": "2K",
    "duration": 5,
    "ratio": "adaptive",
}

task_id = requests.post("https://api.minimax.io/v2/video_generation",
                        headers=headers, json=payload).json()["task_id"]

while True:
    time.sleep(10)
    task = requests.get(f"https://api.minimax.io/v2/query/video_generation/{task_id}",
                        headers=headers).json()["task"]
    if task["status"] == "succeeded":
        open("output.mp4", "wb").write(requests.get(task["content"]["url"]).content)
        break

Alternatif erişim: OpenRouter, Morphic. MiniMax Hub’da 3 ücretsiz H3 üretimi mevcut.

Benchmark: Artificial Analysis’in erken değerlendirmesi

MiniMax duyurusunda hiç benchmark tablosu yok. Teknik rapor bekleniyor. Şu ana kadar tek sistematik üçüncü taraf değerlendirmesi Artificial Analysis’den geldi (lansman günü yayınlandı):

  • #1 Video Editing. Instruction-tabanlı editing kategorisinde. AA’ya göre “birkaç modelin sunduğu bir yetenek”.
  • #2 Text-to-Video. Sesli üretimlerde.
  • #3 Image-to-Video. Sesli üretimlerde.

AA’nın dakika başı maliyet karşılaştırması:

Model Çözünürlük Dakika başı maliyet
MiniMax H3 2K + audio ~$7.80
Gemini Omni Flash ~$6.00
HappyHorse-1.1 ~$9.90
Kling 3.0 1080p ~$20.16
Dreamina Seedance 2.0 1080p ~$22.45

Yani H3, kapalı frontier modelleri Kling 3.0 ve Seedance 2.0’ı 2.5-3x daha ucuza kesip üstüne native audio + editing modu ekliyor.

İki uyarı: Bu tek bir üçüncü taraf arena run’u, peer-reviewed suite değil. Ve “open weights lideri” iddiası prospektif — ağırlıklar planlanan lisans altında geldiği koşuluyla.

Referans girdi limitleri

Multimodal input için pratik sınırlar:

  • Görsel: ≤ 9 (JPG/JPEG/PNG/WEBP/HEIC/HEIF, ≤ 30 MB her biri).
  • Video: ≤ 3 clip (MP4/MOV, H.264/H.265, ≤ 50 MB her biri), 2-15s her biri, toplam ≤ 15s.
  • Ses: ≤ 3 clip (WAV/MP3, ≤ 15 MB her biri), 2-15s her biri. Ses tek başına gönderilemez — görsel veya video ile birlikte gitmeli.
  • Toplam: 12 dosya, request body ≤ 64 MB, prompt ≤ 7,000 karakter.
  • Kısıt: image-to-video ve reference-to-video mutually exclusive — aynı request’te karıştırılamaz.

İçerik pratiği: tek üretim bir görsel’den yüz, bir video’dan hareket/kamera açısı, bir ses’ten ses tonu miras alabilir. Bu H3’ün ana konumlanmayı sağlayan özelliği.

Sınırlamalar ve açık sorular

  • Ağırlıklar askıda. HF repo yok, model kartı yok, parametre sayısı yok, doğrulanmış donanım tabanı yok.
  • Lisans belirsizliği. Community License planlaması (%$20M gelir altı + attribution) fonlanmış ekipler için gerçek bir kısıt.
  • Eval eksikliği. Resmi benchmark tablosu yok, teknik rapor henüz yok.
  • Kapsam sınırları. 4-15 saniye per üretim, ses referansları görsel/video ile birlikte gitmek zorunda, subscription tier yok, 768p closed beta.
  • Yakında öncelikler: M-serisi LLM entegrasyonu, daha güçlü multimodal anlama, model ölçeği, daha yüksek çözünürlük.

Karar rehberi: kullanmalı mı, beklemeli mi?

Sizin durumunuz Tavsiye
Bugün branded/e-ticaret clip yayınlamak, tek call’da ses + editing API’yi şimdi kullanın
Self-hosted veya fine-tuned video generation gerek Ağırlıkları bekleyin; lisansı önce audit edin
Otomatize edit/iterasyon pipeline’ı Güçlü aday; kendi clip’lerinizle doğrulayın
Kesinlikle tekrarlanabilir araştırma Bekleyin
Uzun-form (>15s) çıktı Başka yere bakın veya üretim zincirleyin

Sorumlu kullanım uyarısı: H3’ün voice transfer ve referans-ses özellikleri güçlü. Ticari iş için birinin sesini veya benzerliğini klonlamadan önce izin alın.

Sonuç: video generation cephesinde yeni bir eşik

MiniMax H3, Hailuo hattının Hailuo 01’den bu yana en önemli yapısal değişimi. Task-siloed pipeline (T2I, I2V, editing, ses, SFX) yerine tek unified context + tek native-audio video output. Kapalı rakipler ile karşılaştırıldığında 2K’da 2.5-3x daha ucuz.

Ama önemli bir uyarı: bugün elde etmek istediğiniz ile self-host etmek istediğiniz arasında büyük fark var. API bugün mükemmel çalışıyor; open weights hala vaatte. Model kartı olmadan hangi donanımın çalıştıracağını kesin bilemiyoruz.

Muhtemel takvim:

  • Aug 2-10: HF weights release, model kartı, license file.
  • Aug 10-20: Community quantizations (GGUF, exl2, NF4), ComfyUI entegrasyonu.
  • Sep-Oct: LoRA fine-tune workflows, ControlNet varyantları.
  • Q4 2026: Consumer GPU üzerinde stable deployment (RTX 4090/5090 için optimized).

Kısa vadeli tavsiye: eğer branded content veya e-ticaret video üretimi ihtiyacınız varsa, MiniMax API’sını bugün kullanın. Eğer research veya self-hosted deployment planınız varsa, 1-2 hafta bekleyin — ağırlıklar gelene kadar altyapı seçimini yapmayın.

Hugging Face repo tracking için: huggingface.co/MiniMaxAI/MiniMax-H3. Ağırlıklar geldiğinde detaylı hardware benchmark ve local deployment rehberi ile geri döneceğiz.

Comments

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir