1. 專案概述
MiniMax-H3 是一個開放權重的全模態生成模型,可將文字、圖片、影片和音訊輸入轉換為具有原生同步立體聲的連貫影片輸出——解決了必須將獨立的影片和音訊生成管線拼接成一個統一模型的問題。
2. 背景與定位
MiniMax-H3(在 MiniMax 的消費級產品中也稱為 Hailuo AI 3.0)的誕生是為了填補僅有視覺的無聲影片生成器與創作者實際需要的視聽內容之間的差距——一個從一開始就內建對嘴對話、音效和音樂的單一剪輯,而非事後配音。
其核心使命是讓單一模型讀取混合的多模態上下文——自由形式文字加上參考圖片、影片剪輯和音訊軌道——並產生時間與聲學上連貫的結果,而不是需要為視覺和音訊分別使用獨立模型(以及獨立提示詞)。
與類似的開放權重影片生成器相比,MiniMax-H3 的主要差異化優勢在於原生聯合音訊-影片生成,最高可達 2K 解析度與 32 kHz 立體聲,加上首/尾幀條件控制與多參考條件模式,這些功能在大多數同類開放模型中無法同時在單一檢查點中提供。
3. 功能類別
🎬 生成模式 — 3 種核心模式,涵蓋驅動模型的主要方式
- 文字轉影片含音訊(T2VA):僅從文字提示詞生成完整的視聽剪輯
- 首/尾幀條件控制(FL2VA):將剪輯錨定到指定的起始和/或結束幀
- 多參考生成(Ref2VA):結合最多 9 張圖片、3 段影片剪輯和 3 條音訊軌道作為參考
- 目的:涵蓋從純粹構想到精確、受參考約束的製作等所有需求
🧩 模型架構 — 3 個管線階段,形成端到端的生成路徑
- H3-Context-IR:將多模態輸入預處理並解釋為結構化的中間表示
- H3-Base:生成 768p 影片和音訊的 33B 參數 Transformer
- H3-Regenerate-2K:將輸出放大至 2K 的上下文內再生成階段
- 目的:將「理解」、「生成」和「精煉」分離為可組合的階段
🛠️ 部署與工具 — 4 條受支援的推論路徑,適用於不同規模與整合需求
- SGLang 和 vLLM 用於高吞吐量、多 GPU 伺服器部署
- diffusers 用於 Python 原生實驗和管線
- ComfyUI 用於基於節點的無程式碼工作流程
- 目的:讓團隊選擇符合其現有技術棧的整合路徑
📚 技能與提示詞資源 — 9 個隨附的工作流程技能,用於提示詞工程和下游工具
- h3-prompt-writing:可攜式提示詞技能,相容於 Claude、OpenAI 和其他代理平台
- 基礎(
base-en.txt)和參考條件(ref-en.txt)提示詞的參考指南 - 目的:縮短編寫能可靠產生預期鏡頭、動作和音訊之提示詞的學習曲線
4. 主要亮點
- 原生同步音訊 — 影片和 32 kHz 立體聲由單一模型聯合生成,而非事後合成,因此對話、音樂和音效能與視覺內容保持同步。
- 最高 2K 輸出 — 基礎模型以 768p 生成,H3-Regenerate-2K 階段在上下文內放大,避免了脫節的、單獨訓練的超解析度步驟。
- 豐富的多模態參考 — Ref2VA 模式可同時接受最多 9 張圖片、3 段影片剪輯和 3 條音訊軌道,實現從單次呼叫進行複雜的合成場景建構。
- 靈活的寬高比和時長 — 支援 21:9、16:9、4:3、1:1、3:4 和 9:16 輸出,時長 4–15 秒,24 FPS,涵蓋電影級和短格式直立格式。
- 多語言支援 — 11 種語言具有穩定的輸出品質,並部分支援其他語言,使其可用於全球內容管線,而非僅限英文的工作流程。
- 多層級部署 — 從單次呼叫的雲端 API 到透過 SGLang/vLLM 自架多 GPU 推論,團隊可以從託管 API 開始,並隨著規模增長遷移到自架。
5. 依角色區分的使用案例
- 一般開發者:透過雲端 API(
platform.minimax.io)將影片含音訊生成整合到應用程式中,無需管理 GPU 基礎設施。 - DevOps/SRE:使用 SGLang 或 vLLM 在自管 GPU 叢集上部署和擴展開放權重檢查點,以實現高吞吐量推論。
- 資料/研究科學家:研究或擴展 H3-Omni-Transformer 架構、特定模態的 VAE 和 3D 多模態旋轉位置嵌入,以進行多模態生成研究。
- 專案經理:評估 MiniMax-H3 作為需要同步音訊-影片生成之產品的自建與購買選項,在投入自架基礎設施前,使用託管 API 進行快速原型驗證。
6. 入門指南
找到所需內容 — 瀏覽 skills/ 目錄中隨附的技能和提示詞指南,從 skills/h3-prompt-writing/references/base-en.txt 開始了解提示詞撰寫基礎。
安裝/整合 — 從 Hugging Face 下載模型權重並在本機提供服務:
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3
sglang serve --model-path MiniMaxAI/MiniMax-H3 --num-gpus 4 --ulysses-degree 4
或直接呼叫位於 platform.minimax.io(全球)的託管 API,無需任何本機設定。
貢獻 — 在 GitHub 儲存庫 開啟 issue 或討論,或透過 [email protected] 聯繫維護者洽談合作。
7. 專案結構(選用)
MiniMax-H3/
├── FL2VA/ # 首/尾幀轉影片檢查點
├── Ref2VA/ # 多參考轉影片檢查點
├── audio_scheduler/ # 音訊生成排程邏輯
├── audio_vae/ # 音訊變分自編碼器
├── processor/ # 多模態上下文的輸入預處理
├── scheduler/ # 擴散/生成排程器
├── text_encoder/ # 文字編碼模組
├── tokenizer/ # 文字輸入的分詞器
├── transformer/ # H3-Omni-Transformer 核心模型
├── vae/ # 視覺變分自編碼器
├── skills/ # 隨附的提示詞與工作流程技能
└── model_index.json # 模型元件清單
兩個檢查點目錄(FL2VA/、Ref2VA/)保存任務特定權重,而共享的 transformer/、vae/ 和 audio_vae/ 元件定義了核心全模態架構。
8. 相關生態系統
- 推論框架:SGLang 和 vLLM 用於伺服器級部署;diffusers 用於 Python 管線;ComfyUI 用於視覺工作流程建構。
- 託管平台:
platform.minimax.io(全球 API)、hailuoai.video(消費級網頁應用程式)、hub.minimax.io(桌面應用程式)。 - 模型中心:權重透過 Hugging Face 以
MiniMaxAI/MiniMax-H3發布,提供原始格式和 diffusers 相容格式。 - 代理生態系統:
h3-prompt-writing技能設計為可跨 Claude、OpenAI 和其他代理平台移植。
9. 授權條款
MiniMax-H3 根據 MiniMax H3 社群授權協議 發布。
- ✅ 允許在社群授權許可下將模型用於研究、個人專案和大多數商業應用。
- ❌ 不得使用模型生成非法、色情或侵權內容——授權條款中的審核防護措施明確禁止此類用途。
- ℹ️ 在商業部署前請檢視儲存庫中的完整授權條文,因為社群授權通常包含此處未摘要的使用規模或署名條款。
10. 常見問題
問:我可以僅從文字生成含音訊的影片,而不需要任何參考媒體嗎?
答:可以——文字轉影片含音訊(T2VA)模式僅從文字提示詞即可生成包含同步立體聲的完整剪輯。
問:FL2VA 和 Ref2VA 檢查點之間有什麼區別?
答:FL2VA 根據指定的首幀和/或尾幀進行條件生成,而 Ref2VA 接受更廣泛的混合參考,最多 9 張圖片、3 段影片剪輯和 3 條音訊軌道。
問:使用 MiniMax-H3 是否需要本機 GPU?
答:不需要——您可以呼叫位於 platform.minimax.io 的託管 API,無需本機基礎設施;如果您需要規模或客製化,也可以透過 SGLang/vLLM 自架開放權重。
問:支援哪些解析度和時長?
答:最高 2K 解析度(預設 768p,可透過 H3-Regenerate-2K 放大)和 4–15 秒的剪輯,24 FPS,支援六種寬高比。
問:模型僅限英文提示詞嗎?
答:不是——它穩定支援 11 種語言,並部分支援其他語言。
11. 快速連結
- 儲存庫:github.com/MiniMax-AI/MiniMax-H3
- 模型權重:huggingface.co/MiniMaxAI/MiniMax-H3
- 託管 API:platform.minimax.io
- 消費級應用程式:hailuoai.video
- 聯絡方式:[email protected]
12. 總結
MiniMax-H3 為開發者和研究人員提供了一條開放權重路徑,可從混合的文字、圖片、影片和音訊輸入生成具有原生同步立體聲的影片——這項能力通常需要拼接多個獨立模型。需要視聽內容生成的團隊(從透過託管 API 的快速原型到透過 SGLang 或 vLLM 的大規模自架管線)是主要受眾,而研究人員則可獲得一個完全可檢視的全模態 Transformer 架構來研究或擴展。