首页 / 开源榜单 / MiniMax-H3

MiniMax-H3

MiniMax-H3 是一个开放权重的全模态模型,能够根据文本、图像、视频和音频输入生成带有同步立体声的视频。

PythonDeploy & Inference
⭐ GitHubhttps://github.com/MiniMax-AI/MiniMax-H3
5,245
Star 数
+0
Star 增速
2026年8月11日
最后更新
3
点击数

1. 项目概述

MiniMax-H3 是一个开放权重的全模态生成模型,可将文本、图像、视频和音频输入转化为连贯的视频输出,并自带原生同步立体声——解决了以往需要将独立的视频和音频生成流程拼接在一起的问题,将其统一为一个模型。

2. 背景与定位

MiniMax-H3(在 MiniMax 的消费级产品中也被称为 Hailuo AI 3.0)旨在弥合无声的纯视觉视频生成器与创作者真正需要的视听内容之间的差距——即一段从一开始就内置唇形同步对话、音效和音乐的视频片段,而非事后配音。

其核心使命是让一个模型能够读取混合多模态上下文——自由格式文本加上参考图像、视频片段和音轨——并生成在时间和声学上连贯的结果,而不是为视觉和音频分别使用不同的模型(以及不同的提示词)。

与同类开放权重视频生成器相比,MiniMax-H3 的主要差异化优势在于原生联合音视频生成能力,最高支持 2K 分辨率和 32 kHz 立体声,同时还提供首帧/末帧条件控制以及多参考条件模式,这些功能在大多数同类开放模型中无法同时集成于一个检查点中。

3. 功能分类

🎬 生成模式 — 3 种核心模式,覆盖驱动模型的主要方式

  • 文本生成视频与音频(T2VA):仅凭文本提示即可生成完整的视听片段
  • 首帧/末帧条件控制(FL2VA):将片段锚定到指定的起始和/或结束帧
  • 多参考生成(Ref2VA):组合最多 9 张图像、3 个视频片段和 3 条音轨作为参考
  • 目的:覆盖从纯创意构思到精确、受参考约束的制作的各类场景

🧩 模型架构 — 3 个流水线阶段,构成端到端生成路径

  • H3-Context-IR:将多模态输入预处理并解释为结构化中间表示
  • H3-Base:生成 768p 视频和音频的 33B 参数 Transformer 模型
  • H3-Regenerate-2K:上下文内再生成阶段,将输出升级至 2K
  • 目的:将“理解”、“生成”和“精炼”分离为可组合的阶段

🛠️ 部署与工具 — 4 条受支持的推理路径,满足不同规模和集成需求

  • SGLang 和 vLLM 用于高吞吐量、多 GPU 服务器部署
  • diffusers 用于 Python 原生实验和流水线
  • ComfyUI 用于基于节点的无代码工作流
  • 目的:让团队选择与其现有技术栈匹配的集成路径

📚 技能与提示词资源 — 9 个内置工作流技能,用于提示词工程和下游工具

  • h3-prompt-writing:一个可移植的提示词技能,兼容 Claude、OpenAI 及其他智能体平台
  • 基础提示词(base-en.txt)和参考条件提示词(ref-en.txt)的参考指南
  • 目的:缩短编写能够可靠生成预期镜头、运动和音频的提示词的学习曲线

4. 核心亮点

  • 原生同步音频 — 视频和 32 kHz 立体声由同一个模型联合生成,而非事后合成,因此对话、音乐和音效始终与画面保持同步。
  • 最高 2K 输出 — 基础模型以 768p 生成,H3-Regenerate-2K 阶段在上下文内进行升级,避免了脱节的、单独训练的超分辨率步骤。
  • 丰富的多模态参考 — Ref2VA 模式可同时接受最多 9 张图像、3 个视频片段和 3 条音轨,支持通过单次调用构建复杂的合成场景。
  • 灵活的宽高比和时长 — 支持 21:9、16:9、4:3、1:1、3:4 和 9:16 输出,时长 4–15 秒,24 FPS,兼顾电影级和短视频竖屏格式。
  • 多语言支持 — 稳定支持 11 种语言,并对其他语言提供部分支持,使其适用于全球内容流水线,而非仅限英文工作流。
  • 多层级部署 — 从单次调用云 API 到通过 SGLang/vLLM 自托管多 GPU 推理,团队可以先使用托管 API,随着规模增长再迁移到自托管。

5. 按角色划分的使用场景

  • 普通开发者:通过云 API(platform.minimax.io)将视频与音频生成集成到应用中,无需管理 GPU 基础设施。
  • DevOps/SRE:使用 SGLang 或 vLLM 在自管理 GPU 集群上部署和扩展开放权重检查点,实现高吞吐量推理。
  • 数据/研究科学家:研究或扩展 H3-Omni-Transformer 架构、模态专用 VAE 和 3D 多模态旋转位置编码,用于多模态生成研究。
  • 项目经理:将 MiniMax-H3 作为需要同步音视频生成产品的自建与购买选项进行评估,在投入自托管基础设施之前,使用托管 API 进行快速原型验证。

6. 快速开始

查找所需内容 — 浏览 skills/ 目录中内置的技能和提示词指南,从 skills/h3-prompt-writing/references/base-en.txt 开始了解提示词编写基础。

安装/集成 — 从 Hugging Face 下载模型权重并在本地提供服务:

hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3
sglang serve --model-path MiniMaxAI/MiniMax-H3 --num-gpus 4 --ulysses-degree 4

或者直接调用托管 API(platform.minimax.io,全球可用),无需任何本地设置。

贡献 — 在 GitHub 仓库 上提交 issue 或发起讨论,或通过 [email protected] 联系维护者洽谈合作。

7. 项目结构(可选)

MiniMax-H3/
├── FL2VA/              # 首帧/末帧到视频检查点
├── Ref2VA/             # 多参考到视频检查点
├── audio_scheduler/    # 音频生成调度逻辑
├── audio_vae/          # 音频变分自编码器
├── processor/          # 多模态上下文输入预处理
├── scheduler/          # 扩散/生成调度器
├── text_encoder/       # 文本编码模块
├── tokenizer/          # 文本输入分词器
├── transformer/         # H3-Omni-Transformer 核心模型
├── vae/                # 视觉变分自编码器
├── skills/              # 内置提示词和工作流技能
└── model_index.json     # 模型组件清单

两个检查点目录(FL2VA/Ref2VA/)保存任务特定权重,而共享的 transformer/vae/audio_vae/ 组件定义了核心全模态架构。

8. 相关生态

  • 推理框架:SGLang 和 vLLM 用于服务器级部署;diffusers 用于 Python 流水线;ComfyUI 用于可视化工作流构建。
  • 托管平台platform.minimax.io(全球 API)、hailuoai.video(消费级 Web 应用)、hub.minimax.io(桌面应用)。
  • 模型中心:权重通过 Hugging Face 以 MiniMaxAI/MiniMax-H3 分发,提供原始格式和兼容 diffusers 的格式。
  • 智能体生态h3-prompt-writing 技能设计为可跨 Claude、OpenAI 及其他智能体平台移植。

9. 许可证

MiniMax-H3 根据 MiniMax H3 社区许可协议 发布。

  • ✅ 允许将模型用于研究、个人项目以及社区许可允许的大多数商业应用。
  • ❌ 不得使用模型生成非法、色情或侵权内容——许可证的审核护栏明确禁止此类用途。
  • ℹ️ 商业部署前请查阅仓库中的完整许可证文本,因为社区许可通常包含此处未概述的使用规模或署名条款。

10. 常见问题

问:我可以仅凭文本生成带音频的视频,而无需任何参考媒体吗?
答:可以——文本生成视频与音频(T2VA)模式仅凭文本提示即可生成带有同步立体声的完整片段。

问:FL2VA 和 Ref2VA 检查点有什么区别?
答:FL2VA 根据指定的首帧和/或末帧进行条件生成,而 Ref2VA 接受更广泛的混合参考,最多 9 张图像、3 个视频片段和 3 条音轨。

问:使用 MiniMax-H3 需要本地 GPU 吗?
答:不需要——您可以直接调用 platform.minimax.io 上的托管 API,无需本地基础设施;或者如果您需要规模或定制化,也可以通过 SGLang/vLLM 自托管开放权重。

问:支持哪些分辨率和时长?
答:最高支持 2K 分辨率(默认 768p,通过 H3-Regenerate-2K 升级),4–15 秒片段,24 FPS,支持六种宽高比。

问:模型仅限于英文提示词吗?
答:不是——它稳定支持 11 种语言,并对其他语言提供部分支持。

11. 快速链接

12. 总结

MiniMax-H3 为开发者和研究人员提供了一条开放权重的路径,可从混合的文本、图像、视频和音频输入生成带有原生同步立体声的视频——这一能力通常需要拼接多个独立模型才能实现。需要视听内容生成的团队,从通过托管 API 快速原型到通过 SGLang 或 vLLM 进行大规模自托管流水线,是主要受众;而研究人员则获得了一个完全可检查的全模态 Transformer 架构,可供研究或扩展。