/ 오픈소스 / MiniMax-H3

MiniMax-H3

MiniMax-H3는 텍스트, 이미지, 비디오, 오디오 입력에서 동기화된 스테레오 오디오가 포함된 비디오를 생성하는 오픈 가중치 옴니모달 모델입니다.

PythonDeploy & Inference
⭐ GitHubhttps://github.com/MiniMax-AI/MiniMax-H3
5,245
스타 수
+0
스타 증가율
2026년 8월 11일
최근 업데이트
3
클릭 수

1. 프로젝트 개요

MiniMax-H3는 텍스트, 이미지, 비디오, 오디오 입력을 네이티브 동기화 스테레오 오디오가 포함된 일관된 비디오 출력으로 변환하는 오픈 가중치 옴니모달 생성 모델입니다. 별도의 비디오 및 오디오 생성 파이프라인을 하나로 결합해야 하는 문제를 해결합니다.

2. 배경 및 포지셔닝

MiniMax-H3(미니맥스의 소비자 제품에서는 Hailuo AI 3.0으로도 불림)는 무성의 비전 전용 비디오 생성기와 크리에이터가 실제로 필요로 하는 시청각 콘텐츠 사이의 격차를 해소하기 위해 만들어졌습니다. 즉, 립싱크된 대화, 음향 효과, 음악이 처음부터 포함된 단일 클립을 제공하며, 이후에 더빙하는 방식이 아닙니다.

핵심 임무는 하나의 모델이 혼합된 멀티모달 컨텍스트(자유 형식 텍스트와 참조 이미지, 비디오 클립, 오디오 트랙)를 읽고 시간적·음향적으로 일관된 결과를 생성하는 것입니다. 시각과 오디오에 별도의 모델(및 별도의 프롬프트)을 요구하지 않습니다.

유사한 오픈 가중치 비디오 생성기와 비교했을 때, MiniMax-H3의 주요 차별점은 최대 2K 해상도와 32kHz 스테레오 사운드의 네이티브 오디오-비디오 공동 생성과, 대부분의 유사 오픈 모델이 단일 체크포인트에서 함께 제공하지 않는 첫/마지막 프레임 및 다중 참조 조건화 모드를 지원한다는 점입니다.

3. 기능 분류

🎬 생성 모드 — 모델을 구동하는 주요 방식을 포괄하는 3가지 핵심 모드

  • 텍스트-비디오-오디오(T2VA): 텍스트 프롬프트만으로 전체 시청각 클립 생성
  • 첫/마지막 프레임 조건화(FL2VA): 지정된 시작 및/또는 끝 프레임에 클립 고정
  • 다중 참조 생성(Ref2VA): 최대 9개의 이미지, 3개의 비디오 클립, 3개의 오디오 트랙을 참조로 결합
  • 목적: 순수한 아이디어 구상부터 정밀한 참조 기반 제작까지 모든 것을 포괄

🧩 모델 아키텍처 — 종단 간 생성 경로를 구성하는 3단계 파이프라인

  • H3-Context-IR: 멀티모달 입력을 구조화된 중간 표현으로 전처리 및 해석
  • H3-Base: 768p 비디오와 오디오를 생성하는 33B 파라미터 트랜스포머
  • H3-Regenerate-2K: 출력을 2K로 업스케일하는 인컨텍스트 재생성 단계
  • 목적: "이해", "생성", "정제"를 구성 가능한 단계로 분리

🛠️ 배포 및 도구 — 다양한 규모와 통합 요구에 맞는 4가지 지원 추론 경로

  • 고처리량 다중 GPU 서버 배포를 위한 SGLang 및 vLLM
  • Python 네이티브 실험 및 파이프라인을 위한 diffusers
  • 노드 기반 코드 없는 워크플로우를 위한 ComfyUI
  • 목적: 팀이 기존 스택에 맞는 통합 경로를 선택할 수 있도록 지원

📚 스킬 및 프롬프팅 리소스 — 프롬프트 엔지니어링 및 다운스트림 도구를 위한 9가지 번들 워크플로우 스킬

  • h3-prompt-writing: Claude, OpenAI 및 기타 에이전트 플랫폼과 호환되는 휴대용 프롬프팅 스킬
  • 기본(base-en.txt) 및 참조 조건화(ref-en.txt) 프롬프팅용 참조 가이드
  • 목적: 의도한 샷, 모션, 오디오를 안정적으로 생성하는 프롬프트 작성 학습 곡선 단축

4. 주요 특징

  • 네이티브 동기화 오디오 — 비디오와 32kHz 스테레오 오디오가 하나의 모델에 의해 공동 생성되며, 이후에 합성되지 않으므로 대화, 음악, 음향 효과가 시각과 동기화됩니다.
  • 최대 2K 출력 — 기본 모델은 768p로 생성하고 H3-Regenerate-2K 단계가 인컨텍스트에서 업스케일하여, 분리된 별도 학습 초해상도 단계를 피합니다.
  • 풍부한 멀티모달 참조 — Ref2VA 모드는 최대 9개의 이미지, 3개의 비디오 클립, 3개의 오디오 트랙을 동시에 수용하여 단일 호출로 복잡한 합성 장면 구성을 가능하게 합니다.
  • 유연한 종횡비 및 길이 — 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 출력을 24 FPS에서 4~15초로 지원하여 시네마틱 및 숏폼 세로 형식을 모두 포괄합니다.
  • 다국어 지원 — 안정적인 출력 품질을 제공하는 11개 언어와 일부 추가 언어를 부분 지원하여 영어 전용 워크플로우가 아닌 글로벌 콘텐츠 파이프라인에 사용할 수 있습니다.
  • 다중 배포 계층 — 단일 호출 클라우드 API부터 SGLang/vLLM을 통한 자체 호스팅 다중 GPU 추론까지 지원하므로, 팀은 호스팅 API로 시작하여 볼륨이 증가하면 자체 호스팅으로 전환할 수 있습니다.

5. 역할별 사용 사례

  • 일반 개발자: GPU 인프라를 관리하지 않고 클라우드 API(platform.minimax.io)를 통해 앱에 비디오-오디오 생성 기능을 통합합니다.
  • DevOps/SRE: SGLang 또는 vLLM을 사용하여 자체 관리 GPU 클러스터에서 오픈 가중치 체크포인트를 배포하고 확장하여 고처리량 추론을 수행합니다.
  • 데이터/연구 과학자: 멀티모달 생성 연구를 위해 H3-Omni-Transformer 아키텍처, 모달리티별 VAE, 3D 멀티모달 회전 위치 임베딩을 연구하거나 확장합니다.
  • 프로젝트 관리자: 동기화된 오디오-비디오 생성이 필요한 제품을 위한 빌드-대-구매 옵션으로 MiniMax-H3를 평가하고, 자체 호스팅 인프라에 투자하기 전에 호스팅 API로 빠른 프로토타이핑을 수행합니다.

6. 시작하기

필요한 것 찾기skills/ 디렉토리의 번들 스킬과 프롬프팅 가이드를 살펴보고, 프롬프트 작성 기본 사항은 skills/h3-prompt-writing/references/base-en.txt부터 시작하세요.

설치/통합 — Hugging Face에서 모델 가중치를 다운로드하고 로컬에서 서빙합니다:

hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3
sglang serve --model-path MiniMaxAI/MiniMax-H3 --num-gpus 4 --ulysses-degree 4

또는 로컬 설정 없이 platform.minimax.io(글로벌)에서 호스팅 API를 직접 호출할 수 있습니다.

기여GitHub 저장소에서 이슈나 토론을 열거나, 협업 문의는 [email protected]로 관리자에게 연락하세요.

7. 프로젝트 구조(선택 사항)

MiniMax-H3/
├── FL2VA/              # 첫/마지막 프레임-비디오 체크포인트
├── Ref2VA/             # 다중 참조-비디오 체크포인트
├── audio_scheduler/    # 오디오 생성 스케줄링 로직
├── audio_vae/          # 오디오 변분 오토인코더
├── processor/          # 멀티모달 컨텍스트 입력 전처리
├── scheduler/          # 확산/생성 스케줄러
├── text_encoder/       # 텍스트 인코딩 모듈
├── tokenizer/          # 텍스트 입력 토크나이저
├── transformer/         # H3-Omni-Transformer 코어 모델
├── vae/                # 시각 변분 오토인코더
├── skills/              # 번들 프롬프팅 및 워크플로우 스킬
└── model_index.json     # 모델 구성 요소 매니페스트

두 체크포인트 디렉토리(FL2VA/, Ref2VA/)는 작업별 가중치를 보유하며, 공유 transformer/, vae/, audio_vae/ 구성 요소가 코어 옴니모달 아키텍처를 정의합니다.

8. 관련 생태계

  • 추론 프레임워크: 서버급 배포용 SGLang 및 vLLM, Python 파이프라인용 diffusers, 시각적 워크플로우 구축용 ComfyUI.
  • 호스팅 플랫폼: platform.minimax.io(글로벌 API), hailuoai.video(소비자 웹 앱), hub.minimax.io(데스크톱 앱).
  • 모델 허브: 가중치는 Hugging Face의 MiniMaxAI/MiniMax-H3에서 원본 및 diffusers 호환 형식으로 배포됩니다.
  • 에이전트 생태계: h3-prompt-writing 스킬은 Claude, OpenAI 및 기타 에이전트 플랫폼에서 휴대 가능하도록 설계되었습니다.

9. 라이선스

MiniMax-H3는 MiniMax H3 커뮤니티 라이선스 계약에 따라 출시됩니다.

  • ✅ 커뮤니티 라이선스에 따라 연구, 개인 프로젝트 및 대부분의 상업적 응용 프로그램에 모델을 사용할 수 있습니다.
  • ❌ 불법, 음란 또는 권리 침해 콘텐츠를 생성하는 데 모델을 사용하지 마십시오. 이는 라이선스의 콘텐츠 검열 가드레일에 의해 명시적으로 제한됩니다.
  • ℹ️ 상업적 배포 전에 저장소의 전체 라이선스 텍스트를 검토하십시오. 커뮤니티 라이선스에는 여기에 요약되지 않은 사용 규모 또는 저작자 표시 조항이 포함되는 경우가 많습니다.

10. FAQ

Q: 참조 미디어 없이 텍스트만으로 오디오가 포함된 비디오를 생성할 수 있나요?
A: 예 — 텍스트-비디오-오디오(T2VA) 모드는 텍스트 프롬프트만으로 동기화된 스테레오 오디오가 포함된 전체 클립을 생성합니다.

Q: FL2VA와 Ref2VA 체크포인트의 차이점은 무엇인가요?
A: FL2VA는 지정된 첫 및/또는 마지막 프레임에 생성을 조건화하는 반면, Ref2VA는 최대 9개의 이미지, 3개의 비디오 클립, 3개의 오디오 트랙의 더 넓은 혼합을 참조로 허용합니다.

Q: MiniMax-H3를 사용하려면 로컬 GPU가 필요한가요?
A: 아니요 — 로컬 인프라 없이 platform.minimax.io에서 호스팅 API를 호출하거나, 규모나 사용자 지정이 필요하면 SGLang/vLLM을 통해 오픈 가중치를 자체 호스팅할 수 있습니다.

Q: 지원되는 해상도와 길이는 무엇인가요?
A: 최대 2K 해상도(기본 768p, H3-Regenerate-2K로 업스케일)와 24 FPS에서 4~15초 클립을 6가지 종횡비로 지원합니다.

Q: 모델이 영어 프롬프트로 제한되나요?
A: 아니요 — 11개 언어를 안정적으로 지원하며 추가 언어도 부분 지원합니다.

11. 빠른 링크

12. 요약

MiniMax-H3는 개발자와 연구자에게 혼합 텍스트, 이미지, 비디오, 오디오 입력에서 네이티브 동기화 스테레오 오디오가 포함된 비디오를 생성하는 오픈 가중치 경로를 제공합니다. 이는 일반적으로 별도의 모델을 결합해야 하는 기능입니다. 호스팅 API를 통한 빠른 프로토타입부터 SGLang 또는 vLLM을 통한 대규모 자체 호스팅 파이프라인까지 시청각 콘텐츠 생성이 필요한 팀이 주요 대상이며, 연구자는 완전히 검사 가능한 옴니모달 트랜스포머 아키텍처를 연구하거나 확장할 수 있습니다.