MiniMax H3는 범용 멀티모달 생성 모델입니다: 텍스트, 이미지, 비디오, 오디오를 하나의 컨텍스트로 읽고 네이티브 스테레오 사운드가 담긴 비디오를 2K로 최대 15초까지 내보냅니다. MiniMax는 이 모델을 가격 대비 성능으로 자리매김하며 2K 초당 비용이 주류 모델의 3분의 1 미만이라고 밝혔고, 모델 가중치를 공개할 계획이라고 말했습니다.
기능 스냅샷
2K
기본 해상도
15s
최대 클립 길이
stereo
네이티브 오디오
실제 생산 워크플로우에 매핑된 실용적인 가치.
혜택
01
네 개의 파이프라인이 아닌 하나의 컨텍스트
텍스트, 이미지, 비디오, 오디오가 하나의 컨텍스트로 들어가기 때문에 "이 클립의 카메라 움직임을 가져오고, 이 이미지 속 인물이 노래하게 하고, 이 목소리에 맞춰라"라는 프롬프트가 각각의 전문 모델로 나뉘어 전달되는 대신 하나의 지시로 이해됩니다.
혜택
02
화면과 함께 생성되는 사운드
오디오는 비디오와 함께 생성되어 네이티브 스테레오로 나오므로, 대사와 효과음, 환경음이 나중에 덧입혀지는 대신 이미 샷에 맞춰진 상태로 도착합니다.
혜택
03
더 낮은 초당 비용의 2K
2K는 프리미엄 등급이 아니라 기본값입니다. MiniMax는 H3의 2K 초당 가격을 주류 모델의 3분의 1 미만으로, 768p로 돌릴 때는 주류 720p의 절반 미만으로 제시합니다 — 대량 반복의 비용이 달라지는 지점입니다.
소스 자료에서 재사용 가능한 결과까지의 간단한 3단계 경로입니다.
단계 1
컨텍스트 조립하기
가지고 있는 레퍼런스 자료를 가져오세요 — 카메라 움직임은 클립으로, 피사체는 이미지로, 목소리는 오디오로.
단계 2
관계 설명하기
레퍼런스가 목표 비디오와 어떤 관계인지 평범한 말로 적으세요. 모달을 넘나드는 추론은 H3가 알아서 풀어냅니다.
단계 3
생성하고 반복하기
2K로 스테레오 오디오와 함께 최대 15초까지 렌더링한 다음 반복하세요 — 여러 번 돌리는 것을 현실적으로 만드는 건 초당 비용입니다.
최대 15초이며, 기본 해상도로 2K가 제공됩니다. 768p 등급도 있으며 MiniMax가 제시하는 가장 낮은 초당 가격은 이 등급 기준입니다.
H3는 오디오를 비디오와 함께 생성하며, 출력은 나중에 섞어 넣은 모노 트랙이 아니라 네이티브 스테레오입니다.
MiniMax는 하드웨어 호환성과 커스터마이징을 설계 목표로 들며 모델 가중치를 공개하겠다는 의향을 밝혔습니다. 실제 릴리스가 나오기 전까지는 현재 보장된 것이 아니라 예정된 것으로 보시기 바랍니다.