MiniMax H3 は汎用のマルチモーダル生成モデルです。テキスト、画像、動画、音声をひとつのコンテキストとして読み取り、ネイティブステレオ音声付きの動画を 2K で最長 15 秒まで返します。MiniMax はこのモデルをコストパフォーマンスで位置づけ、2K の 1 秒あたりの価格は主流モデルの 3 分の 1 未満だとしており、モデルの重みを公開する計画があると表明しています。
機能のスナップショット
2K
デフォルト解像度
15s
最大クリップ長
stereo
ネイティブ音声
実際の制作ワークフローにマッピングされた実践的な価値。
メリット
01
4 本のパイプラインではなく、ひとつのコンテキスト
テキスト、画像、動画、音声をひとつのコンテキストとして入力するため、「このクリップのカメラの動きを使い、この画像の人物に歌わせ、この声に合わせて」というプロンプトが、別々の専門モデルに振り分けられるのではなく、ひとつの指示として理解されます。
メリット
02
音を映像と同時に生成
音声は映像と同時に生成されてネイティブステレオとして出力されるため、セリフ、効果音、環境音は後から重ねるのではなく、最初からショットに揃った状態で届きます。
メリット
03
より低い 1 秒あたりコストで 2K
2K は上位プランではなくデフォルトです。MiniMax は H3 の 2K での 1 秒あたり価格を主流モデルの 3 分の 1 未満、768p で動かした場合は主流の 720p の半分未満としています — これは大量に反復するときのコストを変えます。
ソース素材から再利用可能な結果までのシンプルな 3 ステップのパス。
ステップ 1
コンテキストを組み立てる
手元のリファレンス素材を持ち込みます — カメラの動きにはクリップ、被写体には画像、声には音声を。
ステップ 2
関係を説明する
リファレンスが目標の動画とどう関係するかを、普通の言葉で書きます。モーダルをまたぐ推論は H3 自身が解決します。
ステップ 3
生成して反復する
2K・ステレオ音声で最長 15 秒までレンダリングし、そこから反復します — 何度も回すことを現実的にしているのは 1 秒あたりのコストです。
最長 15 秒で、デフォルトの解像度として 2K が提供されます。768p の階層も用意されており、MiniMax が示す最も安い 1 秒あたりの価格はこの階層のものです。
H3 は音声を映像と同時に生成し、出力は後から混ぜたモノラルトラックではなくネイティブステレオです。
MiniMax はモデルの重みを公開する意向を表明し、設計目標としてハードウェア互換性とカスタマイズ性を挙げています。実際にリリースされるまでは、現時点で保証されたものではなく、提供予定として扱ってください。