提供中

映画のような映像を、音声つきで生成。

テキスト・画像・参照クリップを入れるだけで、同期したステレオ音声つきの動画が仕上がります。最長 15 秒、2K 画質、生成時間はおよそ 3 秒です。

参考素材を追加画像・動画・音声
~3s
生成時間
2K
最大解像度
15s
動画の長さ
33B
モデルパラメータ数

MiniMax H3 で作られた作品

動画をクリックすると、その場でご自身のアレンジを加えて作り直せます。

モデルはひとつ。 必要なものは、すべて内蔵。

ステレオ音声の同時生成、11 言語のリップシンク、6 種類のアスペクト比。後処理の工程は必要ありません。

ステレオ音声を同時生成

音声は映像と同じ一度の生成で作られます。セリフ、環境音、音楽までぴたりと同期し、後処理は不要です。

生成はおよそ 3 秒

H3-Max なら 15 秒・2K の動画がおよそ 3 秒で完成します。待ち時間も順番待ちもなく、その場で何度でも試せます。

2K 画質・6 種類の比率

最大 2K 解像度で、横型・縦型・正方形に加え、3 種類のシネマティックな比率にも対応。すべての形式をひとつのモデルでまかなえます。

11 言語のリップシンク

キャラクターが話す場面では、口の動きが音声に自動で合わせられます。対応は 11 言語で、手作業のキーフレーム調整は不要です。

よくあるご質問

MiniMax H3 とはどのようなモデルですか?
MiniMax H3 は 330 億パラメータのオープンソース密結合 Transformer 動画生成モデルです。一度の生成で、最長 15 秒・2K の映像をステレオ音声つきで出力します。
音声は自動で生成されますか?
はい。多くの動画モデルとは異なり、H3 はセリフ・効果音・環境音を動画生成の一部として同時に作ります。あとから別工程で付け足す必要はありません。
対応しているアスペクト比を教えてください。
16:9(横型)、9:16(縦型)、1:1(正方形)、4:3、3:4、21:9(ウルトラワイド)の 6 種類に対応しています。
生成にはどのくらい時間がかかりますか?
H3-Max では 15 秒の動画がおよそ 3 秒で完成します。解像度や長さの設定によって多少前後します。
手持ちの画像を入力に使えますか?
はい。H3 はテキストから動画、画像から動画、参照クリップから動画の 3 つのモードに対応しています。画像や参照クリップをアップロードして、生成結果を方向づけてください。

さっそく動画を作ってみましょう

アカウント登録なしでお試しいただけます。シーンを書いて「生成する」を押せば、音声つきで動き出します。