大幅に向上したリップシンク
口の形が実際の音節に沿って動き、一文の間ずっと保たれます。会話動画が人形ではなく人として見えるようになります。
Grok Imagine Video 2.0 は、大幅に向上したリップシンク、ネイティブ生成される音声、同じワークスペースで使える画像から動画とテキストから動画、そしてセリフを一行書き直してもう一度撮り直せるほど速い生成サイクルを備えています。今すぐ Grok Imagine 2 の動画を作成しましょう — カメラなし、マイクなし、俳優なし。




口の形が実際の音節に沿って動き、一文の間ずっと保たれます。会話動画が人形ではなく人として見えるようになります。
セリフ、効果音、空間音が映像と同じ処理から生まれるため、音声がショットとずれることがありません。
写真を最初のフレームとしてアップロードすれば、Grok Imagine 2 がそこから動かします。構図、被写体、スタイルはそのまま保たれます。
素材が手元にないときは画像を省き、ショット・セリフ・音を一つのプロンプトで書くだけです。
ほとんどのクリップは1分以内に返ってくるので、セリフを一行書き直してテイク全体をやり直せます。
実写ポートレート、アニメ、クレイアニメ、3D キャラクターが、ツールを切り替えることなく同じセリフに同期します。
Grok Imagine 2 は新しい Grok Imagine モデルです。主役は解像度ではなく、リップシンクと音声です。

Grok Imagine Video 2.0 は口の形を実際の音節に合わせ、一文を通してタイミングを保ちます。フレーム間のずれ、口のちらつき、顔の歪みも少なくなりました。トーキングヘッド動画、会話シーン、商品スポークスパーソン、キャラクターの独白を、ミュートでしか見せられない映像ではなく、音を出して見ても成立する映像として作れます。

Grok Imagine 2 は音声を映像と同じ処理で生成します。声、足音、空間音、風、機械音のディテールはすべて後から重ねたトラックではなくプロンプトから生まれます。会話クリップ、雰囲気のあるシーン、商品スポット、アクションの見せ場を、音が映像に遅れず一緒に動く形で作れます。

Grok Imagine Video 2.0 のクリップに映るすべてのフレームとすべての声はプロンプトから生成されます。撮影、録音ブース、キャスト一式が一つの入力欄に収まります。UGC 広告、ブランドスポット、解説動画、SNS コンテンツを、実写では追いつけないペースで作り、昼食までに十通りのセリフを試せます。

セリフを書き、顔と声を一緒に生成して投稿するだけ。カメラもマイクも不要で、窓の外を車が通ったからと撮り直す必要もありません。
モデルを選び、素材を入れて、映像と音声を一度に生成します。

上のジェネレーターを開き、モデルセレクターで Grok Imagine モデルを選びます。
最初のフレームになる画像をアップロードするか、被写体が話すセリフと周囲の音を書いたプロンプトを入力します。
設定を選んで生成をクリックし、音を出して結果を再生してください。