嘴型同步大幅提升
嘴型跟著真實音節走,一整句話都不掉,一段說話的片子看起來像個人,不像木偶。
Grok Imagine Video 2.0 帶來大幅提升的嘴型同步、原生生成的聲音,圖生影片與文生影片同在一個工作區,出片快到你可以改一句台詞就重來一條。現在就生成你的 Grok Imagine 2 影片——沒有攝影機,沒有麥克風,沒有演員。




嘴型跟著真實音節走,一整句話都不掉,一段說話的片子看起來像個人,不像木偶。
台詞、音效和環境底噪與畫面同出一次生成,音訊不會跟鏡頭越對越偏。
上傳一張照片作為開場首幀,Grok Imagine 2 從這一幀開始往下動,保住你的構圖、主體和風格。
手上沒素材時,跳過圖片,用一句提示詞把鏡頭、台詞和聲音一起描述出來。
大多數片子一分鐘內出結果,改一句台詞就能把整條重跑一遍。
寫實人像、二次元、黏土定格、3D 角色,都能對上同一段台詞,不用換工具。
Grok Imagine 2 是全新的 Grok Imagine 模型。這次的主角不是解析度,是嘴型同步和聲音。

Grok Imagine Video 2.0 把嘴型對到真實音節上,一整句話都穩得住,幀間的漂移、嘴部抖動和面部變形都更少。用它做口播片、對話戲、產品代言人和角色獨白——開著音量看也立得住,而不是只能靜音播。

Grok Imagine 2 把音訊和畫面放在同一次生成裡——人聲、腳步、環境底噪、風聲和機械細節都來自提示詞,而不是事後疊的一條音軌。用它做對話短片、氛圍鏡頭、產品廣告和動作段落,聲音跟著鏡頭走,而不是慢半拍。

一條 Grok Imagine Video 2.0 片子裡的每一幀、每一句人聲都是從提示詞生成的,一次拍攝、一間錄音室、一整個劇組壓縮成一個輸入框。用它產出 UGC 廣告、品牌短片、講解影片和社群內容,節奏快到實拍追不上,一頓午飯前就能測完十版台詞。

寫好台詞,讓臉和聲音一起生成,然後發布。不用相機、不用麥克風,也不用因為窗外開過一台車而重錄。
選好模型,填入素材,一次生成畫面和聲音。

打開上方的生成器,在模型選擇器裡選 Grok Imagine 模型。
上傳一張首幀圖片,或者寫一句提示詞,把主體要說的台詞和周圍的聲音一起寫清楚。
調好參數,點擊生成,然後開著聲音回看結果。