Deutlich bessere Lippensync
Die Mundform folgt den tatsächlichen Silben und hält über eine ganze Zeile, sodass ein Sprechclip wie ein Mensch wirkt und nicht wie eine Puppe.
Grok Imagine Video 2.0 bringt deutlich bessere Lippensynchronisation, nativ erzeugten Ton, Bild-zu-Video und Text-zu-Video in einem Arbeitsbereich und einen Durchlauf, der schnell genug ist, um eine Zeile umzuschreiben und den Take erneut zu fahren. Erstelle jetzt dein Grok-Imagine-2-Video — keine Kamera, kein Mikrofon, keine Schauspieler.




Die Mundform folgt den tatsächlichen Silben und hält über eine ganze Zeile, sodass ein Sprechclip wie ein Mensch wirkt und nicht wie eine Puppe.
Dialog, Effekte und Raumklang entstehen im selben Durchlauf wie das Bild, deshalb läuft der Ton der Einstellung nie davon.
Lade ein Foto als Startbild hoch, und Grok Imagine 2 animiert von dort weiter — Bildaufbau, Motiv und Stil bleiben erhalten.
Ohne Ausgangsmaterial lässt du das Bild weg und beschreibst Einstellung, Zeile und Ton in einem einzigen Prompt.
Die meisten Clips sind in unter einer Minute fertig, du kannst also eine Dialogzeile umschreiben und den ganzen Take neu fahren.
Fotorealistische Porträts, Anime, Knetanimation und 3D-Figuren synchronisieren sich auf denselben Dialog, ohne das Werkzeug zu wechseln.
Grok Imagine 2 ist das neue Grok-Imagine-Modell. Die Schlagzeile ist nicht die Auflösung — es sind Lippensync und Ton.

Grok Imagine Video 2.0 formt die Lippen nach den tatsächlichen Silben und hält das Timing über eine ganze Zeile, mit weniger Drift, Mundflattern und Gesichtsverzerrung zwischen den Bildern. Erstelle Talking-Head-Clips, Dialogszenen, Produktsprecher und Charaktermonologe, die bei voller Lautstärke bestehen und nicht nur stummgeschaltet.

Grok Imagine 2 erzeugt den Ton im selben Durchlauf wie das Bild — Stimmen, Schritte, Raumklang, Wind und mechanische Details kommen aus dem Prompt statt aus einer nachträglich gelegten Spur. Erstelle Dialogclips, Atmo-Szenen, Produktspots und Actionmomente, in denen der Ton mit der Einstellung mitgeht, statt ihr hinterherzuhinken.

Jedes Bild und jede Stimme in einem Grok-Imagine-Video-2.0-Clip wird aus einem Prompt erzeugt, ein Dreh, eine Tonkabine und eine ganze Besetzung schrumpfen also auf ein Textfeld. Produziere UGC-Ads, Markenspots, Erklärvideos und Social Content in einem Takt, den ein Dreh nie erreichen könnte, und teste zehn Fassungen einer Zeile vor dem Mittagessen.

Zeile schreiben, Gesicht und Stimme gemeinsam erzeugen, posten. Keine Kamera, kein Mikrofon und keine Wiederholung, weil draußen ein Auto vorbeigefahren ist.
Modell wählen, Eingaben ergänzen und Bild und Ton in einem Durchlauf erzeugen.

Öffne den Generator oben und wähle im Modellselektor das Grok-Imagine-Modell.
Lade ein Startbild hoch oder schreibe einen Prompt mit der Zeile, die dein Motiv spricht, und dem Ton drumherum.
Wähle deine Einstellungen, klicke auf Generieren und spiel das Ergebnis mit Ton ab.
Erzeuge Bild und Ton in einem Durchlauf, mit einer Lippensync, die über die ganze Zeile hält. Keine Kamera, kein Mikrofon, keine Schauspieler.