Sincronía labial mucho mejor
La boca sigue las sílabas reales y aguanta una línea entera, así que un clip hablado parece una persona y no una marioneta.
Grok Imagine Video 2.0 trae una sincronización labial mucho mejor, sonido generado de forma nativa, imagen a vídeo y texto a vídeo en un mismo espacio de trabajo, y un ciclo lo bastante rápido para reescribir una línea y repetir la toma. Crea tu vídeo de Grok Imagine 2 ahora — sin cámara, sin micrófono, sin actores.




La boca sigue las sílabas reales y aguanta una línea entera, así que un clip hablado parece una persona y no una marioneta.
Diálogo, efectos y ambiente salen de la misma pasada que la imagen, así que el audio nunca se desfasa del plano.
Sube una foto como primer fotograma y Grok Imagine 2 anima a partir de ahí, manteniendo intactos tu composición, sujeto y estilo.
Si no tienes material de partida, salta la imagen y describe el plano, la línea y el sonido en un solo prompt.
La mayoría de clips vuelven en menos de un minuto, así que puedes reescribir una línea y repetir la toma entera.
Retratos fotorrealistas, anime, plastilina y personajes 3D se sincronizan con el mismo diálogo sin cambiar de herramienta.
Grok Imagine 2 es el nuevo modelo de Grok Imagine. El titular no es la resolución, es la sincronía labial y el sonido.

Grok Imagine Video 2.0 ajusta los labios a las sílabas reales y mantiene el ritmo durante una línea entera, con menos deriva, temblor de boca y deformación facial entre fotogramas. Crea clips a cámara, escenas de diálogo, portavoces de producto y monólogos de personaje que aguantan a todo volumen y no solo en silencio.

Grok Imagine 2 genera el audio en la misma pasada que la imagen: voces, pasos, ambiente de sala, viento y detalle mecánico salen del prompt y no de una pista añadida después. Crea clips dialogados, escenas de ambiente, spots de producto y momentos de acción donde el sonido avanza con el plano en lugar de quedarse atrás.

Cada fotograma y cada voz de un clip de Grok Imagine Video 2.0 se generan a partir de un prompt, así que un rodaje, una cabina de sonido y todo un reparto caben en un campo de texto. Produce anuncios UGC, spots de marca, explainers y contenido social a un ritmo que el rodaje nunca podría seguir, y prueba diez versiones de una línea antes de comer.

Escribe la línea, genera cara y voz a la vez y publica. Sin cámara, sin micrófono y sin repetir la toma porque ha pasado un coche por la ventana.
Elige el modelo, añade tus entradas y genera imagen y sonido en una sola pasada.

Abre el generador de arriba y selecciona el modelo Grok Imagine en el selector.
Sube una imagen de primer fotograma, o escribe un prompt con la línea que dice tu sujeto y el sonido que la rodea.
Elige los ajustes, pulsa Generar y reproduce el resultado con el sonido activado.
Genera imagen y sonido en una sola pasada, con una sincronía labial que aguanta toda la línea. Sin cámara, sin micrófono, sin actores.