Generación de vídeos con Veo de Google DeepMind
Obtén más información sobre Veo, el último modelo de vídeo generativo de Google DeepMind, capaz de crear fácilmente vídeos 1080P de alta calidad a partir de indicaciones de texto, imagen y vídeo.

Durante la presentación de Google I/O 2024, celebrada el 14 de mayo, compartieron las últimas novedades de DeepMind, su división de IA. Uno de los avances más interesantes fue su nuevo modelo generativo de vídeo, Veo. Veo puede crear vídeos 1080P de alta calidad a partir de indicaciones de texto, imágenes y vídeos. Incluso permite editar los vídeos generados mediante indicaciones posteriores. Veo lleva la IA generativa al siguiente nivel. Veamos más de cerca las funciones que ofrece Veo.
Comprender las capacidades de Veo#
Veo es un modelo generativo de vídeo que utiliza una comprensión profunda del lenguaje y los elementos visuales para crear vídeos que se ajustan estrechamente a la visión creativa del usuario. Puede captar con precisión el tono y los detalles de indicaciones más largas, lo que lo convierte en una herramienta potente para creadores que quieren transformar sus ideas en contenido de vídeo preciso.
El usuario puede ejercer un control creativo revolucionario sobre el vídeo generado, ya que Veo entiende técnicas cinematográficas como «timelapse» y «tomas aéreas de un paisaje». Este control creativo permite crear vídeos en los que las personas, los animales y los objetos se mueven de forma natural. Los vídeos generados por Veo son atractivos y visualmente impactantes porque es difícil detectar que los ha generado un modelo de IA.
Veo va más allá de crear vídeos a partir de indicaciones. Si proporcionas un vídeo generado anteriormente y una solicitud de edición específica, como insertar kayaks en una vista aérea de una costa, Veo puede integrar este cambio sin problemas en el vídeo original y producir una versión actualizada.

Fig. 1 Un ejemplo de edición de vídeo con Veo.
Estas son algunas funciones más que ofrece Veo:
- Edición con máscara: Veo puede ayudarte a editar zonas definidas de un vídeo.
- Creación de vídeos inspirados en imágenes: mediante una imagen y una indicación de texto, Veo puede generar vídeos que reflejen el estilo de la imagen y sigan las instrucciones de la indicación.
- Clips de vídeo ampliados: Veo puede crear y ampliar clips de vídeo hasta 60 segundos o más, ya sea a partir de una sola indicación o de una secuencia de indicaciones que, en conjunto, cuentan una historia.
Vídeos impresionantes generados por Veo#
Veamos algunos de los vídeos que ha generado Veo y por qué son tan impresionantes.
Generar un vídeo de tipo timelapse a partir de una indicación de texto breve es todo un reto. Normalmente, una indicación de texto breve no puede transmitir con precisión los cambios y movimientos que se producen en la escena del timelapse. Por eso resulta asombroso que Veo pueda entender qué se espera de un timelapse sin entrar en detalles.

Fig. 2 Un fotograma del vídeo time-lapse generado por Veo.
Del mismo modo, generar vídeos con una física precisa no es fácil. El modelo de IA debe comprender y simular leyes de la física como la gravedad, el momento y las colisiones para que los movimientos y las interacciones parezcan realistas. Resulta impresionante que Veo pueda modelar estas dinámicas con precisión sin recibir instrucciones detalladas en las indicaciones de texto.

Fig. 3 Un fotograma de un vídeo generado con Veo captura con precisión la física del movimiento de las medusas.
Hasta ahora, solo habíamos visto vídeos más cortos generados por IA debido a las limitaciones computacionales y a la complejidad de mantener la coherencia en secuencias más largas. En la presentación de Google I/O 2024 se mostró la asombrosa capacidad de Veo para crear vídeos más largos y complejos.

Fig. 4 Fotogramas del vídeo más largo de Veo mostrado en la presentación de Google I/O 2024.
¿Cómo funciona Veo?#
Como muchos otros modelos de IA, Veo se apoya en el trabajo de grandes referentes. Se basa en avances anteriores como la Red generativa de consultas (GQN), DVD-GAN, Imagen-Video, Phenaki, WALT, VideoPoet y Lumiere, además de la arquitectura Transformer propia de Google y Gemini. Asimismo, para mejorar la capacidad de Veo de interpretar las indicaciones con precisión, los pies de foto de cada vídeo de su conjunto de datos de entrenamiento eran más detallados.
Según el flujo de trabajo general del modelo compartido por Google, así es como funciona Veo:
- Indicaciones de entrada: proporcionas una indicación de texto y, opcionalmente, una indicación de imagen.
- Codificación: la indicación de texto se procesa mediante un codificador UL2 y la indicación de imagen se procesa mediante un codificador de imágenes.
- Indicación integrada: las salidas de los codificadores de texto e imagen se combinan para formar una única indicación integrada.
- Modelo de difusión latente: la indicación integrada y un vídeo comprimido con ruido se introducen en este modelo, que los utiliza para generar un vídeo comprimido. Veo utiliza representaciones de vídeo comprimidas y de alta calidad, conocidas como latentes, para mejorar la eficiencia sin perder calidad.
- Decodificación: en el paso final se decodifica la salida de vídeo 1080p a partir del vídeo comprimido.

Fig. 5 Cómo funciona Veo.
Un caso práctico fascinante en el cine#
Para poner a prueba las capacidades de Veo, Google colaboró con el cineasta Donald Glover y su estudio creativo, Gilga. Utilizaron Veo para explorar diversas técnicas creativas, incluidas las tomas de seguimiento dinámicas, que requieren un movimiento preciso y un encuadre constante.

Fig. 6 Uso de Veo en el proceso de producción cinematográfica.
Tradicionalmente, los cineastas se enfrentan a limitaciones de tiempo y recursos. Con Veo, Glover y su equipo pudieron experimentar rápidamente con tomas complejas y generarlas, lo que a su vez aportó más flexibilidad e innovación al proceso de producción cinematográfica.
Con Veo, Glover y su equipo pudieron experimentar rápidamente con tomas complejas y generarlas antes del rodaje real. Por ejemplo, podían probar varias tomas de seguimiento dinámicas para ver qué aspecto tendrían y hacer los ajustes necesarios. Este proceso de previsualización les ayudó a perfeccionar sus ideas y garantizar que las tomas funcionaran como estaba previsto, reduciendo en última instancia el número de tomas necesarias durante el rodaje real. Pudieron crear un caso práctico convincente para demostrar el potencial de Veo para cambiar la industria cinematográfica. Ofrece una forma más rápida y eficiente de dar vida a las visiones creativas.
Usos prácticos de Veo en distintos sectores#
Las avanzadas capacidades de generación de vídeo de Veo tienen aplicaciones prácticas en muchos sectores. En publicidad, puede producir rápidamente anuncios personalizados y de alta calidad para públicos específicos, ahorrando tiempo y costes de producción. En educación, Veo puede crear vídeos didácticos atractivos que facilitan la comprensión de conceptos complejos.
Las empresas pueden utilizar Veo para la formación y las comunicaciones corporativas. Los profesionales de la sanidad podrían utilizar Veo para simular procedimientos médicos con fines formativos. En lo que respecta a los eventos y las conferencias virtuales, Veo puede crear simulaciones realistas de lugares y escenarios, ofreciendo a los asistentes una experiencia atractiva e interactiva desde cualquier lugar. Los organizadores se benefician de un mayor alcance y de información valiosa para futuros eventos. Gracias a Veo, se han abierto innumerables oportunidades.
Cuando un modelo de IA tiene el potencial de llegar a distintos sectores, es importante tener presentes la seguridad y la ética en la IA. Para facilitar una adopción más amplia y garantizar un uso responsable, Google ha implementado varias medidas de seguridad. Los vídeos creados por Veo llevan una marca de agua mediante SynthID, una herramienta para marcar e identificar contenido generado por IA. SynthID garantiza la transparencia y ayuda a mitigar los riesgos relacionados con la privacidad, los derechos de autor y los sesgos. Además, todos los vídeos generados pasan por filtros de seguridad y procesos de comprobación de memorización. Estas salvaguardas convierten a Veo en una herramienta valiosa y ética que favorece una producción de vídeo responsable e innovadora.
Dónde acceder a Veo#
En las próximas semanas, Google empezará a ofrecer algunas de las funciones revolucionarias de Veo a creadores seleccionados mediante VideoFX, una nueva herramienta disponible en labs.google. Esta iniciativa permite acceder de forma anticipada a las avanzadas capacidades de generación de vídeo de Veo y ofrece a los creadores la oportunidad de experimentar con sus innovadoras funciones. La lista de espera de Veo está abierta actualmente, por lo que los creadores interesados pueden registrarse y utilizar las potentes herramientas de Veo en sus proyectos.
Más información sobre las novedades de IA generativa de DeepMind en 2024#
Además de Veo, DeepMind ha presentado varias novedades vanguardistas en IA generativa para 2024. Una de ellas es Imagen 3, su modelo de texto a imagen más avanzado hasta la fecha. Imagen 3 destaca en la creación de imágenes fotorrealistas y llenas de vida. Comprende profundamente las indicaciones en lenguaje natural y capta detalles complejos, al tiempo que minimiza los artefactos visuales.

Fig. 7 Una imagen generada con Imagen 3.
DeepMind también ha desarrollado Lyria, su modelo más avanzado para la generación de música mediante IA. Como parte de este esfuerzo, DeepMind ha creado un conjunto de herramientas de IA musical llamado Music AI Sandbox. Estas herramientas permiten a músicos y productores explorar nuevas posibilidades creativas en la composición musical y la transformación del sonido.

Fig. 8 Un ejemplo de la interfaz de usuario de las herramientas de IA musical de DeepMind.
Al igual que con Veo, DeepMind también ha implementado varias medidas de seguridad para sus otras novedades. SynthID se utilizará en todas ellas como herramienta para marcar e identificar contenido generado por IA. Estas novedades de DeepMind prometen transformar diversos sectores al ofrecer herramientas avanzadas, eficientes y responsables para crear contenido visual y de audio de alta calidad.
Adentrarse en la próxima fase de la IA generativa#
Los avances de DeepMind en IA generativa durante 2024, incluidos Veo, Imagen 3 y Lyria, suponen un salto considerable en las capacidades de la IA. Veo transforma la creación de vídeos gracias a su capacidad para generar vídeos 1080p de alta calidad a partir de indicaciones sencillas, lo que lo convierte en una herramienta versátil para cineastas y creadores de contenido. Imagen 3 destaca en la producción de imágenes fotorrealistas, mientras que Lyria abre nuevas posibilidades en la generación musical con herramientas avanzadas de IA.
Estas tecnologías prometen transformar diversos sectores al proporcionar herramientas eficientes y responsables para crear contenido visual y de audio de alta calidad. Con medidas de seguridad como SynthID, que garantiza un uso ético, DeepMind sigue ampliando los límites de la IA y allanando el camino para aplicaciones innovadoras en el futuro.
Adéntrate en la IA visitando nuestro repositorio de GitHub y uniéndote a nuestra comunidad. Explora nuestras páginas de soluciones para descubrir cómo se aplica la IA en la fabricación y la agricultura.









