Создание видео с помощью Veo от Google DeepMind
Узнай больше о Veo — последней генеративной видеомодели Google DeepMind, которая легко создаёт высококачественные видео в формате 1080P по текстовым, графическим и видеоподсказкам.

Во время презентации Google I/O 2024 года 14 мая они поделились последними обновлениями от DeepMind, своего подразделения, занимающегося ИИ. Одним из самых впечатляющих представленных достижений стала их новейшая генеративная модель для создания видео — Veo. Veo может создавать высококачественные видео в разрешении 1080P на основе текстовых, графических и видеопромптов. Она даже позволяет редактировать созданные видео с помощью последующих промптов. Veo выводит генеративный ИИ на новый уровень. Давай подробнее рассмотрим возможности Veo.
Возможности Veo#
Veo — это генеративная модель для создания видео, которая глубоко понимает язык и визуальные образы, чтобы создавать видео, точно соответствующие творческому замыслу пользователя. Она точно передаёт тональность и детали длинных промптов, что делает её мощным инструментом для авторов, желающих превращать свои идеи в точный видеоконтент.
Пользователь получает беспрецедентный творческий контроль над созданным видео, поскольку Veo понимает кинематографические приёмы, такие как «таймлапс» и «съёмка пейзажа с воздуха». Такой творческий контроль позволяет создавать видео, в которых люди, животные и объекты двигаются естественно. Видео, созданные Veo, выглядят увлекательно и привлекательно, поскольку сложно заметить, что они сгенерированы моделью ИИ.
Veo не ограничивается простым созданием видео по промптам. Если предоставить ранее созданное видео и конкретный запрос на редактирование, например добавить каяки в вид побережья с воздуха, Veo сможет органично внести это изменение в исходное видео и создать обновлённую версию.

Рис. 1. Пример редактирования видео с помощью Veo.
Вот ещё несколько возможностей Veo:
- Редактирование с маской: Veo помогает редактировать определённые области видео.
- Создание видео по изображению: используя изображение и текстовый промпт, Veo может создавать видео, повторяющие стиль изображения и соответствующие указаниям из промпта.
- Расширенные видеоклипы: Veo может создавать и продлевать видеоклипы до 60 секунд и более — как по одному промпту, так и по последовательности промптов, которые вместе рассказывают историю.
Захватывающие видео, созданные Veo#
Давай рассмотрим некоторые видео, созданные Veo, и разберёмся, почему они настолько впечатляют.
Создать таймлапс-видео по короткому текстовому промпту сложно. Как правило, короткий текстовый промпт не может точно передать изменения и движения внутри сцены таймлапса. Поэтому поразительно, что Veo понимает, чего ожидать от таймлапса, даже без подробного описания.

Рис. 2. Кадр из таймлапс-видео, созданного Veo.
Точно создавать видео с реалистичной физикой тоже непросто. Модель ИИ должна понимать и моделировать законы физики, такие как гравитация, импульс и столкновения, чтобы движения и взаимодействия выглядели реалистично. Впечатляет, что Veo способна точно моделировать эту динамику без подробных указаний в текстовых промптах.

Рис. 3. Кадр из видео, созданного с помощью Veo, точно передаёт физику движения медузы.
До сих пор из-за вычислительных ограничений и сложности сохранения связности длинных последовательностей мы видели только короткие видео, созданные ИИ. На презентации Google I/O 2024 года была продемонстрирована поразительная способность Veo создавать более длинные и сложные видео.

Рис. 4. Кадры из более длинного видео Veo, показанного на презентации Google I/O 2024 года.
Как работает Veo?#
Как и многие другие модели ИИ, Veo стоит на плечах гигантов. Она опирается на предыдущие достижения, такие как генеративная сеть запросов (GQN), DVD-GAN, Imagen-Video, Phenaki, WALT, VideoPoet и Lumiere, а также на фирменную архитектуру Transformer и Gemini от Google. Кроме того, чтобы Veo могла точнее интерпретировать промпты, описания каждого видео в её обучающем наборе данных были сделаны более подробными.
Согласно представленной Google упрощённой схеме работы модели, Veo работает следующим образом:
- Входные промпты: ты предоставляешь текстовый промпт и, при необходимости, промпт-изображение.
- Кодирование: текстовый промпт обрабатывается кодировщиком UL2, а промпт-изображение — кодировщиком изображений.
- Встроенный промпт: выходные данные текстового кодировщика и кодировщика изображений объединяются в единый встроенный промпт.
- Модель латентной диффузии: встроенный промпт и зашумлённое сжатое видео передаются в эту модель, которая использует их для создания сжатого видео. Veo использует высококачественные сжатые представления видео, известные как латенты, чтобы повысить эффективность без потери качества.
- Декодирование: на последнем этапе из сжатого видео формируется итоговый результат в разрешении 1080p.

Рис. 5. Как работает Veo.
Убедительный пример использования в кинопроизводстве#
Чтобы проверить возможности Veo, Google объединилась с режиссёром Дональдом Гловером и его творческой студией Gilga. Они использовали Veo для изучения различных творческих приёмов, включая динамичные съёмки с сопровождением, требующие точного движения камеры и стабильного кадрирования.

Рис. 6. Использование Veo в процессе кинопроизводства.
Традиционно кинематографисты сталкиваются с ограничениями из-за нехватки времени и ресурсов. С Veo Гловер и его команда могли быстро экспериментировать со сложными кадрами и создавать их, что, в свою очередь, обеспечивало больше гибкости и возможностей для инноваций в процессе кинопроизводства.
С Veo Гловер и его команда могли быстро экспериментировать со сложными кадрами и создавать их до начала настоящих съёмок. Например, они могли протестировать различные динамичные съёмки с сопровождением, чтобы увидеть, как они будут выглядеть, и при необходимости внести изменения. Этот процесс предварительной визуализации помог им доработать идеи и убедиться, что кадры будут работать так, как задумано, что в итоге сократило количество дублей во время настоящих съёмок. Им удалось создать убедительный пример, демонстрирующий потенциал Veo по изменению киноиндустрии. Veo предлагает более быстрый и эффективный способ воплощать творческие замыслы в жизнь.
Практическое применение Veo в различных отраслях#
Продвинутые возможности Veo по созданию видео находят практическое применение во многих отраслях. В рекламе она может быстро создавать персонализированные высококачественные рекламные ролики для целевой аудитории, экономя время и снижая производственные затраты. В образовании Veo может создавать увлекательные учебные видео, упрощая понимание сложных концепций.
Компании могут использовать Veo для обучения и корпоративных коммуникаций. Специалисты в сфере здравоохранения могут применять Veo для симуляции медицинских процедур в учебных целях. Для виртуальных мероприятий и конференций Veo может создавать реалистичные симуляции площадок и сцен, обеспечивая участникам увлекательный интерактивный опыт из любой точки мира. Организаторы получают более широкий охват и ценные сведения для будущих мероприятий. Благодаря Veo открылись бесчисленные возможности.
Когда модель ИИ может затрагивать разные отрасли, важно помнить о безопасности и этичном использовании ИИ. Чтобы обеспечить более широкое внедрение и ответственное использование, Google реализовала несколько мер безопасности. Видео, созданные Veo, получают водяной знак с помощью SynthID — инструмента для нанесения водяных знаков и идентификации контента, созданного ИИ. SynthID обеспечивает прозрачность и помогает снизить риски, связанные с конфиденциальностью, авторскими правами и предвзятостью. Кроме того, все созданные видео проходят фильтры безопасности и проверку на запоминание. Эти меры защиты делают Veo ценным и этичным инструментом, поддерживающим ответственное и инновационное производство видео.
Где получить доступ к Veo#
В ближайшие недели Google начнёт предоставлять некоторые революционные возможности Veo избранным авторам через VideoFX — новый инструмент, доступный на сайте labs.google. Эта инициатива открывает ранний доступ к продвинутым возможностям Veo по созданию видео и даёт авторам возможность экспериментировать с её инновационными функциями. Список ожидания Veo уже открыт: заинтересованные авторы могут зарегистрироваться и использовать мощные инструменты Veo в своих проектах.
Подробнее о генеративных обновлениях DeepMind в 2024 году#
Помимо Veo, в 2024 году DeepMind представила несколько передовых обновлений в области генеративного ИИ. Одно из них — Imagen 3, их самая продвинутая на сегодняшний день модель преобразования текста в изображения. Imagen 3 отлично создаёт фотореалистичные, живые изображения. Она глубоко понимает промпты на естественном языке и передаёт мельчайшие детали, сводя к минимуму визуальные артефакты.

Рис. 7. Изображение, созданное с помощью Imagen 3.
DeepMind также разработала Lyria — свою самую продвинутую модель для создания музыки с помощью ИИ. В рамках этой работы DeepMind создала набор музыкальных инструментов ИИ под названием Music AI Sandbox. Эти инструменты позволяют музыкантам и продюсерам исследовать новые творческие возможности в сочинении музыки и преобразовании звука.

Рис. 8. Пример интерфейса музыкальных инструментов ИИ DeepMind.
Как и в случае с Veo, DeepMind также реализовала несколько мер безопасности для других своих обновлений. SynthID будет использоваться во всех этих обновлениях как инструмент для нанесения водяных знаков и идентификации контента, созданного ИИ. Эти обновления DeepMind обещают преобразовать различные отрасли, предлагая продвинутые, эффективные и ответственные инструменты для создания высококачественного визуального и аудиоконтента.
Переход к следующему этапу развития генеративного ИИ#
Достижения DeepMind в области генеративного ИИ в 2024 году, включая Veo, Imagen 3 и Lyria, знаменуют значительный скачок в возможностях ИИ. Veo преобразует создание видео благодаря способности генерировать высококачественные видео в разрешении 1080p по простым промптам, что делает её универсальным инструментом для кинематографистов и авторов контента. Imagen 3 превосходно создаёт фотореалистичные изображения, а Lyria открывает новые возможности в создании музыки с помощью продвинутых инструментов ИИ.
Эти технологии обещают преобразовать различные отрасли, предоставляя эффективные и ответственные инструменты для создания высококачественного визуального и аудиоконтента. Благодаря мерам безопасности, таким как SynthID, обеспечивающим этичное использование, DeepMind продолжает расширять границы ИИ и прокладывать путь к инновационным приложениям в будущем.
Погрузись в мир ИИ: посети наш репозиторий GitHub и присоединись к нашему сообществу. Изучи страницы с описанием наших решений, чтобы узнать, как ИИ применяется в производстве и сельском хозяйстве.









