Google DeepMind’s Veo로 비디오 생성하기
텍스트, 이미지 및 비디오 프롬프트로 고품질 1080P 비디오를 손쉽게 생성할 수 있는 Google DeepMind의 최신 생성형 비디오 모델 Veo에 대해 자세히 알아보세요.

5월 14일 Google의 2024 I/O 프레젠테이션에서 Google은 AI 부문인 DeepMind의 최신 업데이트를 공유했습니다. 공유된 내용 중 가장 흥미로운 발전 중 하나는 최신 생성형 동영상 모델인 Veo였습니다. Veo는 텍스트, 이미지, 동영상 프롬프트를 기반으로 고품질 1080P 동영상을 생성할 수 있습니다. 또한 후속 프롬프트를 사용해 생성된 동영상을 편집할 수도 있습니다. Veo는 생성형 AI를 한 단계 더 발전시킵니다. Veo가 제공하는 기능을 자세히 살펴보겠습니다.
Veo의 기능 이해하기#
Veo는 언어와 시각 정보에 대한 깊은 이해를 바탕으로 사용자의 창의적인 비전과 밀접하게 일치하는 동영상을 생성하는 생성형 동영상 모델입니다. 긴 프롬프트의 분위기와 세부 사항을 정확하게 포착할 수 있어, 아이디어를 정밀한 동영상 콘텐츠로 전환하려는 크리에이터에게 강력한 도구가 됩니다.
Veo는 "타임랩스"와 "풍경의 항공 촬영" 같은 영화 기법을 이해할 수 있기 때문에 사용자가 생성된 동영상을 획기적으로 창의적으로 제어할 수 있습니다. 이러한 창의적 제어를 통해 사람, 동물, 사물이 자연스럽게 움직이는 동영상을 만들 수 있습니다. Veo가 생성한 동영상은 AI 모델이 생성했다는 사실을 알아차리기 어려워 흥미롭고 시각적으로 매력적입니다.
Veo는 단순히 프롬프트에서 동영상을 생성하는 데 그치지 않습니다. 이전에 생성된 동영상과 해안선의 항공 뷰에 카약을 삽입하는 것과 같은 구체적인 편집 요청을 제공하면, Veo는 이 변경 사항을 원본 동영상에 자연스럽게 통합하여 업데이트된 버전을 생성할 수 있습니다.

그림 1. Veo를 사용한 동영상 편집 예시입니다.
Veo가 제공하는 몇 가지 추가 기능은 다음과 같습니다.
- 마스크 편집: Veo는 동영상에서 지정된 영역을 편집할 수 있도록 지원합니다.
- 이미지 기반 동영상 생성: 이미지와 텍스트 프롬프트를 사용하면 Veo는 이미지의 스타일을 반영하고 프롬프트의 지시를 따르는 동영상을 생성할 수 있습니다.
- 동영상 클립 확장: Veo는 단일 프롬프트 또는 함께 이야기를 구성하는 일련의 프롬프트를 바탕으로 동영상 클립을 생성하고 60초 이상으로 확장할 수 있습니다.
Veo가 생성한 놀라운 동영상#
Veo가 생성한 동영상 몇 가지와 그 동영상이 매우 놀라운 이유를 살펴보겠습니다.
짧은 텍스트 프롬프트로 타임랩스 동영상을 생성하는 일은 어렵습니다. 일반적으로 짧은 텍스트 프롬프트만으로는 타임랩스 장면의 변화와 움직임을 정확하게 전달할 수 없습니다. 따라서 세부 사항을 일일이 설명하지 않아도 Veo가 타임랩스에서 무엇을 기대해야 하는지 이해할 수 있다는 점은 놀랍습니다.

그림 2. Veo가 생성한 타임랩스 동영상의 한 프레임입니다.
마찬가지로 정확한 물리 법칙을 반영하는 동영상을 생성하는 일도 쉽지 않습니다. AI 모델은 움직임과 상호작용이 사실적으로 보이도록 중력, 운동량, 충돌과 같은 물리 법칙을 이해하고 시뮬레이션해야 합니다. Veo가 텍스트 프롬프트의 자세한 안내 없이 이러한 동역학을 정확하게 모델링할 수 있다는 점은 인상적입니다.

그림 3. Veo로 생성한 동영상의 한 프레임에 해파리 움직임의 물리 법칙이 정확하게 표현되어 있습니다.
지금까지는 계산상의 한계와 긴 시퀀스에서 일관성을 유지하는 복잡성 때문에 AI가 생성한 짧은 동영상만 볼 수 있었습니다. Google의 2024 I/O 프레젠테이션에서는 더 길고 복잡한 동영상을 생성하는 Veo의 놀라운 능력이 공개되었습니다.

그림 4. Google 2024 I/O 프레젠테이션에서 공개된 더 긴 Veo 동영상의 프레임입니다.
Veo는 어떻게 작동하나요?#
다른 많은 AI 모델과 마찬가지로 Veo도 선구자들의 성과를 기반으로 합니다. Veo는 생성 쿼리 네트워크(GQN), DVD-GAN, Imagen-Video, Phenaki, WALT, VideoPoet, Lumiere와 같은 이전의 발전뿐 아니라 Google의 독점 Transformer 아키텍처와 Gemini를 활용합니다. 또한 프롬프트를 정확하게 해석하는 Veo의 능력을 향상하기 위해 학습 데이터셋에 포함된 각 동영상의 캡션을 더 상세하게 작성했습니다.
Google이 공유한 대략적인 모델 워크플로를 바탕으로 Veo의 작동 방식은 다음과 같습니다.
- 입력 프롬프트: 텍스트 프롬프트와 선택적으로 이미지 프롬프트를 제공합니다.
- 인코딩: 텍스트 프롬프트는 UL2 인코더로 처리되고, 이미지 프롬프트는 이미지 인코더로 처리됩니다.
- 임베디드 프롬프트: 텍스트 인코더와 이미지 인코더의 출력이 결합되어 하나의 임베디드 프롬프트를 형성합니다.
- 잠재 확산 모델: 임베디드 프롬프트와 노이즈가 포함된 압축 동영상이 이 모델에 입력되며, 모델은 이를 사용해 압축 동영상을 생성합니다. Veo는 잠재 표현(latents)이라고 하는 고품질 압축 동영상 표현을 사용하여 품질을 유지하면서 효율성을 향상합니다.
- 디코딩: 마지막 단계에서는 압축 동영상에서 1080p 동영상 출력을 디코딩합니다.

그림 5. Veo의 작동 방식입니다.
영화 제작의 설득력 있는 사례 연구#
Veo의 기능을 테스트하기 위해 Google은 영화 제작자 Donald Glover 및 그의 크리에이티브 스튜디오 Gilga와 협력했습니다. 이들은 정확한 움직임과 일관된 프레이밍이 필요한 다이내믹 트래킹 숏을 비롯한 다양한 창작 기법을 탐구하는 데 Veo를 사용했습니다.

그림 6. 영화 제작 과정에서 Veo를 사용하는 모습입니다.
기존에는 영화 제작자들이 시간과 리소스의 제약으로 인해 한계에 직면했습니다. Veo를 사용하면 Glover와 그의 팀은 복잡한 숏을 빠르게 실험하고 생성할 수 있었으며, 이를 통해 영화 제작 과정에서 더 많은 유연성과 혁신을 확보할 수 있었습니다.
Glover와 그의 팀은 실제 촬영 전에 Veo를 사용해 복잡한 숏을 빠르게 실험하고 생성할 수 있었습니다. 예를 들어 다양한 다이내믹 트래킹 숏을 테스트하여 어떻게 보이는지 확인하고 필요에 따라 조정할 수 있었습니다. 이러한 사전 시각화 과정은 아이디어를 구체화하고 숏이 의도한 대로 작동하는지 확인하는 데 도움이 되었으며, 결과적으로 실제 촬영에 필요한 테이크 수를 줄였습니다. 이들은 영화 산업을 변화시킬 Veo의 잠재력을 보여주는 설득력 있는 사례 연구를 만들 수 있었습니다. Veo는 창의적인 비전을 더 빠르고 효율적으로 현실화하는 방법을 제공합니다.
다양한 산업에서 Veo의 실용적인 활용#
Veo의 고급 동영상 생성 기능은 다양한 산업에서 실용적으로 활용될 수 있습니다. 광고 분야에서는 타깃 고객을 위한 맞춤형 고품질 광고를 빠르게 제작하여 시간과 제작 비용을 절감할 수 있습니다. 교육 분야에서는 Veo가 흥미로운 교육용 동영상을 제작하여 복잡한 개념을 더 쉽게 이해하도록 지원할 수 있습니다.
기업은 교육 및 기업 커뮤니케이션에 Veo를 사용할 수 있습니다. 의료 전문가는 교육 목적으로 의료 절차를 시뮬레이션하는 데 Veo를 활용할 수 있습니다. 가상 이벤트와 컨퍼런스의 경우 Veo는 장소와 무대를 실제와 유사하게 시뮬레이션하여 참석자에게 어디서든 흥미롭고 상호작용적인 경험을 제공할 수 있습니다. 주최자는 더 넓은 도달 범위와 향후 이벤트를 위한 유용한 인사이트를 얻을 수 있습니다. Veo 덕분에 무수히 많은 기회가 열렸습니다.
AI 모델이 다양한 산업에 영향을 미칠 가능성이 있다면 안전성과 윤리적 AI를 염두에 두는 것이 중요합니다. 더 폭넓은 도입을 지원하고 책임 있는 사용을 보장하기 위해 Google은 여러 안전 조치를 구현했습니다. Veo로 제작된 동영상에는 AI 생성 콘텐츠에 워터마크를 삽입하고 식별하는 도구인 SynthID를 사용해 워터마크가 적용됩니다. SynthID는 투명성을 보장하고 개인정보 보호, 저작권, 편향과 관련된 위험을 완화하는 데 도움이 됩니다. 이뿐만 아니라 생성된 모든 동영상은 안전 필터와 암기 여부 확인 프로세스를 거칩니다. 이러한 보호 조치는 책임 있고 혁신적인 동영상 제작을 지원하는 가치 있고 윤리적인 도구로서 Veo의 역할을 강화합니다.
Veo에 액세스하는 방법#
앞으로 몇 주 안에 Google은 labs.google에서 제공되는 새로운 도구 VideoFX를 통해 일부 엄선된 크리에이터에게 Veo의 획기적인 기능을 제공하기 시작할 예정입니다. 이 이니셔티브를 통해 Veo의 고급 동영상 생성 기능을 조기에 이용할 수 있으며, 크리에이터는 혁신적인 기능을 실험할 수 있습니다. 현재 Veo 대기자 명단이 공개되어 있어 관심 있는 크리에이터는 등록하고 프로젝트에서 Veo의 강력한 도구를 사용할 수 있습니다.
DeepMind의 2024년 생성형 AI 업데이트 자세히 알아보기#
Veo 외에도 DeepMind는 2024년에 생성형 AI와 관련된 여러 최첨단 업데이트를 선보였습니다. 그중 하나는 지금까지 가장 발전된 텍스트-이미지 모델인 Imagen 3입니다. Imagen 3는 사실적인 이미지를 생성하는 데 뛰어납니다. 자연어 프롬프트를 깊이 이해하고 복잡한 세부 사항을 포착하면서 시각적 아티팩트를 최소화합니다.

그림 7. Imagen 3를 사용해 생성한 이미지입니다.
DeepMind는 AI 음악 생성을 위한 가장 발전된 모델인 Lyria도 개발했습니다. 이 노력의 일환으로 DeepMind는 Music AI Sandbox라는 음악 AI 도구 제품군을 만들었습니다. 이 도구를 통해 음악가와 프로듀서는 음악 작곡과 사운드 변환에서 새로운 창작 가능성을 탐구할 수 있습니다.

그림 8. DeepMind의 AI 음악 도구 예시 UI입니다.
DeepMind는 Veo와 마찬가지로 다른 업데이트에도 여러 안전 조치를 구현했습니다. 이러한 업데이트 전반에 걸쳐 SynthID가 AI 생성 콘텐츠에 워터마크를 삽입하고 식별하는 도구로 사용됩니다. DeepMind의 이러한 업데이트는 고품질 시각 및 오디오 콘텐츠를 제작하기 위한 고급스럽고 효율적이며 책임감 있는 도구를 제공하여 다양한 산업을 변화시킬 것으로 기대됩니다.
생성형 AI의 다음 단계 탐색하기#
Veo, Imagen 3, Lyria를 포함한 DeepMind의 2024년 생성형 AI 발전은 AI 기능이 크게 도약했음을 보여줍니다. Veo는 간단한 프롬프트에서 고품질 1080p 동영상을 생성하여 동영상 제작 방식을 혁신하며, 영화 제작자와 콘텐츠 크리에이터를 위한 다목적 도구가 되고 있습니다. Imagen 3는 사실적인 이미지 생성에서 뛰어난 성능을 보이며, Lyria는 고급 AI 도구를 통해 음악 생성의 새로운 가능성을 제시합니다.
이러한 기술은 고품질 시각 및 오디오 콘텐츠를 제작하기 위한 효율적이고 책임감 있는 도구를 제공하여 다양한 산업을 변화시킬 것으로 기대됩니다. SynthID와 같은 안전 조치가 윤리적 사용을 보장하는 가운데, DeepMind는 AI의 경계를 계속 확장하며 미래의 혁신적인 애플리케이션을 위한 길을 열고 있습니다.
GitHub 저장소를 방문하고 커뮤니티에 참여하여 AI를 탐구해 보세요. 솔루션 페이지에서 AI가 제조 및 농업에 어떻게 적용되는지 알아보세요.









