YOLO Vision 2026:
비전 AI

Meta Movie Gen: 콘텐츠 제작의 재상상

Meta Movie Gen이 비디오 및 사운드 제작을 어떻게 재정의하고 있는지 확인해 보세요. 이 모델이 어떻게 정밀한 비디오 편집을 제공하고 개인화된 미디어 제작을 지원하는지 배워보세요.

ABAbirami Vina4 min read
Meta Movie Gen AI 비디오 제작

열정적인 영화 제작자이든 시청자를 위해 비디오 만드는 것을 즐기는 크리에이터이든, 창의력을 확장해 주는 AI 도구를 사용하는 것은 언제나 유익합니다. 최근 MetaMeta Movie Gen으로 알려진 최신 비디오 생성 모델을 출시했습니다.

미디어 및 엔터테인먼트 분야의 글로벌 generative AI market은 2033년까지 115억 7천만 달러에 이를 것으로 예상되며, Runway, OpenAI, Meta 같은 기업들이 획기적인 혁신을 주도하고 있습니다. 특히 Meta Movie Gen은 영화 제작, 비디오 콘텐츠 제작, 디지털 스토리텔링과 같은 애플리케이션에 매우 적합하며, 고품질의 AI 생성 비디오를 통해 창의적인 비전을 그 어느 때보다 쉽게 실현할 수 있게 해줍니다. 이 글에서는 Meta Movie Gen과 그 작동 방식에 대해 알아봅니다. 또한 주요 애플리케이션도 자세히 살펴보겠습니다. 시작하겠습니다!

Meta Movie Gen을 사용하여 생성된 비디오 클립의 한 프레임

Fig 1. Meta Movie Gen을 사용하여 생성된 비디오 클립의 한 프레임.

Meta Movie Gen이란 무엇인가요?#

Meta Movie Gen이 무엇인지 논의하기 전에, 이 기술이 어떻게 탄생했는지 살펴보겠습니다.

generative AI와 관련된 Meta의 연구 노력은 Make-A-Scene series 모델에서 시작되었습니다. 이 연구는 아티스트와 비전가들이 상상력을 현실로 구현할 수 있도록 돕는 multimodal 생성 AI 방법에 초점을 맞추고 있습니다. 아티스트는 이미지, 오디오, 비디오 또는 3D animations을 입력하여 원하는 이미지 출력을 얻을 수 있습니다. 혁신의 다음 도약은 Llama 이미지 파운데이션 모델(Emu)과 같은 diffusion models을 통해 이루어졌으며, 이를 통해 훨씬 더 높은 품질의 이미지와 비디오를 생성하고 이미지 편집이 가능해졌습니다.

Make-A-Scene 스케치와 텍스트 입력을 사용하여 이미지 생성하기

Fig 2. Make-A-Scene의 스케치와 텍스트 입력을 사용하여 생성된 이미지를 얻은 예시.

Movie Gen is Meta’s latest contribution to generative AI research. It combines all of the previously mentioned modalities and allows further fine-grained control so that people can use the models in more creative ways. Meta Movie Gen is a collection of foundational models for generating different types of media, including text-to-video, text-to-audio, and text-to-image. It consists of four models, which are trained on a combination of licensed and publicly available datasets.

이 모델들에 대한 간략한 개요는 다음과 같습니다:

  • Movie Gen Video 모델: 텍스트 프롬프트로부터 고품질 비디오를 생성하는 300억 개의 파라미터 모델입니다.
  • Movie Gen Audio 모델: 비디오 콘텐츠와 동기화되는 사운드트랙을 생성할 수 있는 130억 개의 파라미터 모델입니다.
  • Personalized Movie Gen Video 모델: 특정 개인의 이미지와 텍스트 프롬프트를 기반으로 그들의 외형을 유지하면서 비디오를 생성합니다.
  • Movie Gen Edit 모델: 실제 비디오와 허구의 비디오 모두에 대해 상세한 텍스트 기반 비디오 편집을 수행할 수 있는 모델입니다.

Meta Movie Gen 비디오 모델 학습#

Movie Gen Video 모델을 만들고 training하는 과정에는 몇 가지 핵심 프로세스가 포함되었습니다. 첫 번째 단계는 품질, 모션, 관련성을 기준으로 필터링된 주로 인간 활동의 이미지와 비디오 클립을 포함한 preparing visual data를 수집하고 준비하는 작업이었습니다. 그런 다음 data를 각 장면에서 무슨 일이 일어나고 있는지 설명하는 텍스트 캡션과 쌍을 이루었습니다. Meta’s LLaMa3-Video 모델을 사용하여 생성된 캡션은 각 장면의 콘텐츠에 대한 풍부한 세부 정보를 제공하여 모델의 시각적 스토리텔링 기능을 향상시켰습니다.

Movie Gen Video 모델 사전 학습 데이터 파이프라인 개요

Fig 3. Movie Gen Video 모델의 사전 학습 데이터 큐레이션 파이프라인 개요.

training 과정은 모델이 텍스트를 저해상도 이미지로 변환하는 것을 학습하는 것으로 시작되었습니다. 그런 다음 text-to-image와 텍스트 비디오 변환 학습의 조합을 통해 점점 더 고품질의 시각 자료를 사용하여 전체 비디오 클립을 생성하는 단계로 진행되었습니다.

TAE(Temporal Autoencoder)라는 도구가 비디오를 압축하여 대용량 데이터를 효율적으로 관리했습니다. Fine-tuning을 통해 비디오 품질이 더욱 선명해졌으며, 모델 평균화(더 부드럽고 일관된 결과를 위해 여러 모델 출력을 결합하는 방식)라는 방법으로 출력의 일관성을 높였습니다. 마지막으로, 처음에는 768p였던 비디오가 픽셀 데이터를 추가하여 선명한 시각 자료를 위해 이미지 해상도를 높이는 공간 업샘플러 기술을 사용하여 선명한 1080p 해상도로 업스케일링되었습니다. 그 결과 고품질의 상세한 비디오 출력이 생성되었습니다.

Meta Movie Gen 역량 살펴보기#

Meta Movie Gen 모델은 기본적으로 4가지 기능을 지원합니다. 각 기능을 자세히 살펴보겠습니다.

비디오 및 오디오 생성#

Meta Movie Gen은 고품질 비디오를 생성할 수 있습니다. 이 비디오 클립은 최대 16초 길이이며 초당 16프레임(fps)으로 실행되어 텍스트 프롬프트에서 모션, 상호작용, camera 각도를 포착하는 사실적인 시각 자료를 만듭니다. 130억 개의 파라미터를 가진 오디오 모델과 결합하여 시각 자료와 일치하는 주변 소리, 폴리 효과, 음악 등 동기화된 오디오를 생성할 수 있습니다.

이 설정을 통해 다양한 장면과 프롬프트에서 시각 자료와 오디오가 모두 정렬되고 사실적으로 유지되는 완벽하고 생생한 경험을 보장합니다. 예를 들어, 이러한 모델은 바이럴된 태국 하마 Moo Deng의 비디오 클립을 만드는 데 사용되었습니다.

Meta Movie Gen을 사용하여 만든 Moo Deng 비디오 클립의 한 프레임

Fig 4. Meta Movie Gen으로 만든 Moo Deng 비디오 클립의 한 프레임.

개인화된 비디오 생성#

Meta Movie Gen 모델의 또 다른 흥미로운 기능은 개인화된 비디오 생성입니다. 사용자는 사람의 이미지와 비디오 클립 생성 방식을 설명하는 텍스트 프롬프트를 제공할 수 있으며, 그 결과 참조 인물이 포함되고 텍스트 프롬프트에 지정된 풍부한 시각적 세부 정보가 통합된 비디오가 생성됩니다. 모델은 두 가지 입력(이미지 및 텍스트)을 모두 사용하여 프롬프트에 설명된 장면을 정확하게 따르면서 사람의 고유한 외모와 자연스러운 body movements를 유지합니다.

모델의 개인화된 비디오 생성 기능 예시

Fig 5. 모델의 개인화된 비디오 생성 기능 예시.

정밀한 비디오 편집#

사용자는 Movie Gen Edit 모델을 사용하여 비디오 클립과 텍스트 프롬프트를 입력함으로써 창의적인 방식으로 비디오를 편집할 수 있습니다. 이 모델은 비디오 생성과 고급 이미지 편집을 결합하여 요소 추가, 제거 또는 교체와 같은 매우 구체적인 편집을 수행합니다. 비디오 클립의 배경이나 전체 스타일을 수정하는 등의 전역적인 변경도 가능합니다. 하지만 이 모델을 진정으로 독보적으로 만드는 것은 정밀함입니다. 편집이 필요한 특정 픽셀만 수정하고 나머지는 그대로 유지할 수 있어 원본 콘텐츠를 최대한 보존합니다.

Movie Gen Edit 모델의 비디오 편집 기능 예시

Fig 6. Movie Gen Edit 모델의 비디오 편집 기능의 다양한 예시.

Meta Movie Gen의 벤치마킹 도구#

generative AI 모델과 함께 Meta는 generative AI 모델의 성능을 테스트하기 위한 벤치마킹 도구 모음인 Movie Gen Bench도 소개했습니다. 이 도구는 Movie Gen Video Bench와 Movie Gen Audio Bench라는 두 가지 주요 도구를 제공합니다. 둘 다 비디오 및 오디오 생성의 다양한 측면을 테스트하도록 설계되었습니다.

두 도구에 대한 간략한 소개입니다:

  • Movie Gen Video Bench: 인간 활동, animals, natural scenery, physics뿐만 아니라 생소한 피사체와 활동 등 광범위한 테스트 카테고리를 다루는 1003개의 프롬프트로 구성되어 있습니다. 이 평가 벤치마크가 특히 가치 있는 이유는 모션 수준을 포괄하여 비디오 생성 모델이 빠른 시퀀스와 느린 시퀀스 모두에서 테스트되도록 보장하기 때문입니다.
  • Movie Gen Audio Bench: 527개의 프롬프트를 통해 오디오 생성 기능을 테스트하도록 설계되었습니다. 이 프롬프트들은 생성된 비디오와 쌍을 이루어 모델이 음향 효과와 음악을 시각 콘텐츠와 얼마나 잘 동기화할 수 있는지 평가합니다.

Movie Gen Bench 평가 프롬프트 및 워드 클라우드 분석

Fig 7. 이 다이어그램은 평가 프롬프트의 분석을 보여주며, 왼쪽에 개념 목록이 있고 오른쪽에 자주 사용되는 명사와 동사의 워드 클라우드가 있습니다.

Meta Movie Gen의 실용적인 응용#

이제 Meta Movie Gen 모델이 무엇이며 어떻게 작동하는지 알아보았으니, 실용적인 응용 사례 중 하나를 살펴보겠습니다.

영화 제작 분야에서의 Movie Gen AI 혁신#

Meta Movie Gen의 가장 흥미로운 용도 중 하나는 AI 기반 비디오 및 audio creation을 통해 filmmaking을 혁신할 수 있는 방식입니다. 크리에이터는 Movie Gen을 사용하여 간단한 text prompts에서 고품질의 시각 자료와 사운드를 생성하여 스토리텔링의 새로운 방식을 열 수 있습니다.

실제로 Meta는 Blumhouse 및 영화 제작자 그룹과 협력하여 Movie Gen이 creative process를 가장 잘 지원할 수 있는 방법에 대한 피드백을 수집했습니다. Aneesh Chaganty, Spurlock Sisters, Casey Affleck과 같은 영화 제작자들이 분위기, 톤, 시각적 방향을 포착하는 도구의 능력을 테스트했습니다. 이들은 모델이 새로운 아이디어를 촉발하는 데 도움이 되었다는 것을 발견했습니다.

이 파일럿 프로그램은 Movie Gen이 전통적인 영화 제작을 대체하지는 않지만, 감독들에게 시각 및 오디오 요소를 빠르고 창의적으로 실험할 수 있는 새로운 방법을 제공한다는 점을 보여주었습니다. 또한 영화 제작자들은 이 도구의 편집 기능을 통해 배경음, 효과음, 시각적 스타일을 더욱 자유롭게 다룰 수 있다는 점을 높이 평가했습니다.

Meta Movie Gen을 사용하여 제작된 단편 영화의 한 프레임

Fig 8. Meta Movie Gen을 사용하여 제작된 단편 영화의 한 프레임.

핵심 요약#

Meta Movie Gen은 간단한 텍스트 설명에서 고품질 비디오와 사운드를 만들기 위해 생성형 AI를 사용하는 데 있어 한 걸음 더 나아간 기술입니다. 이 도구는 사용자가 사실적이고 맞춤화된 비디오를 쉽게 만들 수 있도록 지원합니다. 정밀한 비디오 편집 및 개인화된 미디어 생성과 같은 기능을 갖춘 Meta Movie Gen은 스토리텔링, 영화 제작 등을 위한 새로운 가능성을 열어주는 유연한 도구 모음을 제공합니다. Meta Movie Gen은 상세하고 유용한 시각 자료를 만들기 쉽게 함으로써 다양한 분야에서 비디오가 제작되고 사용되는 방식을 변화시키고 있으며, AI 기반 콘텐츠 제작의 새로운 표준을 정립하고 있습니다.

자세한 내용은 GitHub 저장소를 방문하시고 커뮤니티에 참여해 보세요. 솔루션 페이지에서 자율주행차농업 분야의 AI 애플리케이션을 살펴보세요. 🚀

Explore solutions

Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.