Meta Movie Gen: Tái định hình việc sáng tạo nội dung
Xem cách Meta Movie Gen đang tái định nghĩa việc tạo video và âm thanh. Tìm hiểu cách model này cung cấp khả năng chỉnh sửa video chính xác và hỗ trợ tạo media cá nhân hóa.

Dù bạn là một nhà làm phim đầy tham vọng hay một nhà sáng tạo nội dung yêu thích việc làm video cho khán giả, việc sở hữu các công cụ AI giúp mở rộng khả năng sáng tạo luôn hữu ích. Gần đây, Meta đã ra mắt model tạo video mới nhất của mình, có tên là Meta Movie Gen.
Thị trường AI tạo sinh toàn cầu trong lĩnh vực truyền thông và giải trí được dự đoán sẽ đạt 11,57 tỷ USD vào năm 2033, với các công ty như Runway, OpenAI và Meta dẫn đầu những đổi mới đột phá. Đặc biệt, Meta Movie Gen phù hợp với các ứng dụng như làm phim, sáng tạo nội dung video và kể chuyện kỹ thuật số, giúp việc hiện thực hóa các ý tưởng sáng tạo thông qua video chất lượng cao do AI tạo ra trở nên dễ dàng hơn bao giờ hết. Trong bài viết này, chúng ta sẽ tìm hiểu về Meta Movie Gen và cách thức hoạt động của nó. Chúng ta cũng sẽ xem xét kỹ hơn một số ứng dụng của model này. Hãy bắt đầu!

Hình 1. Một khung hình của đoạn video được tạo bằng Meta Movie Gen.
Meta Movie Gen là gì?#
Trước khi thảo luận về Meta Movie Gen, hãy cùng tìm hiểu cách công nghệ này hình thành.
Các nỗ lực nghiên cứu của Meta liên quan đến AI tạo sinh bắt đầu với loạt model Make-A-Scene của họ. Nghiên cứu này tập trung vào một phương pháp AI tạo sinh đa phương thức, giúp các nghệ sĩ và nhà sáng tạo biến trí tưởng tượng thành hiện thực. Nghệ sĩ có thể đưa vào hình ảnh, âm thanh, video hoặc hoạt ảnh 3D để nhận được đầu ra hình ảnh mong muốn. Bước tiến lớn tiếp theo đến từ các diffusion model như các model Llama Image Foundation (Emu), giúp tạo ra hình ảnh và video chất lượng cao hơn nhiều, đồng thời hỗ trợ chỉnh sửa hình ảnh.

Hình 2. Ví dụ về việc sử dụng bản phác thảo và đầu vào văn bản của Make-A-Scene để tạo hình ảnh.
Movie Gen là đóng góp mới nhất của Meta cho nghiên cứu AI tạo sinh. Model này kết hợp tất cả các phương thức đã đề cập trước đó và cho phép kiểm soát chi tiết hơn, để mọi người có thể sử dụng các model theo những cách sáng tạo hơn. Meta Movie Gen là một tập hợp các model nền tảng để tạo nhiều loại phương tiện khác nhau, bao gồm chuyển văn bản thành video, chuyển văn bản thành âm thanh và chuyển văn bản thành hình ảnh. Tập hợp này gồm bốn model, được huấn luyện trên sự kết hợp giữa dataset được cấp phép và công khai.
Dưới đây là tổng quan nhanh về các model này:
- Movie Gen Video model: Model có 30 tỷ tham số, tạo video chất lượng cao từ các prompt văn bản.
- Movie Gen Audio model: Model có 13 tỷ tham số, có thể tạo nhạc nền đồng bộ với nội dung video.
- Personalized Movie Gen Video model: Model tạo video về những cá nhân cụ thể dựa trên một prompt văn bản và một hình ảnh duy nhất, đồng thời duy trì diện mạo của họ.
- Movie Gen Edit model: Model cho phép chỉnh sửa video thực tế và hư cấu một cách chi tiết bằng văn bản.
Huấn luyện Movie Gen Video model của Meta#
Một số quy trình quan trọng đã được thực hiện để tạo và huấn luyện Movie Gen Video model. Bước đầu tiên là thu thập và chuẩn bị dữ liệu hình ảnh, bao gồm hình ảnh và các đoạn video, chủ yếu về hoạt động của con người, được lọc theo chất lượng, chuyển động và mức độ liên quan. Sau đó, dữ liệu được ghép với các chú thích văn bản giải thích những gì đang diễn ra trong từng cảnh. Các chú thích được tạo bằng model LLaMa3-Video của Meta cung cấp thông tin chi tiết về nội dung của mỗi cảnh, nâng cao khả năng kể chuyện bằng hình ảnh của model.

Hình 3. Tổng quan về pipeline tuyển chọn dữ liệu tiền huấn luyện của Movie Gen Video model.
Quá trình huấn luyện bắt đầu bằng việc model học cách chuyển văn bản thành hình ảnh có độ phân giải thấp. Sau đó, quá trình phát triển sang việc tạo các đoạn video hoàn chỉnh thông qua sự kết hợp giữa huấn luyện chuyển văn bản thành hình ảnh và chuyển văn bản thành video, sử dụng hình ảnh có chất lượng ngày càng cao.
Một công cụ có tên Temporal Autoencoder (TAE) đã nén video để quản lý hiệu quả khối lượng dữ liệu lớn. Fine-tuning tiếp tục làm sắc nét chất lượng video, còn một phương pháp gọi là trung bình hóa model (kết hợp đầu ra của nhiều model để tạo kết quả mượt mà và nhất quán hơn) giúp đảm bảo tính nhất quán cao hơn cho đầu ra. Cuối cùng, video ban đầu có độ phân giải 768p được nâng cấp lên độ phân giải 1080p sắc nét bằng kỹ thuật spatial upsampler, trong đó độ phân giải hình ảnh được tăng bằng cách bổ sung dữ liệu pixel để hình ảnh rõ ràng hơn. Kết quả là các video đầu ra chất lượng cao và giàu chi tiết.
Khám phá các khả năng của Meta Movie Gen#
Các model Meta Movie Gen chủ yếu hỗ trợ bốn khả năng khác nhau. Hãy cùng xem xét kỹ hơn từng khả năng.
Tạo video và âm thanh#
Meta Movie Gen có thể tạo video chất lượng cao. Các đoạn video này có thể dài tới 16 giây và chạy ở tốc độ 16 fps (khung hình mỗi giây), tạo ra hình ảnh chân thực thể hiện chuyển động, tương tác và các góc camera từ prompt văn bản. Khi kết hợp với audio model 13 tỷ tham số, model có thể tạo âm thanh đồng bộ, bao gồm âm thanh môi trường, hiệu ứng Foley và âm nhạc, phù hợp với hình ảnh.
Thiết lập này đảm bảo trải nghiệm liền mạch và sống động, trong đó cả hình ảnh lẫn âm thanh đều được căn chỉnh và duy trì tính chân thực qua nhiều cảnh và prompt khác nhau. Chẳng hạn, các model này đã được sử dụng để tạo các đoạn video về chú hà mã lùn Thái Lan đang lan truyền trên mạng, có tên là Moo Deng.

Hình 4. Một khung hình của đoạn video về Moo Deng được tạo bằng Movie Gen của Meta.
Tạo video cá nhân hóa#
Một khả năng thú vị khác của Meta Movie Gen model là tạo video cá nhân hóa. Người dùng có thể cung cấp hình ảnh của một người và prompt văn bản mô tả cách tạo đoạn video, từ đó tạo ra video có người tham chiếu và tích hợp các chi tiết hình ảnh phong phú được nêu trong prompt văn bản. Model sử dụng cả hai đầu vào (hình ảnh và văn bản) để duy trì diện mạo riêng và chuyển động cơ thể tự nhiên của người đó, đồng thời tuân thủ chính xác cảnh được mô tả trong prompt.

Hình 5. Ví dụ về khả năng tạo video cá nhân hóa của model.
Chỉnh sửa video chính xác#
Sử dụng Movie Gen Edit model, người dùng có thể cung cấp cả một đoạn video và prompt văn bản làm đầu vào để chỉnh sửa video theo những cách sáng tạo. Model kết hợp khả năng tạo video với chỉnh sửa hình ảnh nâng cao để thực hiện các chỉnh sửa rất cụ thể, chẳng hạn như thêm, xóa hoặc thay thế các thành phần. Model cũng có thể thực hiện những thay đổi tổng thể như chỉnh sửa nền của đoạn video hoặc phong cách tổng thể. Tuy nhiên, điểm thực sự độc đáo của model là độ chính xác: model có thể chỉ nhắm đến các pixel cụ thể cần chỉnh sửa và giữ nguyên phần còn lại. Điều này bảo toàn nội dung gốc nhiều nhất có thể.

Hình 6. Nhiều ví dụ khác nhau về khả năng chỉnh sửa video của Movie Gen Edit model.
Các công cụ benchmark của Meta Movie Gen#
Cùng với các model AI tạo sinh, Meta cũng giới thiệu Movie Gen Bench, một bộ công cụ benchmark để kiểm tra hiệu năng của các model AI tạo sinh. Bộ công cụ này gồm hai công cụ chính: Movie Gen Video Bench và Movie Gen Audio Bench. Cả hai được thiết kế để kiểm tra các khía cạnh khác nhau của việc tạo video và âm thanh.
Dưới đây là khái quát về cả hai công cụ:
- Movie Gen Video Bench: Công cụ gồm 1003 prompt bao quát nhiều danh mục kiểm thử như hoạt động của con người, động vật, phong cảnh tự nhiên, vật lý, cũng như các chủ thể và hoạt động khác thường. Điểm đặc biệt giá trị của benchmark đánh giá này là phạm vi bao phủ các mức độ chuyển động, đảm bảo video generation model được kiểm thử cả với các chuỗi chuyển động nhanh và chậm.
- Movie Gen Audio Bench: Công cụ được thiết kế để kiểm tra khả năng tạo âm thanh qua 527 prompt. Các prompt này được ghép với video được tạo ra nhằm đánh giá mức độ model có thể đồng bộ hiệu ứng âm thanh và âm nhạc với nội dung hình ảnh.

Hình 7. Sơ đồ thể hiện sự phân tích các prompt đánh giá, với danh sách các khái niệm ở bên trái và đám mây từ gồm những danh từ và động từ thường dùng ở bên phải.
Một ứng dụng thực tiễn của Meta Movie Gen#
Giờ đây, khi đã tìm hiểu các model Meta Movie Gen là gì và cách chúng hoạt động, hãy cùng khám phá một ứng dụng thực tiễn của chúng.
Những đổi mới của Movie Gen AI trong lĩnh vực làm phim#
Một trong những ứng dụng thú vị nhất của Movie Gen của Meta là khả năng biến đổi quy trình làm phim thông qua việc tạo video và âm thanh bằng AI. Với Movie Gen, các nhà sáng tạo có thể tạo hình ảnh và âm thanh chất lượng cao từ những prompt văn bản đơn giản, mở ra những cách mới để kể chuyện.
Trên thực tế, Meta đã hợp tác với Blumhouse và một nhóm các nhà làm phim để thu thập phản hồi của họ về cách Movie Gen có thể hỗ trợ tốt nhất cho quy trình sáng tạo. Những nhà làm phim như Aneesh Chaganty, Spurlock Sisters và Casey Affleck đã thử nghiệm khả năng nắm bắt tâm trạng, sắc thái và định hướng hình ảnh của công cụ. Họ phát hiện rằng các model giúp khơi nguồn những ý tưởng mới mẻ.
Chương trình thí điểm này cho thấy dù Movie Gen không thay thế quy trình làm phim truyền thống, công cụ vẫn mang đến cho đạo diễn một cách mới để thử nghiệm nhanh chóng và sáng tạo với các yếu tố hình ảnh và âm thanh. Các nhà làm phim cũng đánh giá cao việc những tính năng chỉnh sửa của công cụ cho phép họ tự do thử nghiệm hơn với âm thanh nền, hiệu ứng và phong cách hình ảnh.

Hình 8. Một khung hình của bộ phim ngắn được tạo bằng Meta Movie Gen.
Những điểm chính#
Meta Movie Gen là một bước tiến trong việc sử dụng AI tạo sinh để tạo video và âm thanh chất lượng cao từ những mô tả văn bản đơn giản. Công cụ này giúp người dùng dễ dàng tạo các video chân thực và tùy chỉnh. Với những khả năng như chỉnh sửa video chính xác và tạo phương tiện cá nhân hóa, Meta Movie Gen cung cấp một bộ công cụ linh hoạt, mở ra những khả năng mới cho hoạt động kể chuyện, làm phim và nhiều lĩnh vực khác. Bằng cách giúp việc tạo ra hình ảnh chi tiết và hữu ích trở nên dễ dàng hơn, Meta Movie Gen đang thay đổi cách video được tạo ra và sử dụng trong nhiều lĩnh vực khác nhau, đồng thời thiết lập một tiêu chuẩn mới cho hoạt động sáng tạo nội dung do AI thúc đẩy.
Để tìm hiểu thêm, hãy truy cập repository GitHub của chúng tôi và tham gia cộng đồng. Khám phá các ứng dụng AI trong xe tự lái và nông nghiệp trên các trang giải pháp của chúng tôi. 🚀









