Tạo video với Veo của Google DeepMind
Tìm hiểu thêm về Veo, model video tạo sinh mới nhất của Google DeepMind, có thể dễ dàng tạo video 1080P chất lượng cao từ prompt văn bản, hình ảnh và video.

Trong bài thuyết trình Google I/O 2024 vào ngày 14 tháng 5, họ đã chia sẻ những cập nhật mới nhất từ DeepMind, bộ phận AI của Google. Một trong những tiến bộ thú vị nhất được giới thiệu là model video sinh tạo mới nhất của họ, Veo. Veo có thể tạo video 1080P chất lượng cao dựa trên prompt văn bản, hình ảnh và video. Model này thậm chí còn cho phép bạn chỉnh sửa video đã tạo bằng các prompt tiếp theo. Veo đưa AI sinh tạo lên một tầm cao mới. Hãy cùng tìm hiểu kỹ hơn về các tính năng mà Veo cung cấp.
Tìm hiểu các khả năng của Veo#
Veo là một model video sinh tạo, sử dụng khả năng hiểu sâu về ngôn ngữ và hình ảnh để tạo ra các video bám sát ý tưởng sáng tạo của người dùng. Model này có thể nắm bắt chính xác sắc thái và chi tiết của các prompt dài, trở thành một công cụ mạnh mẽ cho những nhà sáng tạo muốn chuyển hóa ý tưởng thành nội dung video chính xác.
Người dùng có thể kiểm soát video được tạo ở mức đột phá vì Veo hiểu các kỹ thuật làm phim như "timelapse" và "cảnh quay từ trên không của một phong cảnh". Mức độ kiểm soát sáng tạo này cho phép người dùng tạo ra các video trong đó con người, động vật và vật thể chuyển động tự nhiên. Video do Veo tạo ra hấp dẫn và bắt mắt vì rất khó nhận ra chúng được tạo bởi một model AI.
Veo không chỉ đơn thuần tạo video từ prompt. Nếu bạn cung cấp một video đã tạo trước đó cùng yêu cầu chỉnh sửa cụ thể, chẳng hạn như chèn thuyền kayak vào góc nhìn từ trên không của đường bờ biển, Veo có thể tích hợp thay đổi này một cách liền mạch vào video gốc và tạo ra phiên bản cập nhật.

Hình 1. Ví dụ về chỉnh sửa video bằng Veo.
Dưới đây là một số tính năng khác mà Veo cung cấp:
- Chỉnh sửa theo vùng chọn: Veo có thể hỗ trợ bạn chỉnh sửa các vùng được xác định trong video.
- Tạo video lấy cảm hứng từ hình ảnh: Bằng cách sử dụng một hình ảnh và prompt văn bản, Veo có thể tạo video phản ánh phong cách của hình ảnh và tuân theo hướng dẫn trong prompt.
- Mở rộng đoạn video: Veo có thể tạo và kéo dài các đoạn video lên 60 giây hoặc hơn, từ một prompt đơn lẻ hoặc một chuỗi prompt cùng kể một câu chuyện.
Những video ấn tượng do Veo tạo ra#
Hãy cùng xem qua một số video do Veo tạo ra và lý do chúng ấn tượng đến vậy.
Tạo video timelapse từ một prompt văn bản ngắn là một thử thách. Thông thường, prompt văn bản ngắn không thể truyền tải chính xác những thay đổi và chuyển động trong cảnh timelapse. Vì vậy, thật đáng kinh ngạc khi Veo có thể hiểu cần kỳ vọng điều gì từ một timelapse mà không cần đi sâu vào chi tiết.

Hình 2. Một khung hình từ video timelapse do Veo tạo ra.
Tương tự, việc tạo video có physics chính xác không hề dễ dàng. Model AI cần hiểu và mô phỏng các định luật vật lý như trọng lực, động lượng và va chạm để khiến chuyển động và tương tác trông chân thực. Khả năng Veo mô hình hóa chính xác các động lực này mà không cần hướng dẫn chi tiết từ prompt văn bản thật ấn tượng.

Hình 3. Một khung hình từ video được tạo bằng Veo, ghi lại chính xác physics trong chuyển động của sứa.
Cho đến nay, chúng ta chỉ thấy các video ngắn do AI tạo ra do những hạn chế về tính toán và độ phức tạp của việc duy trì tính nhất quán trong các chuỗi dài hơn. Trong bài thuyết trình Google I/O 2024, khả năng đáng kinh ngạc của Veo trong việc tạo ra các video dài hơn và phức tạp hơn đã được trình diễn.

Hình 4. Các khung hình từ video Veo dài hơn được trình chiếu tại bài thuyết trình Google I/O 2024.
Veo hoạt động như thế nào?#
Giống như nhiều model AI khác, Veo kế thừa thành quả của những thế hệ tiên phong. Model này dựa trên các tiến bộ trước đó như Mạng truy vấn sinh tạo (GQN), DVD-GAN, Imagen-Video, Phenaki, WALT, VideoPoet và Lumiere, cùng kiến trúc Transformer độc quyền của Google và Gemini. Ngoài ra, để cải thiện khả năng diễn giải chính xác các prompt của Veo, chú thích của mỗi video trong dataset huấn luyện được viết chi tiết hơn.
Dựa trên quy trình hoạt động tổng quan của model do Google chia sẻ, Veo hoạt động như sau:
- Prompt đầu vào: Bạn cung cấp một prompt văn bản và tùy chọn thêm một prompt hình ảnh.
- Mã hóa: Prompt văn bản được xử lý bởi một UL2 Encoder, còn prompt hình ảnh được xử lý bởi một image encoder.
- Prompt embedding: Các đầu ra từ text encoder và image encoder được kết hợp để tạo thành một prompt embedding duy nhất.
- Latent Diffusion Model: Prompt embedding và một video nén có nhiễu được đưa vào model này, sau đó model sử dụng chúng để tạo ra một video nén. Veo sử dụng các biểu diễn video nén chất lượng cao, được gọi là latent, để cải thiện hiệu suất mà vẫn duy trì chất lượng.
- Giải mã: Bước cuối cùng giải mã đầu ra video 1080p từ video nén.

Hình 5. Cách Veo hoạt động.
Một case study thuyết phục trong lĩnh vực làm phim#
Để thử nghiệm khả năng của Veo, Google đã hợp tác với nhà làm phim Donald Glover và studio sáng tạo Gilga của anh. Họ sử dụng Veo để khám phá nhiều kỹ thuật sáng tạo, bao gồm các cảnh quay tracking động, vốn đòi hỏi chuyển động chính xác và khung hình nhất quán.

Hình 6. Sử dụng Veo trong quy trình làm phim.
Theo cách làm truyền thống, các nhà làm phim gặp nhiều hạn chế do ràng buộc về thời gian và nguồn lực. Với Veo, Glover và đội ngũ của anh có thể nhanh chóng thử nghiệm và tạo ra các cảnh quay phức tạp, qua đó mang lại nhiều sự linh hoạt và đổi mới hơn trong quy trình làm phim.
Với Veo, Glover và đội ngũ của anh có thể nhanh chóng thử nghiệm và tạo các cảnh quay phức tạp trước khi quay thực tế. Chẳng hạn, họ có thể thử nhiều cảnh quay tracking động để xem hình thức của chúng và điều chỉnh khi cần. Quy trình tiền trực quan hóa này giúp họ hoàn thiện ý tưởng và đảm bảo các cảnh quay hoạt động đúng như dự kiến, từ đó giảm số lần quay cần thiết trong quá trình quay thực tế. Họ đã tạo ra một case study thuyết phục để chứng minh tiềm năng thay đổi ngành điện ảnh của Veo. Công cụ này mang đến một cách nhanh hơn và hiệu quả hơn để biến các ý tưởng sáng tạo thành hiện thực.
Các ứng dụng thực tiễn của Veo trong nhiều ngành#
Khả năng tạo video tiên tiến của Veo có nhiều ứng dụng thực tiễn trong các ngành khác nhau. Trong quảng cáo, model này có thể nhanh chóng tạo ra các quảng cáo tùy chỉnh, chất lượng cao cho những nhóm khán giả mục tiêu, giúp tiết kiệm thời gian và chi phí sản xuất. Trong giáo dục, Veo có thể tạo các video hướng dẫn hấp dẫn, giúp các khái niệm phức tạp dễ hiểu hơn.
Doanh nghiệp có thể sử dụng Veo cho hoạt động đào tạo và truyền thông doanh nghiệp. Các chuyên gia y tế có thể dùng Veo để mô phỏng các quy trình y khoa nhằm phục vụ đào tạo. Đối với các sự kiện và hội nghị ảo, Veo có thể tạo mô phỏng chân thực về địa điểm và sân khấu, mang đến cho người tham dự trải nghiệm hấp dẫn và tương tác từ bất kỳ đâu. Ban tổ chức được hưởng lợi từ phạm vi tiếp cận mở rộng và những insight giá trị cho các sự kiện trong tương lai. Nhờ Veo, vô số cơ hội đã mở ra.
Khi một model AI có tiềm năng tác động đến nhiều ngành khác nhau, điều quan trọng là phải lưu ý đến vấn đề an toàn và AI có đạo đức. Để thúc đẩy việc áp dụng rộng rãi hơn và đảm bảo sử dụng có trách nhiệm, Google đã triển khai một số biện pháp an toàn. Video do Veo tạo ra được gắn watermark bằng SynthID, một công cụ gắn watermark và xác định nội dung do AI tạo. SynthID đảm bảo tính minh bạch và giúp giảm thiểu các rủi ro về quyền riêng tư, bản quyền và thiên kiến. Ngoài ra, tất cả video được tạo đều đi qua các bộ lọc an toàn và quy trình kiểm tra khả năng ghi nhớ. Những biện pháp bảo vệ này biến Veo thành một công cụ hữu ích và có đạo đức, hỗ trợ hoạt động sản xuất video đổi mới và có trách nhiệm.
Truy cập Veo ở đâu#
Trong những tuần tới, Google sẽ bắt đầu cung cấp một số tính năng đột phá của Veo cho các nhà sáng tạo được chọn thông qua VideoFX, một công cụ mới có tại labs.google. Sáng kiến này cho phép truy cập sớm vào các khả năng tạo video tiên tiến của Veo, giúp các nhà sáng tạo có cơ hội thử nghiệm những tính năng đổi mới của model. Danh sách chờ Veo hiện đang mở, mời các nhà sáng tạo quan tâm đăng ký và sử dụng các công cụ mạnh mẽ của Veo trong dự án của họ.
Tìm hiểu thêm về các cập nhật AI sinh tạo năm 2024 của DeepMind#
Ngoài Veo, DeepMind đã giới thiệu một số cập nhật tiên tiến trong lĩnh vực AI sinh tạo năm 2024. Một trong số đó là Imagen 3, model chuyển văn bản thành hình ảnh tiên tiến nhất của họ cho đến nay. Imagen 3 xuất sắc trong việc tạo ra những hình ảnh chân thực như ảnh chụp. Model này hiểu sâu các prompt bằng ngôn ngữ tự nhiên và nắm bắt những chi tiết tinh vi, đồng thời giảm thiểu các artifact hình ảnh.

Hình 7. Một hình ảnh được tạo bằng Imagen 3.
DeepMind cũng đã phát triển Lyria, model tiên tiến nhất của họ để tạo nhạc bằng AI. Trong nỗ lực này, DeepMind đã tạo ra một bộ công cụ AI âm nhạc có tên Music AI Sandbox. Các công cụ này cho phép nhạc sĩ và nhà sản xuất khám phá những khả năng sáng tạo mới trong việc sáng tác và chuyển đổi âm thanh.

Hình 8. Ví dụ về UI của các công cụ AI âm nhạc của DeepMind.
Tương tự như Veo, DeepMind cũng đã triển khai một số biện pháp an toàn cho các cập nhật khác của mình. SynthID sẽ được sử dụng trong các cập nhật này như một công cụ gắn watermark và xác định nội dung do AI tạo. Những cập nhật từ DeepMind hứa hẹn chuyển đổi nhiều ngành bằng cách cung cấp các công cụ tiên tiến, hiệu quả và có trách nhiệm để tạo nội dung hình ảnh và âm thanh chất lượng cao.
Định hướng giai đoạn tiếp theo của AI sinh tạo#
Những tiến bộ về AI sinh tạo năm 2024 của DeepMind, bao gồm Veo, Imagen 3 và Lyria, đánh dấu bước tiến đáng kể về năng lực AI. Veo chuyển đổi hoạt động tạo video nhờ khả năng tạo video 1080p chất lượng cao từ các prompt đơn giản, trở thành một công cụ linh hoạt cho các nhà làm phim và nhà sáng tạo nội dung. Imagen 3 nổi bật trong việc tạo hình ảnh chân thực như ảnh chụp, còn Lyria mở ra những khả năng mới trong lĩnh vực tạo nhạc với các công cụ AI tiên tiến.
Các công nghệ này hứa hẹn chuyển đổi nhiều ngành bằng cách cung cấp các công cụ hiệu quả và có trách nhiệm để tạo nội dung hình ảnh và âm thanh chất lượng cao. Với những biện pháp an toàn như SynthID giúp đảm bảo việc sử dụng có đạo đức, DeepMind tiếp tục mở rộng ranh giới của AI, mở đường cho các ứng dụng đổi mới trong tương lai.
Khám phá AI bằng cách truy cập repository GitHub của chúng tôi và tham gia cộng đồng. Khám phá các trang giải pháp của chúng tôi để tìm hiểu cách AI được ứng dụng trong sản xuất và nông nghiệp.









