Google Genie 3 đưa thế giới 3D của bạn vào cuộc sống bằng AI
World model Genie 3 AI của DeepMind chuyển đổi prompt dạng văn bản hoặc hình ảnh thành các môi trường 3D. Bước tiến này đánh dấu một bước tiến nữa hướng tới trí tuệ giống con người.

Vào ngày 5 tháng 8 năm 2025, Google DeepMind đã phát hành phiên bản mới nhất của model Genie, có tên là Genie 3. Đây là một model AI mới có thể chuyển các prompt văn bản của người dùng thành những môi trường năng động, tương tác.
Những môi trường này, hay các thế giới AI, cho phép người dùng điều hướng và tương tác với chúng theo thời gian thực, tương tự như trong một trò chơi điện tử. Người dùng cũng có thể mở rộng hoặc sửa đổi môi trường bằng cách cung cấp thêm các prompt văn bản, cho phép thay đổi ngay lập tức mà không cần khởi động lại mô phỏng.
Điểm khiến model Genie mới nhất của Google đặc biệt có tác động lớn là khả năng được sử dụng để huấn luyện các tác nhân AI. Quá trình này bao gồm việc dạy các tác nhân AI đưa ra quyết định hoặc thực hiện tác vụ bằng dữ liệu và phản hồi. Bằng cách sử dụng môi trường 3D mô phỏng thay vì thế giới thực, các nhà nghiên cứu có thể tránh nhiều thách thức, chi phí và rủi ro trong quá trình huấn luyện ngoài đời thực.
Google Genie 3 cũng có thể mô phỏng các kịch bản phức tạp, chẳng hạn như kiểm thử một xe tự hành chạy trong điều kiện thời tiết khắc nghiệt hoặc một người mặc wingsuit lượn qua địa hình núi non.
Trong bài viết này, chúng ta sẽ khám phá Google Genie 3 và các khả năng của model. Hãy bắt đầu!

Hình 1. Một khung hình từ mô phỏng Genie 3 cho thấy người mặc wingsuit đang lượn. (Nguồn)
Lịch sử tóm lược của các model Genie của Google#
Trước khi tìm hiểu sâu hơn về các model Genie của Google DeepMind, hãy cùng hiểu rõ hơn về world model.
World model là các hệ thống AI học những quy luật của thế giới thực như vật lý, chuyển động và mối quan hệ không gian từ văn bản, hình ảnh, video và dataset chuyển động. Điều này cho phép chúng tạo ra các cảnh chân thực và dự đoán cách chúng biến đổi. Các model Genie là những ví dụ về các hệ thống như vậy.
Dưới đây là cái nhìn nhanh về các model Google Genie trước đây, những nền tảng mở đường cho Genie 3:
-
Genie 1: Genie 1, thường được gọi đơn giản là Google Genie, là world model AI đầu tiên của Google DeepMind có khả năng tạo ra các môi trường ảo tương tác. Người dùng có thể mô tả một thế giới bằng văn bản, hình ảnh, ảnh chụp hoặc thậm chí bản phác thảo, rồi Genie sẽ tạo ra thế giới đó và cho phép họ điều khiển các hành động trong cảnh. Model này được thiết kế để xử lý dữ liệu video theo thời gian, dự đoán khung hình tiếp theo và chuyển đổi đầu vào của người dùng thành các hành động trong thế giới ảo.
-
Genie 2: Kế thừa các khả năng của Google Genie, Genie 2 có thể tạo ra nhiều thế giới 3D chi tiết và tương tác. Với vai trò là một world model, nó mô phỏng các môi trường ảo và phản hồi chân thực trước những hành động như nhảy, bơi hoặc di chuyển đồ vật. Được huấn luyện trên một bộ sưu tập video khổng lồ, model này có khả năng tương tác giữa các đối tượng chân thực và chuyển động nhân vật sống động.
Genie 3 là gì? Model AI mới của Google#
Kế thừa các model Genie trước đây, Genie 3 là model mới nhất và tiên tiến nhất trong dòng sản phẩm này. Model này đặc biệt phát triển dựa trên Genie 2, vốn có thể tạo ra các môi trường ảo mới, và Veo 3, model tạo video mới nhất của Google DeepMind. Veo 3 thể hiện khả năng hiểu sâu về vật lý và cách các vật thể tương tác trong thế giới thực.
Trong khi Veo 3 sử dụng một physics engine được lập trình cố định, Google Genie 3 tự học cách vật lý vận hành bằng một phương pháp gọi là học tự giám sát. Đây là một kỹ thuật học AI, trong đó model AI học các mẫu và mối quan hệ từ dữ liệu chưa gán nhãn bằng cách tự tạo ra các tín hiệu học.
Khả năng học tự giám sát của Google Genie 3 rất quan trọng đối với việc huấn luyện các hệ thống AI, chẳng hạn như tác nhân AI hoặc robot AI, để xử lý nhiều tác vụ khác nhau. Trên thực tế, các nhà nghiên cứu tại Google DeepMind xem Genie 3 là một bước tiến quan trọng hướng tới việc tạo ra Trí tuệ nhân tạo tổng quát (AGI).

Hình 2. Ví dụ về việc sử dụng Google Genie 3 để mô phỏng điều khiển một xe tự hành robot. (Nguồn)
AGI là một dạng AI mang tính lý thuyết, có thể hiểu và học bất kỳ tác vụ hoặc chủ đề nào, đồng thời áp dụng kiến thức đó trong nhiều tình huống khác nhau, tương tự con người. Không giống các model trí tuệ nhân tạo ngày nay, vốn được xây dựng cho những tác vụ cụ thể và gặp khó khăn khi chuyển giao kỹ năng sang các vấn đề mới, AGI có thể thích ứng và học hỏi trong nhiều bối cảnh khác nhau.
Các tính năng chính của Google Genie 3 liên quan đến việc xây dựng một thế giới AI#
Dưới đây là một số tính năng chính được Genie 3 hỗ trợ:
-
Tạo thế giới từ văn bản sang 3D: Model có thể chuyển một prompt văn bản đơn giản (ví dụ: “một robot đi bộ trên phố”) thành một môi trường dạng 3D có thể chơi được, với các điều khiển chuyển động cơ bản.
-
Các sự kiện thế giới có thể điều khiển bằng prompt: Người dùng có thể thay đổi môi trường một cách linh hoạt bằng cách nhập các lệnh mới (ví dụ: thêm mưa vào đường phố).
-
Bộ nhớ hình ảnh: Genie 3 có thể ghi nhớ các vật thể bị bỏ lại trong môi trường và cho phép bạn quay lại xem chúng sau đó, với thời gian ghi nhớ khoảng một phút.
-
Đầu ra video mượt mà và nhất quán: Model có thể duy trì đầu ra video ở tốc độ 24 fps (khung hình mỗi giây) với độ phân giải 720p, cùng thời lượng tương tác dài hơn so với Genie 2.

Hình 3. Google Genie 3 có thể tạo ra các đầu ra kéo dài hơn những đầu ra do Genie 2 tạo ra. (Nguồn)
Từ giáo dục đến game: Các ứng dụng của Google DeepMind Genie 3#
Google Genie 3 có thể khiến việc học tập, nghiên cứu và huấn luyện trở nên trực quan và hấp dẫn hơn. Ví dụ, trong lớp học, model có thể đưa lịch sử, khoa học hoặc địa lý vào cuộc sống bằng cách cho phép học sinh khám phá các thành phố cổ hoặc du hành qua không gian. Tương tự, đối với các nhà phát triển trí tuệ nhân tạo, model cung cấp những thế giới ảo chân thực để thực hành chiến lược, vượt qua thử thách và cải thiện kỹ năng ra quyết định.
Các nhà khoa học cũng có thể sử dụng model để tạo ra những mô phỏng có kiểm soát nhằm kiểm thử ý tưởng, nghiên cứu hệ sinh thái hoặc quan sát hành vi của các vật thể. Một ứng dụng thú vị khác là trong lĩnh vực phát triển game. Các nhà phát triển game có thể biến prompt văn bản thành những thế giới game chi tiết, đẩy nhanh quá trình phát triển và giảm nhu cầu về các đội ngũ lớn.

Hình 4. Có thể thiết kế các game vui nhộn, đầy màu sắc và mang tính tương tác bằng Genie 3. (Nguồn)
Những hạn chế của Google Genie 3 với vai trò world model#
Mặc dù Google Genie 3 cung cấp nhiều tính năng và lợi ích, điều quan trọng là cũng cần cân nhắc những hạn chế của model.
Dưới đây là một số hạn chế cần cân nhắc:
-
Phạm vi hành động hạn chế: Mặc dù bạn có thể kích hoạt nhiều sự kiện trong thế giới ảo, không phải tất cả đều được chính tác nhân thực hiện. Những hành động mà tác nhân có thể trực tiếp thực hiện vẫn còn hạn chế.
-
Tương tác với các tác nhân khác: Việc tạo ra các tương tác chân thực giữa nhiều tác nhân độc lập trong cùng một môi trường vẫn đang trong quá trình phát triển.
-
Độ chính xác so với thế giới thực: Google Genie 3 hiện vẫn chưa thể tái tạo các địa điểm trong thế giới thực với độ chính xác địa lý tuyệt đối.
Những điểm chính#
Google Genie 3 thể hiện một bước tiến đáng kể trong việc tạo ra các thế giới 3D chân thực và tương tác bằng AI. Model có thể biến ý tưởng thành hiện thực từ những prompt văn bản đơn giản, mô phỏng vật lý và thậm chí huấn luyện các hệ thống AI trong những không gian ảo an toàn.
Mặc dù vẫn còn những hạn chế, model này mở ra nhiều khả năng cho nghiên cứu, game và phát triển AI. Đây cũng là một bước quan trọng hướng tới các hệ thống AGI có thể suy nghĩ và học hỏi giống con người hơn.
Hãy xem repository GitHub của chúng tôi để khám phá thêm về AI. Tham gia cộng đồng năng động của chúng tôi và khám phá những đổi mới trong các lĩnh vực như AI trong ngành bán lẻ và vision AI trong sản xuất. Để bắt đầu với computer vision ngay hôm nay, hãy xem các tùy chọn cấp phép của chúng tôi.









