YOLO Vision 2026:
Thị giác AI

Google Genie 3 mang thế giới 3D của bạn vào cuộc sống với AI

Genie 3 AI world model của DeepMind chuyển đổi các gợi ý văn bản hoặc hình ảnh thành môi trường 3D. Tiến bộ này đánh dấu một bước tiến khác tới trí tuệ giống con người.

ABAbirami Vina4 min read
Google DeepMind Genie 3 tạo ra một thế giới 3D

Vào ngày 5 tháng 8 năm 2025, Google DeepMind đã phát hành phiên bản mới nhất của mô hình Genie, được biết đến là Genie 3. Đây là một mô hình AI mới có khả năng chuyển đổi các câu lệnh văn bản của người dùng thành các môi trường tương tác năng động.

Những môi trường này, hay các thế giới AI, cho phép người dùng điều hướng và tương tác với chúng trong thời gian thực, giống như trong một trò chơi điện tử. Người dùng cũng có thể mở rộng hoặc sửa đổi môi trường bằng cách cung cấp thêm các câu lệnh văn bản, cho phép thực hiện những thay đổi ngay lập tức mà không cần khởi động lại mô phỏng.

Điều làm cho model Genie mới nhất của Google có sức ảnh hưởng đặc biệt là nó có thể được sử dụng để train các AI agent. Điều này liên quan đến việc dạy cho AI agents cách đưa ra quyết định hoặc thực hiện các tác vụ sử dụng dữ liệu và feedback. Bằng cách sử dụng một môi trường 3D giả lập thay vì thế giới thực, các nhà nghiên cứu có thể tránh được nhiều thách thức, chi phí và rủi ro của việc training trong thế giới thực.

Google Genie 3 cũng có thể giả lập các kịch bản phức tạp, chẳng hạn như kiểm thử một autonomous car lái xe qua điều kiện thời tiết khắc nghiệt hoặc bộ đồ bay lượn qua địa hình núi non.

Trong bài viết này, chúng ta sẽ khám phá Google Genie 3 và các khả năng của nó. Hãy cùng bắt đầu!

Frame from a Genie 3 simulation showing a wingsuit gliding

Hình 1. Một khung hình từ mô phỏng Genie 3 hiển thị bộ đồ bay lượn. (Nguồn)

Lược sử về các mô hình Genie của Google#

Trước khi đi sâu vào các mô hình Genie của Google DeepMind, hãy cùng tìm hiểu rõ hơn về thế giới mô hình (world models) là gì.

World model là các hệ thống AI học các quy tắc thế giới thực như vật lý, chuyển động và mối quan hệ không gian từ các dataset văn bản, hình ảnh, video và chuyển động. Điều này cho phép chúng tạo ra các bối cảnh thực tế và predict cách chúng tiến hóa. Các model Genie là ví dụ về các hệ thống như vậy.

Dưới đây là cái nhìn nhanh về các mô hình Google Genie trước đây đã mở đường cho Genie 3:

  • Genie 1: Genie 1, thường được gọi đơn giản là Google Genie, là mô hình thế giới AI đầu tiên của Google DeepMind có khả năng tạo ra các môi trường ảo tương tác. Người dùng có thể mô tả một thế giới bằng văn bản, hình ảnh, ảnh chụp hoặc thậm chí là bản phác thảo, và Genie sẽ tạo ra nó, cho phép họ kiểm soát các hành động trong cảnh. Nó được thiết kế để xử lý dữ liệu video theo thời gian, dự đoán khung hình tiếp theo và chuyển đổi đầu vào của người dùng thành các hành động trong thế giới đó.

  • Genie 2: Dựa trên các khả năng của Google Genie, Genie 2 có thể tạo ra nhiều thế giới 3D chi tiết và tương tác. Là một mô hình thế giới, nó mô phỏng các môi trường ảo và phản hồi một cách thực tế với các hành động như nhảy, bơi hoặc di chuyển đồ vật. Được huấn luyện trên một tập hợp video khổng lồ, nó có các tương tác vật thể chân thực và các chuyển động nhân vật sống động.

Genie 3 là gì? Mô hình AI mới của Google#

Dựa trên các model Genie trước đó, Genie 3 là model mới nhất và tiên tiến nhất trong series. Nó đặc biệt dựa trên Genie 2, có khả năng tạo ra các môi trường ảo mới, và Veo 3, model tạo video mới nhất của Google DeepMind. Veo 3 thể hiện sự hiểu biết sâu sắc về vật lý và cách các đối tượng tương tác trong thế giới thực.

Trong khi Veo 3 sử dụng một engine vật lý được mã hóa cứng, Google Genie 3 tự dạy cho chính nó cách vật lý hoạt động bằng cách sử dụng phương pháp được gọi là self-supervised learning. Đây là một AI learning technique trong đó một AI model học các pattern và mối quan hệ từ dữ liệu chưa được gán nhãn bằng cách tự tạo ra các tín hiệu học tập của riêng nó.

Khả năng self-supervised learning của Google Genie 3 là tối quan trọng để training các hệ thống AI, chẳng hạn như các AI agent hoặc robot AI, để xử lý các tác vụ khác nhau. Trên thực tế, các nhà nghiên cứu tại Google DeepMind coi Genie 3 là một bước tiến quan trọng hướng tới việc tạo ra Artificial General Intelligence (AGI).

Genie 3 simulating control of a robotic rover

Hình 2. Ví dụ về việc sử dụng Google Genie 3 để giả lập điều khiển một xe tự hành robot. (Nguồn)

AGI là một dạng lý thuyết của AI có khả năng hiểu và học bất kỳ tác vụ hoặc chủ đề nào và áp dụng kiến thức đó vào các tình huống khác nhau, giống như con người. Khác với các mô hình trí tuệ nhân tạo ngày nay vốn được xây dựng cho các tác vụ cụ thể và gặp khó khăn trong việc chuyển giao kỹ năng của chúng sang các vấn đề mới, AGI sẽ có khả năng thích nghi và học hỏi trong nhiều ngữ cảnh rộng lớn.

Các tính năng chính của Google Genie 3 liên quan đến việc xây dựng thế giới AI#

Dưới đây là một số tính năng chính được hỗ trợ bởi Genie 3:

  • Tạo thế giới từ văn bản (Text-to-3D): Nó có thể biến một câu lệnh văn bản đơn giản (ví dụ: “một robot đang đi bộ trên phố”) thành một môi trường giống như 3D có thể chơi được với các điều khiển di chuyển cơ bản.

  • Sự kiện thế giới có thể gợi ý: Người dùng có thể thay đổi môi trường một cách năng động bằng cách nhập các lệnh mới (ví dụ: thêm mưa vào đường phố).

  • Bộ nhớ thị giác: Genie 3 có thể ghi nhớ các vật thể bị bỏ lại trong môi trường và cho phép bạn xem lại chúng sau đó, kéo dài trong khoảng một phút.

  • Đầu ra video mượt mà và nhất quán: Nó có thể duy trì đầu ra video ở mức 24 fps (frames per second) ở độ phân giải 720p, với thời gian tương tác dài hơn so với Genie 2.

Genie 3 generating longer-lasting outputs than Genie 2

Hình 3. Google Genie 3 có thể tạo ra các đầu ra kéo dài hơn so với các đầu ra được tạo bởi Genie 2. (Nguồn)

Từ giáo dục đến trò chơi: Các ứng dụng của Genie 3 từ Google DeepMind#

Google Genie 3 có thể làm cho việc học tập, nghiên cứu và training trở nên trực quan và hấp dẫn hơn. Ví dụ, trong các lớp học, nó có thể làm cho lịch sử, khoa học hoặc địa lý trở nên sống động bằng cách cho phép học sinh khám phá các thành phố cổ đại hoặc du hành qua space. Tương tự, đối với các developer trí tuệ nhân tạo, nó cung cấp các thế giới ảo thực tế để thực hành chiến lược, điều hướng các thách thức và cải thiện kỹ năng ra quyết định.

Các nhà khoa học cũng có thể sử dụng nó để tạo ra các mô phỏng có kiểm soát để kiểm thử các ý tưởng, nghiên cứu hệ sinh thái hoặc quan sát hành vi của các đối tượng. Một ứng dụng thú vị khác là trong game development video. Các developer game có thể biến các prompt văn bản thành các thế giới game chi tiết, đẩy nhanh quá trình phát triển và giảm bớt nhu cầu về các nhóm lớn.

Colorful interactive game designed using Genie 3

Hình 4. Các tựa game vui nhộn, nhiều màu sắc và tính tương tác cao có thể được thiết kế bằng cách sử dụng Genie 3. (Nguồn)

Các hạn chế của Google Genie 3 như một mô hình thế giới#

Mặc dù Google Genie 3 cung cấp nhiều tính năng và lợi ích, nhưng cũng rất quan trọng khi xem xét các nhược điểm của nó.

Dưới đây là một số hạn chế cần xem xét:

  • Phạm vi hành động hạn chế: Mặc dù bạn có thể kích hoạt nhiều sự kiện trong thế giới ảo, không phải tất cả chúng đều được thực hiện bởi chính tác nhân đó. Các hành động mà một tác nhân có thể thực hiện trực tiếp vẫn còn bị hạn chế.

  • Tương tác với các tác nhân khác: Việc tạo ra các tương tác thực tế giữa nhiều tác nhân độc lập trong cùng một môi trường vẫn là một công việc đang được tiếp tục hoàn thiện.

  • Độ chính xác trong thế giới thực: Google Genie 3 vẫn chưa thể tái tạo các địa điểm trong thế giới thực với độ chính xác địa lý hoàn hảo.

Các điểm chính cần lưu ý#

Google Genie 3 đại diện cho một bước tiến đáng kể trong việc tạo ra các thế giới 3D tương tác, chân thực với AI. Nó có thể biến các ý tưởng từ những câu lệnh văn bản đơn giản thành hiện thực, mô phỏng vật lý và thậm chí huấn luyện các hệ thống AI trong các không gian ảo an toàn.

Mặc dù vẫn còn những hạn chế, nó mở ra nhiều khả năng cho nghiên cứu, trò chơi và phát triển AI. Đây cũng là một bước quan trọng hướng tới các hệ thống AGI có thể suy nghĩ và học hỏi giống con người hơn.

Hãy xem GitHub repository của chúng tôi để khám phá thêm về AI. Tham gia community năng động của chúng tôi và khám phá những đổi mới trong các lĩnh vực như AI in the retail công nghiệp và vision AI in manufacturing. Để bắt đầu với computer vision ngay hôm nay, hãy xem các licensing options của chúng tôi.

Explore solutions

Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning