Khám phá SAM 3: Mô hình Segment Anything mới của Meta AI
Tìm hiểu cách SAM 3, mô hình Segment Anything mới của Meta AI, giúp dễ dàng phát hiện, phân đoạn và theo dõi các đối tượng trong hình ảnh và video thực tế.

Vào ngày 19 tháng 11 năm 2025, Meta AI đã phát hành Segment Anything Model 3, còn được gọi là SAM 3. Phiên bản mới nhất này giới thiệu những phương thức mới để phát hiện, phân đoạn và theo dõi các đối tượng trong hình ảnh và video thực tế bằng prompt văn bản, prompt hình ảnh và các ví dụ hình ảnh.
Model SAM 3 được xây dựng dựa trên SAM và SAM 2, đồng thời mang đến các tiến bộ và tính năng mới như phân đoạn khái niệm, phát hiện với từ vựng mở và theo dõi video theo thời gian thực. Model này có thể hiểu các cụm danh từ ngắn, theo dõi đối tượng qua các frame và nhận diện những khái niệm chi tiết hoặc hiếm gặp mà các model trước đây không thể xử lý một cách nhất quán.
Trong khuôn khổ phát hành SAM 3, Meta cũng giới thiệu SAM 3D. Bộ model thế hệ mới này tái dựng đối tượng, cảnh và toàn bộ cơ thể người từ một hình ảnh duy nhất, đồng thời mở rộng hệ sinh thái Segment Anything sang lĩnh vực hiểu 3D. Những bổ sung này mở ra các ứng dụng mới trong thị giác máy tính, robot, chỉnh sửa media và quy trình sáng tạo.
Trong bài viết này, chúng ta sẽ tìm hiểu SAM 3 là gì, điểm khác biệt của nó so với SAM 2, cách model hoạt động và các ứng dụng trong thực tế. Hãy bắt đầu!
SAM 3 là gì? Tìm hiểu Segment Anything Model 3 của Meta#
SAM 3 là một model thị giác máy tính hiện đại, có thể nhận diện, tách và theo dõi các đối tượng trong hình ảnh và video dựa trên các chỉ dẫn đơn giản. Thay vì phụ thuộc vào một danh sách nhãn cố định, SAM 3 hiểu ngôn ngữ tự nhiên và các tín hiệu hình ảnh, giúp bạn dễ dàng cho model biết mình muốn tìm gì.
Ví dụ, với SAM 3, bạn có thể nhập một cụm từ ngắn như “xe buýt trường học màu vàng” hoặc “một con mèo có sọc”, nhấp vào một đối tượng hoặc đánh dấu một ví dụ trong hình ảnh. Sau đó, model sẽ phát hiện mọi đối tượng khớp và tạo các mask phân đoạn rõ ràng (đường viền trực quan cho biết chính xác pixel nào thuộc về một đối tượng). SAM 3 cũng có thể theo dõi các đối tượng đó qua các frame video, duy trì tính nhất quán khi chúng di chuyển.
SAM 3D cho phép tái dựng 3D từ một hình ảnh duy nhất#
Một phần đáng chú ý khác trong thông báo của Meta AI là SAM 3D, mở rộng dự án Segment Anything sang lĩnh vực hiểu 3D. SAM 3D có thể nhận một hình ảnh 2D duy nhất và tái dựng hình dạng, tư thế hoặc cấu trúc của một đối tượng hay cơ thể người trong không gian ba chiều. Nói cách khác, model có thể ước tính cách một vật thể chiếm giữ không gian ngay cả khi chỉ có một góc nhìn.
SAM 3D được phát hành dưới dạng hai model khác nhau: SAM 3D Objects, chuyên tái dựng các vật dụng hằng ngày cùng hình học và texture, và SAM 3D Body, chuyên ước tính hình dạng và tư thế cơ thể người từ một hình ảnh duy nhất. Cả hai model đều sử dụng đầu ra phân đoạn từ SAM 3, sau đó tạo một biểu diễn 3D phù hợp với diện mạo và vị trí của đối tượng trong ảnh gốc.

Hình 1. Ví dụ sử dụng SAM 3D. (Nguồn: Được tạo bằng playground segment anything của Meta AI)
SAM 3: Các tính năng mới hợp nhất việc phát hiện, phân đoạn và theo dõi#
Dưới đây là một số cập nhật chính mà SAM 3 giới thiệu để kết hợp việc phát hiện, phân đoạn và theo dõi trong một model thống nhất:
- Tác vụ phân đoạn khái niệm: Trong SAM và SAM 2, việc phân đoạn đối tượng phụ thuộc vào các prompt hình ảnh như thao tác nhấp hoặc box. SAM 3 bổ sung khả năng phân đoạn đối tượng dựa trên một cụm từ văn bản ngắn hoặc một crop mẫu từ hình ảnh. Điều này có nghĩa là model có thể nhận diện tất cả instance khớp mà không cần nhấp vào từng instance.
- Prompt văn bản với từ vựng mở: Không giống các phiên bản trước, SAM 3 có thể diễn giải các cụm từ ngôn ngữ tự nhiên ngắn. Điều này loại bỏ nhu cầu sử dụng danh sách nhãn cố định và cho phép model làm việc với những khái niệm cụ thể hơn hoặc ít phổ biến hơn.
- Một model cho phát hiện, phân đoạn và theo dõi: SAM 3 hợp nhất việc phát hiện, phân đoạn và theo dõi trong một model, loại bỏ nhu cầu sử dụng các hệ thống riêng biệt để tìm đối tượng, tạo mask phân đoạn và theo dõi chúng qua các frame video. Điều này tạo ra một workflow nhất quán và tinh gọn hơn cho cả hình ảnh lẫn video; mặc dù SAM 2 cũng cung cấp một số khả năng theo dõi, SAM 3 mang lại hiệu năng mạnh hơn và đáng tin cậy hơn đáng kể.
- Kết quả ổn định hơn trong các cảnh phức tạp: Vì SAM 3 có thể kết hợp văn bản, hình ảnh ví dụ và prompt hình ảnh, model xử lý các cảnh lộn xộn hoặc lặp lại đáng tin cậy hơn các phiên bản trước vốn chỉ dựa vào thao tác nhấp trên hình ảnh.

Hình 2. SAM 3 giới thiệu phân đoạn khái niệm bằng văn bản hoặc ví dụ hình ảnh. (Nguồn)
So sánh SAM 3 với SAM 2 và SAM 1#
Giả sử bạn đang xem một video safari có nhiều loài động vật khác nhau và muốn chỉ phát hiện, phân đoạn những con voi. Tác vụ này sẽ diễn ra như thế nào trên các phiên bản SAM khác nhau?
Với SAM, bạn phải nhấp thủ công vào từng con voi trong mỗi frame để tạo mask phân đoạn. Model không có tính năng theo dõi, vì vậy mỗi frame mới đều yêu cầu các thao tác nhấp mới.
Với SAM 2, bạn có thể nhấp một lần vào một con voi, nhận mask của nó và để model theo dõi chính con voi đó xuyên suốt video. Tuy nhiên, bạn vẫn phải cung cấp các thao tác nhấp riêng nếu muốn phân đoạn nhiều con voi (các đối tượng cụ thể), vì bản thân SAM 2 không hiểu các danh mục như “voi”.
Với SAM 3, workflow trở nên đơn giản hơn nhiều. Bạn có thể nhập “voi” hoặc vẽ một bounding box quanh một con voi để cung cấp ví dụ, sau đó model sẽ tự động tìm mọi con voi trong video, phân đoạn chúng và theo dõi nhất quán qua các frame. Model vẫn hỗ trợ các prompt dạng nhấp và box được sử dụng trong những phiên bản trước, nhưng giờ đây cũng có thể phản hồi prompt văn bản và hình ảnh mẫu, điều mà SAM và SAM 2 không thể làm.
Cách model SAM 3 hoạt động#
Tiếp theo, hãy cùng xem xét kỹ hơn cách model SAM 3 hoạt động và cách nó được huấn luyện.
Tổng quan về kiến trúc model của SAM 3#
SAM 3 kết hợp nhiều thành phần để hỗ trợ prompt khái niệm và prompt hình ảnh trong một hệ thống duy nhất. Ở lõi, model sử dụng Meta Perception Encoder, encoder hình ảnh-văn bản mã nguồn mở thống nhất của Meta.
Encoder này có thể xử lý cả hình ảnh và các cụm danh từ ngắn. Nói một cách đơn giản, điều này cho phép SAM 3 liên kết các đặc trưng ngôn ngữ và hình ảnh hiệu quả hơn các phiên bản trước của Segment Anything Model.
Trên nền encoder này, SAM 3 tích hợp một detector dựa trên họ model Transformer DETR. Detector này nhận diện các đối tượng trong hình ảnh và giúp hệ thống xác định đối tượng nào tương ứng với prompt của người dùng.
Cụ thể, đối với phân đoạn video, SAM 3 sử dụng một thành phần theo dõi được xây dựng dựa trên memory bank và memory encoder của SAM 2. Nhờ đó, model có thể lưu giữ thông tin về các đối tượng qua các frame để tái nhận diện và theo dõi chúng theo thời gian.

Hình 3. Cách phân đoạn mọi thứ bằng các khái niệm (Nguồn: scontent)
Data engine có khả năng mở rộng phía sau Segment Anything Model 3#
Để huấn luyện SAM 3, Meta cần lượng dữ liệu được annotate lớn hơn nhiều so với những gì hiện có trên internet. Các mask phân đoạn và nhãn văn bản chất lượng cao khó tạo ở quy mô lớn, trong khi việc phác thảo đầy đủ mọi instance của một khái niệm trong hình ảnh và video vừa chậm vừa tốn kém.
Để giải quyết vấn đề này, Meta đã xây dựng một data engine mới kết hợp chính SAM 3, các model AI bổ sung và các annotator là con người làm việc cùng nhau. Workflow bắt đầu với một pipeline gồm các hệ thống AI, bao gồm SAM 3 và một model tạo caption dựa trên Llama.
Các hệ thống này quét những tập hợp lớn hình ảnh và video, tạo caption, chuyển caption thành nhãn văn bản và tạo các ứng viên mask phân đoạn ban đầu. Sau đó, annotator là con người và AI sẽ đánh giá các ứng viên này.
Các annotator AI, được huấn luyện để đạt độ chính xác tương đương hoặc thậm chí vượt con người trong những tác vụ như kiểm tra chất lượng mask và xác minh độ bao phủ khái niệm, sẽ lọc các trường hợp đơn giản. Con người chỉ can thiệp vào những ví dụ khó hơn, nơi model vẫn có thể gặp khó khăn.

Hình 4. Data engine của SAM 3 (Nguồn)
Phương pháp này giúp Meta tăng đáng kể tốc độ annotation. Khi để các annotator AI xử lý những trường hợp đơn giản, pipeline nhanh hơn khoảng năm lần với các prompt âm và nhanh hơn 36% với các prompt dương trong những lĩnh vực đòi hỏi độ chi tiết cao.
Hiệu quả này giúp mở rộng dataset lên hơn bốn triệu khái niệm độc nhất. Vòng lặp liên tục gồm đề xuất của AI, hiệu chỉnh của con người và dự đoán model được cập nhật cũng cải thiện chất lượng nhãn theo thời gian, đồng thời giúp SAM 3 học được tập hợp khái niệm hình ảnh và văn bản rộng hơn nhiều.
Những cải thiện về hiệu năng của SAM 3#
Về hiệu năng, SAM 3 mang lại cải thiện rõ rệt so với các model trước đây. Trên benchmark SA-Co mới của Meta, đánh giá khả năng phát hiện và phân đoạn khái niệm với từ vựng mở, SAM 3 đạt hiệu năng cao hơn khoảng hai lần so với các hệ thống trước đây trên cả hình ảnh và video.
Model cũng đạt hoặc vượt SAM 2 trong các tác vụ hình ảnh tương tác như point-to-mask và mask-to-masklet. Meta báo cáo thêm những cải thiện trong các phép đánh giá khó hơn như LVIS zero-shot (trong đó model phải nhận diện các danh mục hiếm mà không có ví dụ huấn luyện) và đếm đối tượng (đo lường việc tất cả instance của một đối tượng có được phát hiện hay không), cho thấy khả năng tổng quát hóa mạnh hơn giữa các domain.
Bên cạnh những cải thiện về độ chính xác, SAM 3 còn hiệu quả về tính toán, xử lý một hình ảnh có hơn 100 đối tượng được phát hiện trong khoảng 30 mili giây trên GPU H200 và duy trì tốc độ gần thời gian thực khi theo dõi nhiều đối tượng trong video.
Các ứng dụng của Segment Anything Model 3#
Giờ đây khi đã hiểu rõ hơn về SAM 3, hãy cùng xem cách model đang được sử dụng trong các ứng dụng thực tế, từ suy luận nâng cao có hướng dẫn bằng văn bản đến nghiên cứu khoa học và các sản phẩm của chính Meta.
Xử lý truy vấn văn bản phức tạp bằng SAM 3 Agent#
SAM 3 cũng có thể được sử dụng như một công cụ bên trong một multimodal language model lớn hơn, được Meta gọi là SAM 3 Agent. Thay vì đưa cho SAM 3 một cụm từ ngắn như “voi”, agent có thể chia một câu hỏi phức tạp hơn thành các prompt nhỏ mà SAM 3 hiểu được.
Ví dụ, nếu người dùng hỏi, “Đối tượng nào trong ảnh được dùng để điều khiển và dẫn dắt ngựa?”, agent sẽ thử các cụm danh từ khác nhau, gửi chúng tới SAM 3 và kiểm tra mask nào hợp lý. Agent tiếp tục tinh chỉnh cho đến khi tìm được đối tượng phù hợp.
Ngay cả khi không được huấn luyện trên các dataset suy luận chuyên biệt, SAM 3 Agent vẫn hoạt động tốt trên các benchmark được thiết kế cho những truy vấn văn bản phức tạp, chẳng hạn như ReasonSeg và OmniLabel. Điều này cho thấy SAM 3 có thể hỗ trợ các hệ thống cần cả khả năng hiểu ngôn ngữ lẫn phân đoạn hình ảnh chi tiết.
Các ứng dụng khoa học và bảo tồn của SAM 3#
Đáng chú ý, SAM 3 đã được sử dụng trong các môi trường nghiên cứu nơi nhãn hình ảnh chi tiết đóng vai trò quan trọng. Meta đã hợp tác với Conservation X Labs và Osa Conservation để xây dựng SA-FARI, một dataset công khai về theo dõi động vật hoang dã với hơn 10.000 video từ bẫy ảnh.
Mọi động vật trong từng frame đều được gán nhãn bằng box và mask phân đoạn, một công việc sẽ cực kỳ tốn thời gian nếu annotate thủ công. Tương tự, trong nghiên cứu đại dương, SAM 3 đang được sử dụng cùng FathomNet và MBARI để tạo mask phân đoạn instance cho hình ảnh dưới nước và hỗ trợ các benchmark đánh giá mới.
Các dataset như vậy giúp các nhà khoa học phân tích footage video hiệu quả hơn và nghiên cứu những loài động vật cũng như môi trường sống thường khó theo dõi ở quy mô lớn. Các nhà nghiên cứu cũng có thể sử dụng những tài nguyên này để xây dựng model riêng cho việc nhận diện loài, phân tích hành vi và theo dõi sinh thái tự động.
Cách Meta triển khai SAM 3 trên các sản phẩm của mình#
Bên cạnh các ứng dụng nghiên cứu, SAM 3 cũng đang hỗ trợ những tính năng và use case mới trên các sản phẩm dành cho người dùng của Meta. Dưới đây là một số cách model đang được tích hợp:
- Chỉnh sửa trên Instagram: Creator có thể áp dụng hiệu ứng cho một người hoặc đối tượng cụ thể trong video mà không cần thao tác thủ công trên từng frame.
- Ứng dụng Meta AI và meta.ai trên web: SAM 3 hỗ trợ các công cụ mới để chỉnh sửa, nâng cao và remix hình ảnh cũng như video.
- Tính năng “View in Room” của Facebook Marketplace: SAM 3 hoạt động cùng SAM 3D để cho phép người dùng xem trước đồ nội thất hoặc đồ trang trí trong nhà bằng một bức ảnh duy nhất.
- Kính nghiên cứu Aria Gen 2: Segment Anything Model 3 giúp phân đoạn và theo dõi bàn tay cũng như các đối tượng từ góc nhìn người thứ nhất, hỗ trợ nghiên cứu về AR (Thực tế tăng cường), robot và AI theo ngữ cảnh.
Những điểm chính#
SAM 3 là một bước tiến đáng chú ý đối với lĩnh vực phân đoạn. Model giới thiệu phân đoạn khái niệm, prompt văn bản với từ vựng mở và khả năng theo dõi được cải thiện. Với hiệu năng mạnh hơn rõ rệt trên cả hình ảnh và video, cùng sự bổ sung của SAM 3D, bộ model mở ra những khả năng mới cho vision AI, công cụ sáng tạo, nghiên cứu khoa học và các sản phẩm thực tế.
Tham gia cộng đồng của chúng tôi và khám phá repository GitHub của chúng tôi để tìm hiểu thêm về AI. Nếu bạn muốn xây dựng dự án vision AI của riêng mình, hãy xem các lựa chọn cấp phép của chúng tôi. Tìm hiểu thêm về các ứng dụng như AI trong chăm sóc sức khỏe và Vision AI trong bán lẻ trên các trang giải pháp của chúng tôi.









