Ultralytics YOLO27:
Vision AI

Tìm hiểu về promptable concept segmentation

Khám phá promptable concept segmentation, cách phương pháp này khác với các phương pháp truyền thống và cách các model liên quan như YOLOE-26 hỗ trợ khả năng open-vocabulary.

ABAbirami Vina20 min read
Promptable concept segmentation của các vật thể trong hình ảnh

AI thị giác đang phát triển nhanh chóng và được sử dụng rộng rãi để phân tích hình ảnh và video trong môi trường thực tế. Ví dụ, các ứng dụng từ hệ thống quản lý giao thông đến phân tích bán lẻ đang được tích hợp với model thị giác máy tính.

Trong nhiều ứng dụng này, các model thị giác, chẳng hạn như model phát hiện đối tượng, được huấn luyện để nhận diện một tập hợp đối tượng định trước, bao gồm phương tiện, con người và thiết bị. Trong quá trình huấn luyện, các model này được cung cấp nhiều ví dụ đã gán nhãn để học cách mỗi đối tượng xuất hiện và cách phân biệt đối tượng đó với những đối tượng khác trong một cảnh.

Đối với các tác vụ phân đoạn, model tiến thêm một bước bằng cách tạo ra đường viền chính xác ở cấp pixel xung quanh các đối tượng này. Điều này giúp hệ thống hiểu chính xác vị trí của từng đối tượng trong một hình ảnh.

Cách này hoạt động hiệu quả miễn là hệ thống chỉ cần nhận diện những gì nó đã được huấn luyện. Tuy nhiên, trong môi trường thực tế, trường hợp đó hiếm khi xảy ra.

Các cảnh quan sát thường có tính động. Những đối tượng và khái niệm thị giác mới xuất hiện, điều kiện thay đổi, và người dùng thường muốn phân đoạn các đối tượng không có trong thiết lập huấn luyện ban đầu.

Những hạn chế này đặc biệt rõ ràng trong phân đoạn. Khi AI thị giác tiếp tục phát triển, nhu cầu về các model phân đoạn linh hoạt hơn, có thể thích ứng với những khái niệm mới mà không cần huấn luyện lại nhiều lần, ngày càng tăng. Đó là lý do phân đoạn khái niệm có thể điều khiển bằng prompt (PCS) nhận được nhiều sự chú ý.

Thay vì dựa vào một danh sách cố định các danh mục đối tượng, người dùng có thể mô tả những gì họ muốn phân đoạn bằng văn bản, prompt trực quan hoặc hình ảnh ví dụ. Sau đó, các model này có thể xác định và phân đoạn tất cả vùng khớp với khái niệm được mô tả, ngay cả khi khái niệm đó không được đưa vào rõ ràng trong quá trình huấn luyện.

Trong bài viết này, chúng ta sẽ tìm hiểu cách phân đoạn khái niệm có thể điều khiển bằng prompt hoạt động, điểm khác biệt so với các phương pháp truyền thống và những nơi công nghệ này đang được sử dụng hiện nay.

Phân đoạn khái niệm có thể điều khiển bằng prompt là gì?#

Trong hầu hết trường hợp, các model phân đoạn được huấn luyện để nhận diện một danh sách ngắn các loại đối tượng. Cách này hoạt động hiệu quả khi hệ thống AI thị giác chỉ cần phát hiện và phân đoạn một tập hợp đối tượng cụ thể.

Tuy nhiên, trong các ứng dụng thực tế, cảnh quan sát có tính động. Các đối tượng mới xuất hiện, yêu cầu tác vụ thay đổi và người dùng thường cần phân đoạn những khái niệm không có trong tập nhãn ban đầu. Để hỗ trợ các tình huống này, thông thường cần thu thập dữ liệu và annotation chất lượng cao mới rồi huấn luyện lại model, làm tăng chi phí và kéo dài thời gian triển khai.

Phân đoạn khái niệm có thể điều khiển bằng prompt giải quyết vấn đề này bằng cách cho phép người dùng chỉ cho model biết cần tìm gì, thay vì chọn từ một danh sách nhãn cố định. Người dùng mô tả đối tượng hoặc ý tưởng họ đang tìm kiếm, và model làm nổi bật tất cả vùng khớp trong hình ảnh. Điều này giúp kết nối ý định của người dùng với các pixel thực tế trong hình ảnh dễ dàng hơn nhiều.

Sử dụng prompt khái niệm để phân đoạn các đối tượng trong một hình ảnh

Hình 1. Minh họa việc sử dụng prompt khái niệm cho phân đoạn (Nguồn)

Điều hướng phân đoạn bằng các loại prompt khác nhau#

Các model hỗ trợ phân đoạn khái niệm có thể điều khiển bằng prompt rất linh hoạt vì chúng tiếp nhận nhiều loại đầu vào khác nhau. Nói cách khác, có nhiều cách để cho model biết cần tìm gì, chẳng hạn như mô tả văn bản, gợi ý trực quan hoặc hình ảnh ví dụ.

Hãy cùng xem kỹ hơn từng phương pháp:

  • Prompt văn bản: Các cụm từ ngắn như “xe buýt trường học” hoặc “vùng khối u” có thể được dùng để mô tả khái niệm cần phân đoạn. Model diễn giải ý nghĩa của các từ và xác định những vùng khớp.
  • Prompt trực quan: Các prompt này sử dụng điểm, hộp hoặc bản phác thảo sơ lược bên trong hình ảnh làm gợi ý. Những tín hiệu này định hướng vị trí cần tìm và giúp định hình đường biên cuối cùng.
  • Hình ảnh mẫu: Hình ảnh tham chiếu hoặc các crop nhỏ đại diện cho khái niệm cần quan tâm. Model tìm kiếm những vùng tương tự về mặt thị giác và phân đoạn chúng dựa trên diện mạo trực quan.

Sự khác biệt giữa PCS và phân đoạn truyền thống#

Trước khi đi sâu vào cách phân đoạn khái niệm có thể điều khiển bằng prompt hoạt động, trước hết hãy so sánh phương pháp này với các phương pháp phân đoạn đối tượng truyền thống khác nhau.

PCS cho phép xây dựng các model có từ vựng mở và được điều khiển bằng prompt. Model có thể xử lý những ý tưởng mới được mô tả thông qua prompt, trong khi phân đoạn truyền thống thì không. Có nhiều loại phương pháp phân đoạn truyền thống khác nhau, mỗi loại đều có các giả định và hạn chế riêng.

Dưới đây là một số loại phân đoạn truyền thống chính:

  • Phân đoạn ngữ nghĩa: Mỗi pixel trong hình ảnh được gán nhãn là một phần của danh mục như đường, tòa nhà hoặc người. Tất cả pixel có cùng nhãn được nhóm lại với nhau, vì vậy model không tách riêng từng instance đối tượng.
  • Phân đoạn instance: Model xác định và phân đoạn từng đối tượng riêng lẻ, vì vậy hai người hoặc hai chiếc xe được xem là các đối tượng riêng biệt.
  • Phân đoạn panoptic: Kỹ thuật này kết hợp phân đoạn ngữ nghĩa và phân đoạn instance để cung cấp góc nhìn đầy đủ về cảnh, bao quát cả các vùng nền và từng đối tượng riêng lẻ.

Tất cả các phương pháp này đều dựa vào một danh sách định trước các danh mục đối tượng. Chúng hoạt động tốt trong phạm vi đó, nhưng xử lý không hiệu quả các khái niệm nằm ngoài phạm vi. Khi cần phân đoạn một đối tượng cụ thể mới, thường phải bổ sung dữ liệu huấn luyện và fine-tune model.

PCS hướng tới việc thay đổi điều đó. Thay vì bị giới hạn trong các danh mục định trước, phương pháp này cho phép bạn mô tả những gì muốn phân đoạn trong hình ảnh ngay tại thời điểm inference.

Quá trình phát triển của các model PCS#

Tiếp theo, hãy cùng xem các model phân đoạn đã tiến hóa như thế nào để hướng tới phân đoạn khái niệm có thể điều khiển bằng prompt.

Một foundation model phổ biến đánh dấu bước chuyển trong phân đoạn là SAM, hay Segment Anything Model. Model này được giới thiệu vào năm 2023. Thay vì dựa vào các danh mục đối tượng định trước, SAM cho phép người dùng điều hướng quá trình phân đoạn bằng các prompt trực quan đơn giản như điểm hoặc bounding box.

Với SAM, người dùng không còn phải chọn nhãn. Họ chỉ cần chỉ ra vị trí của một đối tượng, và model sẽ tạo mask cho đối tượng đó. Điều này làm cho phân đoạn trở nên linh hoạt hơn, nhưng người dùng vẫn cần cho model biết vị trí cần tìm.

SAM 2, được phát hành vào năm 2024, phát triển dựa trên ý tưởng này bằng cách xử lý các cảnh phức tạp hơn và mở rộng phân đoạn có thể điều khiển bằng prompt sang video. Model cải thiện độ mạnh mẽ trong nhiều điều kiện ánh sáng, hình dạng đối tượng và chuyển động khác nhau, trong khi vẫn chủ yếu dựa vào prompt trực quan để điều hướng phân đoạn.

Model SAM 3 là bước tiến mới nhất trong quá trình phát triển này. Model được phát hành vào năm ngoái và là một model hợp nhất, kết hợp khả năng hiểu thị giác với định hướng ngôn ngữ, cho phép hoạt động nhất quán trên các tác vụ phân đoạn hình ảnh và video.

Với SAM 3, người dùng không bị giới hạn ở việc chỉ hoặc vẽ prompt. Thay vào đó, họ có thể mô tả những gì muốn phân đoạn bằng văn bản, và model sẽ tìm kiếm trong hình ảnh hoặc các frame video những vùng khớp với mô tả đó.

Phân đoạn được định hướng bởi các khái niệm thay vì các danh mục đối tượng cố định, hỗ trợ sử dụng từ vựng mở trong nhiều cảnh khác nhau và theo thời gian. Trên thực tế, SAM 3 hoạt động trên một không gian khái niệm lớn đã được học, dựa trên một ontology được xây dựng từ các nguồn như Wikidata và mở rộng thông qua dữ liệu huấn luyện quy mô lớn.

Dùng prompt cho SAM 3 để phân đoạn một hình ảnh đơn

Hình 2. Ví dụ về việc dùng prompt cho SAM 3 và phân đoạn một hình ảnh đơn (Nguồn)

So với các phiên bản trước vốn chủ yếu dựa vào prompt hình học, SAM 3 thể hiện một bước tiến hướng tới phân đoạn linh hoạt hơn, dựa trên khái niệm. Điều này giúp model phù hợp hơn với các ứng dụng thực tế, nơi đối tượng hoặc ý tưởng cần quan tâm có thể thay đổi và không phải lúc nào cũng được xác định trước.

Tìm hiểu cách phân đoạn thị giác có thể điều khiển bằng prompt hoạt động#

Vậy phân đoạn khái niệm có thể điều khiển bằng prompt hoạt động như thế nào? Phương pháp này dựa trên các model thị giác và model thị giác-ngôn ngữ lớn được pretrained, vốn được huấn luyện trên các bộ sưu tập khổng lồ gồm hình ảnh và trong nhiều trường hợp là văn bản đi kèm. Quá trình huấn luyện này giúp chúng học các mẫu thị giác tổng quát và ý nghĩa ngữ nghĩa.

Hầu hết model PCS sử dụng kiến trúc dựa trên Transformer, xử lý toàn bộ hình ảnh cùng lúc để hiểu mối quan hệ giữa các vùng khác nhau. Vision Transformer trích xuất các đặc trưng thị giác từ hình ảnh, trong khi text encoder chuyển đổi từ ngữ thành các biểu diễn số mà model có thể xử lý.

Trong quá trình huấn luyện, các model này có thể học từ nhiều loại supervision khác nhau, bao gồm mask ở cấp pixel xác định chính xác đường biên đối tượng, bounding box định vị tương đối các đối tượng và nhãn ở cấp hình ảnh mô tả những gì xuất hiện trong hình ảnh. Huấn luyện bằng nhiều loại dữ liệu đã gán nhãn giúp model nắm bắt cả chi tiết nhỏ và các khái niệm thị giác rộng hơn.

Tại thời điểm inference, tức khi model thực sự được sử dụng để đưa ra dự đoán, PCS tuân theo quy trình dựa trên prompt. Người dùng cung cấp chỉ dẫn thông qua mô tả văn bản, gợi ý trực quan như điểm hoặc hộp hay hình ảnh ví dụ. Model mã hóa cả prompt và hình ảnh thành một biểu diễn nội bộ dùng chung hoặc các embedding, rồi xác định những vùng phù hợp với khái niệm được mô tả.

Sau đó, mask decoder chuyển đổi biểu diễn dùng chung này thành các mask phân đoạn chính xác ở cấp pixel. Vì model liên kết các đặc trưng thị giác với ý nghĩa ngữ nghĩa, nó có thể phân đoạn những khái niệm mới ngay cả khi chúng không được đưa vào rõ ràng trong quá trình huấn luyện.

Ngoài ra, đầu ra thường có thể được tinh chỉnh bằng cách điều chỉnh prompt hoặc bổ sung chỉ dẫn, giúp model xử lý các cảnh phức tạp hoặc mơ hồ. Quy trình lặp này hỗ trợ tối ưu hóa thực tế trong quá trình triển khai.

Các model phân đoạn khái niệm có thể điều khiển bằng prompt thường được đánh giá dựa trên khả năng phân đoạn các khái niệm chưa từng thấy và mức độ hoạt động ổn định trên nhiều cảnh khác nhau. Các benchmark thường tập trung vào chất lượng mask, khả năng khái quát hóa và hiệu quả tính toán, phản ánh các yêu cầu triển khai trong thực tế.

Các trường hợp sử dụng PCS trong thực tế#

Tiếp theo, hãy xem phân đoạn khái niệm có thể điều khiển bằng prompt đang được sử dụng ở đâu và bắt đầu tạo ra tác động thực tế như thế nào.

Phân đoạn hình ảnh linh hoạt cho chẩn đoán hình ảnh y khoa#

Chẩn đoán hình ảnh y khoa bao gồm nhiều cấu trúc sinh học, bệnh lý và loại scan, trong khi các ca mới xuất hiện mỗi ngày. Các model phân đoạn truyền thống gặp khó khăn trong việc theo kịp sự đa dạng này.

PCS phù hợp tự nhiên với lĩnh vực này vì cho phép bác sĩ mô tả điều họ muốn tìm thay vì chọn từ một danh sách ngắn và cứng nhắc. Với các cụm từ văn bản hoặc prompt trực quan, PCS có thể được dùng để phân đoạn trực tiếp các cơ quan hoặc vùng đáng quan tâm mà không cần huấn luyện lại model cho từng tác vụ mới. Điều này giúp xử lý các nhu cầu lâm sàng đa dạng dễ dàng hơn, giảm nhu cầu vẽ mask thủ công và hoạt động trên nhiều loại hình ảnh.

Một ví dụ nổi bật là MedSAM-3, model điều chỉnh kiến trúc SAM 3 cho PCS trong chẩn đoán hình ảnh y khoa có thể điều khiển bằng văn bản. Model này có thể nhận prompt là các thuật ngữ giải phẫu và bệnh lý cụ thể, chẳng hạn như tên cơ quan như gan hoặc thận và các khái niệm liên quan đến tổn thương như khối u hoặc tổn thương. Khi nhận prompt, model trực tiếp phân đoạn vùng tương ứng trong hình ảnh y khoa.

MedSAM-3 cũng tích hợp các model ngôn ngữ lớn đa phương thức (MLLMs), có khả năng suy luận trên cả văn bản và hình ảnh. Các model này hoạt động trong thiết lập có agent tham gia vòng lặp, trong đó kết quả được tinh chỉnh lặp lại để cải thiện độ chính xác trong các ca khó hơn.

Pipeline MedSAM-3 cho phân đoạn khối u bằng prompt văn bản trong hình ảnh y khoa

Hình 3. Pipeline MedSAM-3 cho phân đoạn khối u bằng prompt văn bản trong hình ảnh y khoa (Nguồn)

MedSAM-3 hoạt động hiệu quả trên dữ liệu X-ray, MRI, CT, siêu âm và video, cho thấy PCS có thể hỗ trợ các workflow chẩn đoán hình ảnh y khoa linh hoạt và hiệu quả hơn trong môi trường lâm sàng thực tế.

Phân đoạn thích ứng cho phẫu thuật robot và tự động hóa#

Phẫu thuật robot dựa vào các hệ thống thị giác để theo dõi dụng cụ và hiểu các cảnh phẫu thuật thay đổi nhanh chóng. Dụng cụ di chuyển nhanh, ánh sáng thay đổi và các dụng cụ mới có thể xuất hiện bất cứ lúc nào, khiến việc duy trì hệ thống nhãn định trước trở nên khó khăn.

Với PCS, robot có thể theo dõi dụng cụ, điều khiển camera và bám sát các bước phẫu thuật theo thời gian thực. Điều này giảm công việc gán nhãn thủ công và giúp hệ thống dễ thích ứng với các quy trình khác nhau hơn. Bác sĩ phẫu thuật hoặc hệ thống tự động có thể sử dụng các prompt văn bản như “kẹp gắp”, “dao mổ” hoặc “dụng cụ camera” để chỉ ra đối tượng cần được phân đoạn trong hình ảnh.

Phân đoạn dụng cụ phẫu thuật trong quá trình phẫu thuật robot

Hình 4. Phân đoạn các dụng cụ phẫu thuật được sử dụng trong phẫu thuật robot (Nguồn)

Phân đoạn từ vựng mở với Ultralytics YOLOE-26#

Một model state-of-the-art thú vị khác liên quan đến phân đoạn khái niệm có thể điều khiển bằng prompt là Ultralytics YOLOE-26 của chúng tôi. Model này đưa khả năng phân đoạn từ vựng mở, được điều khiển bằng prompt vào họ model Ultralytics YOLO.

YOLOE-26 được xây dựng trên kiến trúc Ultralytics YOLO26 và hỗ trợ phân đoạn instance với từ vựng mở. YOLOE-26 cho phép người dùng điều hướng phân đoạn theo nhiều cách.

Model hỗ trợ prompt văn bản, trong đó các cụm từ ngắn gắn với ngữ cảnh thị giác có thể chỉ định đối tượng đích, cũng như prompt trực quan cung cấp thêm chỉ dẫn dựa trên các tín hiệu trong hình ảnh. Ngoài ra, YOLOE-26 có chế độ không cần prompt cho inference zero-shot, trong đó model phát hiện và phân đoạn các đối tượng từ một từ vựng tích hợp mà không yêu cầu prompt từ người dùng.

YOLOE-26 phù hợp với các ứng dụng như phân tích video, nhận thức cho robot và các hệ thống tại edge, nơi danh mục đối tượng có thể thay đổi nhưng độ trễ thấp và throughput ổn định vẫn là yếu tố thiết yếu. Model cũng đặc biệt hữu ích cho việc gán nhãn dữ liệu và tuyển chọn dataset, vì giúp đơn giản hóa workflow bằng cách tự động hóa một phần quy trình annotation.

Ưu và nhược điểm của phân đoạn khái niệm có thể điều khiển bằng prompt#

Dưới đây là một số lợi ích chính khi sử dụng phân đoạn khái niệm có thể điều khiển bằng prompt:

  • Lặp và tạo prototype nhanh hơn: Các tác vụ phân đoạn mới có thể được kiểm thử nhanh bằng cách thay đổi prompt thay vì xây dựng lại dataset hoặc huấn luyện lại model, giúp đẩy nhanh quá trình thử nghiệm và phát triển.
  • Khả năng thích ứng giữa các lĩnh vực: Cùng một model PCS thường có thể được áp dụng cho nhiều lĩnh vực khác nhau, chẳng hạn như chẩn đoán hình ảnh y khoa, robot hoặc phân tích video, với rất ít thay đổi trong workflow.
  • Tinh chỉnh tương tác: Người dùng có thể lặp lại việc điều chỉnh prompt hoặc bổ sung chỉ dẫn để cải thiện kết quả, giúp xử lý các cảnh mơ hồ hoặc trường hợp biên dễ dàng hơn mà không cần huấn luyện lại.

Mặc dù PCS có những ưu điểm rõ ràng, dưới đây là một số hạn chế cần cân nhắc:

  • Độ nhạy với prompt: Những thay đổi nhỏ trong cách viết hoặc cung cấp prompt có thể ảnh hưởng đến đầu ra. Prompt quá mơ hồ hoặc quá cụ thể có thể dẫn đến kết quả phân đoạn không đầy đủ hoặc không chính xác.
  • Hành vi kém dự đoán hơn: Vì model diễn giải prompt thay vì chọn từ các nhãn cố định, kết quả có thể biến thiên nhiều hơn giữa các cảnh và đầu vào, gây vấn đề cho những pipeline được kiểm soát chặt chẽ.
  • Diễn giải khái niệm mơ hồ: Một số khái niệm mang tính chủ quan hoặc được định nghĩa lỏng lẻo, có thể dẫn đến kết quả phân đoạn không nhất quán giữa những người dùng hoặc giữa các hình ảnh.
  • Độ tin cậy hạn chế với các đối tượng cực kỳ cụ thể: Các model dựa trên prompt thường kém tin cậy hơn đối với những tác vụ được định nghĩa hẹp và gắn với từng instance, chẳng hạn như phát hiện lỗi, trong đó cần xác định chính xác và nhất quán các đặc trưng tinh vi.

Lựa chọn giữa phân đoạn có thể điều khiển bằng prompt và phân đoạn truyền thống#

Khi tìm hiểu về phân đoạn có thể điều khiển bằng prompt, bạn có thể tự hỏi phương pháp này phù hợp nhất với những ứng dụng nào và khi nào một model thị giác máy tính truyền thống như Ultralytics YOLO26 sẽ phù hợp hơn với bài toán cần giải quyết. Phân đoạn có thể điều khiển bằng prompt hoạt động tốt với các đối tượng tổng quát, nhưng không phù hợp với các trường hợp sử dụng đòi hỏi kết quả rất chính xác và nhất quán.

Phát hiện lỗi là một ví dụ điển hình. Trong sản xuất, lỗi thường rất nhỏ và tinh vi, chẳng hạn như vết xước nhỏ, vết lõm, sai lệch hoặc bất thường trên bề mặt. Chúng cũng có thể thay đổi đáng kể tùy thuộc vào vật liệu, ánh sáng và điều kiện sản xuất.

Những vấn đề này khó mô tả bằng một prompt đơn giản và càng khó hơn đối với một model đa dụng nếu muốn phát hiện chúng một cách đáng tin cậy. Nhìn chung, các model dựa trên prompt có xu hướng bỏ sót lỗi hoặc tạo ra kết quả không ổn định, trong khi các model được huấn luyện riêng trên dữ liệu lỗi đáng tin cậy hơn nhiều đối với các hệ thống kiểm tra thực tế.

Những điểm chính#

Phân đoạn khái niệm có thể điều khiển bằng prompt giúp các hệ thống thị giác dễ thích ứng hơn với thế giới thực, nơi các đối tượng và ý tưởng mới liên tục xuất hiện. Thay vì bị giới hạn trong các nhãn cố định, người dùng chỉ cần mô tả những gì muốn phân đoạn và để model xử lý phần còn lại, giúp tiết kiệm thời gian và giảm công việc thủ công. Dù vẫn còn những hạn chế, PCS đã và đang thay đổi cách phân đoạn được sử dụng trong thực tế và nhiều khả năng sẽ trở thành một phần cốt lõi của các hệ thống thị giác trong tương lai.

Tìm hiểu thêm về AI bằng cách truy cập repository GitHub và tham gia cộng đồng của chúng tôi. Xem các trang giải pháp để tìm hiểu về AI trong robotthị giác máy tính trong sản xuất. Khám phá các tùy chọn cấp phép của chúng tôi để bắt đầu với AI thị giác ngay hôm nay!

Explore solutions

Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning