YOLO Vision 2026:
Quay lại Bảng thuật ngữ Ultralytics

Visual Prompting

Khám phá visual prompting để hướng dẫn các mô hình AI bằng điểm và hộp. Tìm hiểu cách Ultralytics YOLO và SAM cho phép phân đoạn chính xác và chú thích dữ liệu nhanh hơn.

Visual prompting là một kỹ thuật mới nổi trong computer vision, nơi người dùng cung cấp các gợi ý về không gian hoặc trực quan—như điểm, bounding box, hoặc đường nét nguệch ngoạc—để hướng sự tập trung của mô hình AI vào các đối tượng hoặc vùng cụ thể trong một hình ảnh. Không giống như prompt engineering truyền thống vốn chủ yếu dựa trên mô tả văn bản, visual prompting cho phép tương tác trực quan và chính xác hơn với hệ thống Artificial Intelligence (AI). Phương pháp này tận dụng khả năng của các foundation models hiện đại để thực hiện các tác vụ như segmentation và detection mà không cần huấn luyện lại chuyên sâu hoặc các tập dữ liệu gán nhãn lớn. Bằng cách "chỉ" hiệu quả vào những gì quan trọng, người dùng có thể điều chỉnh các mô hình đa dụng sang các tác vụ mới ngay lập tức, thu hẹp khoảng cách giữa ý định của con người và nhận thức của máy móc.

Các cơ chế của Visual Prompting#

Về bản chất, visual prompting hoạt động bằng cách đưa thông tin không gian trực tiếp vào pipeline xử lý của mô hình. Khi người dùng nhấp vào một đối tượng hoặc vẽ một hộp, các đầu vào này được chuyển đổi thành các embedding dựa trên tọa độ mà mạng neural tích hợp với các đặc trưng của hình ảnh. Quá trình này đóng vai trò cốt lõi đối với các kiến trúc tương tác như Segment Anything Model (SAM), nơi mô hình dự đoán mặt nạ dựa trên các prompt hình học.

Sự linh hoạt của visual prompting cho phép nhiều loại hình tương tác:

  • Point Prompts: Người dùng nhấp vào một pixel cụ thể để chỉ định đối tượng quan tâm. Sau đó, model sẽ mở rộng vùng chọn này đến toàn bộ biên của đối tượng.
  • Box Prompts: Vẽ một bounding box cung cấp khả năng định vị thô, ra hiệu cho mô hình segment hoặc phân loại mọi thứ có trong khu vực đó.
  • Scribble Prompts: Các nét vẽ tự do trên một đối tượng có thể giúp làm rõ các cảnh phức tạp nơi các đối tượng chồng lấp hoặc có kết cấu tương tự nhau.

Nghiên cứu gần đây được trình bày tại CVPR 2024 làm nổi bật cách visual prompting giảm đáng kể thời gian cần thiết cho data annotation, vì những người gán nhãn con người có thể chỉnh sửa các dự đoán của mô hình trong thời gian thực bằng các cú nhấp chuột đơn giản thay vì vẽ tay các đa giác.

Visual Prompting so với Text Prompting#

Mặc dù cả hai kỹ thuật đều nhằm mục đích hướng dẫn hành vi của mô hình, điều quan trọng là phải phân biệt visual prompting với các phương pháp dựa trên văn bản. Việc tạo Text-to-image hoặc zero-shot detection dựa vào natural language processing (NLP) để diễn giải các mô tả ngữ nghĩa (ví dụ: "tìm chiếc xe màu đỏ"). Tuy nhiên, ngôn ngữ có thể mơ hồ hoặc không đủ để mô tả các vị trí không gian chính xác hoặc các hình dạng trừu tượng.

Visual prompting giải quyết sự mơ hồ này bằng cách neo hướng dẫn vào chính không gian điểm ảnh. Ví dụ, trong medical image analysis, một bác sĩ X quang nhấp vào một nốt mờ đáng ngờ sẽ chính xác hơn nhiều so với việc cố gắng mô tả tọa độ chính xác và hình dạng bất thường của nó qua văn bản. Thường thì các workflow mạnh mẽ nhất kết hợp cả hai phương pháp—sử dụng văn bản để lọc ngữ nghĩa và visual prompts để đạt độ chính xác về không gian—một khái niệm được gọi là multi-modal learning.

Các ứng dụng trong thực tế#

Khả năng thích ứng của visual prompting đã dẫn đến việc áp dụng nhanh chóng trong nhiều ngành công nghiệp đa dạng:

  • Interactive Medical Diagnostics: Các bác sĩ sử dụng các công cụ visual prompting để cô lập các khối u hoặc cơ quan trong ảnh quét MRI. Chỉ bằng cách nhấp vào một vùng quan tâm, họ có thể ngay lập tức tạo ra các phép đo thể tích 3D, hỗ trợ việc tumor detection chính xác và lập kế hoạch phẫu thuật.
  • Smart Photo Editing: Trong phần mềm người dùng như Adobe Photoshop hoặc các ứng dụng di động, visual prompting cung cấp năng lượng cho các công cụ "magic select". Người dùng có thể chạm vào một người hoặc đối tượng để xóa nền hoặc áp dụng các bộ lọc có mục tiêu, tận dụng các công nghệ instance segmentation bên dưới mà không cần kỹ năng tạo mặt nạ thủ công.
  • Robotic Manipulation: Trong AI in Robotics, robot có thể được hướng dẫn để nhặt các món đồ cụ thể thông qua giao diện trực quan. Người vận hành nhấp vào một đối tượng trong nguồn cấp dữ liệu camera của robot, cung cấp một visual prompt mà robot chuyển đổi thành tọa độ gắp, tạo điều kiện thuận lợi cho tự động hóa human-in-the-loop trong các nhà kho.

Triển khai với Ultralytics#

Hệ sinh thái Ultralytics hỗ trợ các quy trình visual prompting, đặc biệt thông qua các model như FastSAM và SAM. Các model này cho phép các nhà phát triển chuyển tọa độ điểm hoặc khung hình theo chương trình để truy xuất các mask phân đoạn.

Ví dụ sau đây minh họa cách sử dụng gói ultralytics để áp dụng point prompt vào một hình ảnh, hướng dẫn mô hình segment đối tượng nằm ở các tọa độ cụ thể.

from ultralytics import SAM

# Load the Segment Anything Model (SAM)
model = SAM("sam2.1_b.pt")

# Apply a visual point prompt to the image
# The 'points' argument accepts [x, y] coordinates
# labels: 1 indicates a foreground point (include), 0 indicates background
results = model("https://ultralytics.com/images/bus.jpg", points=[[300, 350]], labels=[1])

# Display the segmented result
results[0].show()

Thúc đẩy sự linh hoạt của Model#

Visual prompting đại diện cho sự dịch chuyển hướng tới computer vision "có thể nhắc nhở" (promptable), nơi các mô hình không còn là các "hộp đen" tĩnh mà là các công cụ tương tác. Khả năng này rất cần thiết cho các vòng lặp active learning, nơi các mô hình cải thiện nhanh chóng bằng cách kết hợp phản hồi của người dùng.

Đối với các nhà phát triển đang tìm cách tích hợp các khả năng này vào môi trường production, Ultralytics Platform cung cấp các công cụ để quản lý datasets và deploy các mô hình có thể xử lý các đầu vào động. Khi nghiên cứu tiến1 triển, chúng ta mong đợi sẽ thấy sự tích hợp chặt chẽ hơn nữa giữa visual prompts và large language models (LLMs), cho phép các hệ thống có thể lý luận về các đầu vào trực quan với sự trôi chảy tương tự như cách chúng xử lý văn bản hiện nay.

Explore solutions

Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning