YOLO Vision 2026:
Quay lại Bảng thuật ngữ Ultralytics

Diffusion Policies

Khám phá cách Diffusion Policies định hình robot hiện đại. Tìm hiểu cách chúng mô hình hóa các hành động thông qua khử nhiễu và tích hợp với Ultralytics YOLO26 để đạt được khả năng nhận diện thông minh.

Diffusion Policies đại diện cho một sự thay đổi mô hình trong roboticsmachine learning, trong đó chính sách thị giác-vận động của một AI agent được mô hình hóa như một quá trình khuếch tán khử nhiễu có điều kiện. Theo truyền thống, behavior cloning—một hình thức của imitation learning—dựa vào hồi quy trực tiếp để dự đoán một hành động tất định đơn lẻ từ đầu vào cảm giác. Mặc dù hoạt động hiệu quả cho các tác vụ đơn giản, hồi quy trực tiếp thường thất bại khi tồn tại nhiều hành động hợp lệ, dẫn đến các chuyển động trung bình không ổn định hoặc không an toàn. Các chính sách khuếch tán giải quyết vấn đề này bằng cách đóng khung việc tạo hành động như một tác vụ tinh chỉnh chuỗi. Bắt đầu từ tiếng ồn ngẫu nhiên tinh khiết, thuật toán lặp đi lặp lại khử nhiễu tín hiệu—được điều kiện hóa dựa trên các quan sát cảm giác như hình ảnh hoặc dữ liệu trạng thái không gian—để tạo ra các chuỗi hành động có độ chính xác cao, mạnh mẽ và đa phương thức.

Cách hoạt động của Diffusion Policies#

Cơ chế cốt lõi dựa trên toán học được tìm thấy trong generative modeling, thích ứng với các kỹ thuật ban đầu được phát triển để tổng hợp hình ảnh độ trung thực cao trong original visuomotor diffusion policy paper. Trong giai đoạn huấn luyện, được gọi là quá trình thuận, một lượng nhỏ tiếng nhiễu được thêm vào dần dần cho các quỹ đạo hành động chuyên gia tối ưu. Một neural network sau đó được huấn luyện để dự đoán và đảo ngược tiếng ồn này dựa trên bối cảnh quan sát cho trước.

Trong quá trình suy luận, khi robot tương tác với môi trường của nó, nó quan sát môi trường xung quanh, khởi tạo một chuỗi hành động ngẫu nhiên và khử nhiễu nó bằng cách sử dụng Langevin dynamics ngẫu nhiên. Việc tối ưu hóa lặp đi lặp lại này mang lại các lệnh điều khiển động cơ mịn màng, chi tiết có khả năng xử lý các không gian hành động phức tạp, nhiều chiều.

Các ứng dụng trong thực tế#

Bằng cách biểu diễn chính xác các phân phối phức tạp mà không bị mode collapse, các chính sách khuếch tán đang tích cực định hình lại artificial intelligence vật lý hiện đại.

  • Robotic Manipulation: Trong các thiết lập công nghiệp, các cánh tay robot sử dụng các chính sách này cho các tác vụ khéo léo, giàu tính tiếp xúc như nắm bắt các vật thể có hình dạng bất thường, lắp ráp các thiết bị điện tử phức tạp hoặc thực hiện các chuyển động đổ chất lỏng trôi chảy.
  • Autonomous Navigation: Các hệ thống tự lái và máy drone kết hợp depth estimation với các chính sách khuếch tán để lên kế hoạch cho các quỹ đạo an toàn, liên tục qua các môi trường động, thích ứng uyển chuyển với các chướng ngại vật bất ngờ mà nếu không sẽ làm rối loạn các mô hình reinforcement learning tiêu chuẩn.

Phân biệt các thuật ngữ chính#

Để làm rõ chức năng cụ thể của diffusion policies, việc phân biệt chúng với các kiến trúc tạo sinh có liên quan chặt chẽ là rất hữu ích:

  • Diffusion Policies vs. Diffusion Models: Diffusion Models nói chung chỉ kiến trúc tạo sinh cơ sở được sử dụng để tạo dữ liệu tĩnh như tổng hợp văn bản thành hình ảnh. Diffusion Policies áp dụng cơ chế cụ thể này để dự đoán các lệnh điều khiển động cơ chuỗi thời gian, liên tục cho các robot hoạt động.
  • Diffusion Policies vs. Diffusion Forcing: Diffusion Forcing là một framework tạo chuỗi tổng quát huấn luyện causal transformers bằng cách sử dụng các mức độ nhiễu khác nhau cho mỗi token. Mặc dù có liên quan, diffusion forcing tập trung mạnh vào dự đoán tự hồi quy, trong khi diffusion policies biểu thị nghiêm ngặt chiến lược học bắt chước cho điều khiển thị giác-vận động.

Những tiến bộ gần đây trong học chính sách#

Nghiên cứu từ các tổ chức hàng đầu, bao gồm OpenAI research initiativesGoogle DeepMind robotics, tiếp tục đẩy mạnh ranh giới của những gì các thuật toán này có thể đạt được. Đáng chú ý, 3D Diffusion Policy (DP3), published on arXiv in 2024, đã giới thiệu một bước đột phá bằng cách điều kiện hóa các chính sách trên các 3D point cloud representations gọn nhẹ thay vì các hình ảnh 2D đơn giản. Điều này cải thiện đáng kể nhận thức không gian của robot đồng thời đòi hỏi ít lượt biểu diễn từ chuyên gia hơn đáng kể. Các đổi mới tiếp theo như D3P: Dynamic Denoising Diffusion Policy đã bắt đầu giải quyết tốc độ suy luận chậm của khuếch tán tiêu chuẩn bằng cách tự động bỏ qua các bước khử nhiễu cho các tác vụ thông thường, mở khóa khả năng phản hồi theo thời gian thực.

Triển khai thực tế với Computer Vision#

Trước khi một diffusion policy có thể tạo ra một hành động, nó yêu cầu một sự hiểu biết rõ ràng, có cấu trúc về môi trường xung quanh. Các kỹ sư thường kết hợp các mô hình object detection mạnh mẽ với các thuật toán policy để tạo thành một computer vision pipeline hoàn chỉnh. Ví dụ, một mô hình nhận thức nhanh như Ultralytics YOLO26 có thể cô lập các đối tượng mục tiêu trong thời gian thực, đưa tọa độ không gian vào một diffusion policy dựa trên PyTorch library.

import torch
from ultralytics import YOLO

# Load the Ultralytics YOLO26 Nano model for high-speed robotic perception
model = YOLO("yolo26n.pt")

# Predict bounding boxes on the robot's active camera feed
results = model.predict("robot_camera_feed.jpg")

# Condition the policy by extracting the bounding box center coordinate
if len(results[0].boxes) > 0:
    box = results[0].boxes[0].xyxy.squeeze()
    center_x = (box[0] + box[2]) / 2.0
    center_y = (box[1] + box[3]) / 2.0

    # Create a spatial observation tensor to condition the PyTorch Diffusion Policy.
    # This directly guides the denoising process to generate accurate motor actions.
    observation_state = torch.tensor([center_x, center_y])
    print(f"Conditioning action trajectory on object center: {observation_state}")

Để đơn giản hóa quy trình này, các nhà phát triển có thể sử dụng Ultralytics Platform để tận dụng các auto-annotation tools nhanh chóng cho các tập dữ liệu tùy chỉnh. Sự hỗ trợ toàn diện này giúp đẩy nhanh quá trình model deployment từ nguồn cấp dữ liệu camera thô thành trí tuệ robot có thể hành động.

Explore solutions

Real-time AI that works with your team

Thị giác máy tính trong lĩnh vực robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong y tế

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Thị giác máy tính trong ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Thị giác máy tính trong nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong lĩnh vực robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong y tế

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Thị giác máy tính trong ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Thị giác máy tính trong nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong lĩnh vực robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong y tế

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Thị giác máy tính trong ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Thị giác máy tính trong nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning