Rectified Flow
Rectified flow huấn luyện model sinh để chuyển nhiễu thành dữ liệu theo các đường thẳng, cần ít bước lấy mẫu hơn nhiều so với model diffusion.
Rectified Flow là kỹ thuật mô hình hóa tạo sinh tiên tiến, học cách ánh xạ phân phối nhiễu đơn giản, dễ lấy mẫu sang phân phối dữ liệu phức tạp bằng các quỹ đạo đường thẳng. Đây là giải pháp thay thế hiệu quả cao đang nổi lên so với các framework tạo sinh truyền thống. Rectified Flow hoạt động bằng cách giải phương trình vi phân thường (ODE) để chuyển các điểm dữ liệu trực tiếp từ nhiễu thuần sang ảnh, âm thanh hoặc video đích. Vì các đường dẫn này được huấn luyện để càng thẳng càng tốt, model cần ít bước hơn đáng kể để tạo đầu ra chất lượng cao, qua đó giảm mạnh chi phí tính toán trong quá trình suy luận.
Rectified Flow so với Model khuếch tán#
Cả hai kỹ thuật đều thuộc nhóm AI tạo sinh rộng hơn, nhưng Rectified Flow giải quyết một số điểm kém hiệu quả cốt lõi trong Model khuếch tán tiêu chuẩn. Model khuếch tán thường tạo một đường dẫn cong, nhiễu giữa phân phối nhiễu và dữ liệu cuối cùng, đòi hỏi hàng chục hoặc thậm chí hàng trăm bước khử nhiễu lặp đi lặp lại để tạo đầu ra rõ nét. Ngược lại, Rectified Flow tối ưu hóa rõ ràng các đường dẫn truyền tải để chúng trở thành đường thẳng. Quá trình "làm thẳng" này cho phép model thực hiện các bước lớn hơn nhiều mà không mất độ chính xác, giúp tạo đầu ra có độ trung thực cao chỉ sau vài vòng lặp.
Ứng dụng thực tế#
Hiệu quả và độ ổn định của Rectified Flow đã biến kỹ thuật này thành nền tảng của các pipeline thị giác máy tính và tạo nội dung đa phương tiện hiện đại.
- Tạo dữ liệu tổng hợp độ trung thực cao: Các tổ chức sử dụng model Rectified Flow để nhanh chóng tạo ra dataset thị giác máy tính đa dạng với quy mô lớn. Dữ liệu tổng hợp này có thể mô phỏng các trường hợp biên hiếm gặp, yếu tố quan trọng để huấn luyện kiến trúc phát hiện đối tượng vững chắc mà không phải chịu chi phí quá lớn cho việc thu thập dữ liệu thủ công.
- Hệ thống chuyển văn bản thành hình ảnh nâng cao: Các công cụ tạo ảnh production như Stable Diffusion 3 của Stability AI và FLUX của Black Forest Labs được xây dựng trên Transformer Rectified Flow. Các model này vận hành những công cụ tạo ảnh và tạo video nhanh chóng hướng đến người dùng phổ thông, trong đó độ trễ suy luận thấp đóng vai trò then chốt để mang lại trải nghiệm mượt mà.
Cải thiện quy trình Thị giác máy tính#
Trong thực tế, ảnh tổng hợp chất lượng cao do model Rectified Flow tạo ra thường được dùng để tiền huấn luyện hoặc tinh chỉnh các model thị giác ở bước tiếp theo. Ví dụ, nhà phát triển có thể tạo ảnh có chủ đích về lỗi sản xuất rồi dùng Ultralytics Platform để dễ dàng gán nhãn dữ liệu mới này trên cloud. Sau khi được gán nhãn, tập dữ liệu có thể được dùng để huấn luyện model Ultralytics YOLO26, phục vụ phát hiện đối tượng thời gian thực với độ chính xác cao.
Dưới đây là ví dụ ngắn gọn minh họa cách huấn luyện model Ultralytics YOLO26 trên dataset tùy chỉnh (có thể bao gồm dữ liệu tổng hợp được tạo bằng Rectified Flow) bằng package ultralytics:
from ultralytics import YOLO
# Tải model YOLO26 mới nhất, hiện đại nhất
model = YOLO("yolo26n.pt")
# Huấn luyện model trên tập dữ liệu kết hợp tổng hợp/thực tế
results = model.train(data="custom_synthetic_data.yaml", epochs=50, imgsz=640)
# Xuất model đã huấn luyện sang ONNX để triển khai nhanh
model.export(format="onnx")Bằng cách thu hẹp khoảng cách giữa các model tạo sinh hiệu quả và công cụ phân biệt mạnh mẽ như YOLO26, người thực hành machine learning có thể xây dựng hệ thống AI có khả năng chống chịu cao. Dù đánh giá chỉ số hiệu năng model hay xuất model sang thiết bị edge thông qua TensorRT, sự kết hợp giữa dữ liệu tổng hợp và công nghệ phát hiện tiên tiến nhất giúp tăng tốc các bước trong dự án CV, đảm bảo model vừa có độ chính xác cao vừa hoạt động cực nhanh.










