Observability
Khám phá tầm quan trọng của observability trong AI và ML. Tìm hiểu cách debug các hệ thống phức tạp, giám sát performance của Ultralytics YOLO26 và thu được insight chuyên sâu về model.
Khả năng quan sát đề cập đến năng lực tìm hiểu trạng thái bên trong của một hệ thống phức tạp chỉ dựa trên các đầu ra bên ngoài của hệ thống. Trong các lĩnh vực Trí tuệ nhân tạo (AI) và Machine Learning (ML) đang phát triển nhanh chóng, khả năng quan sát vượt xa việc kiểm tra trạng thái đơn giản để cung cấp thông tin chuyên sâu về lý do model hoạt động theo một cách nhất định. Khi các kiến trúc Deep Learning (DL) hiện đại—chẳng hạn như YOLO26 tiên tiến nhất—ngày càng trở nên phức tạp, chúng thường có thể hoạt động như những "hộp đen". Các công cụ observability tạo ra một cửa sổ minh bạch vào những hệ thống này, cho phép các team engineering gỡ lỗi các hành vi không mong đợi, truy vết nguyên nhân gốc rễ của lỗi và đảm bảo độ tin cậy trong môi trường production.
Khả năng quan sát và Monitoring#
Mặc dù thường được sử dụng thay thế cho nhau, khả năng quan sát và monitoring model phục vụ các mục đích riêng biệt nhưng bổ trợ cho nhau trong vòng đời MLOps.
- Monitoring Model mang tính phản ứng và tập trung vào các "unknown đã biết". Hoạt động này theo dõi các metric được xác định trước, chẳng hạn như độ trễ inference, mức sử dụng CPU hoặc tỷ lệ lỗi, so với các ngưỡng đã thiết lập. Monitoring trả lời câu hỏi: "Hệ thống có đang hoạt động ổn định không?"
- Khả năng quan sát mang tính chủ động và xử lý các "unknown chưa biết". Khả năng này cung cấp dữ liệu chi tiết—log, trace và các event có cardinality cao—cần thiết để điều tra những vấn đề mới phát sinh chưa được dự đoán trong quá trình chuẩn bị training data. Như được mô tả trong Sách Google SRE, một hệ thống có khả năng quan sát cho phép bạn tìm hiểu các hành vi mới mà không cần triển khai code mới. Nó trả lời câu hỏi: "Tại sao hệ thống lại hoạt động như vậy?"
Ba trụ cột của khả năng quan sát#
Để đạt được khả năng quan sát thực sự trong các pipeline Thị giác máy tính (CV), hệ thống thường dựa vào ba loại dữ liệu telemetry chính:
-
Log: Các bản ghi bất biến, có timestamp về những event riêng lẻ. Trong một pipeline detection, log có thể ghi lại độ phân giải của ảnh đầu vào hoặc cấu hình tuning hyperparameter cụ thể được sử dụng trong một lần chạy. Structured logging, thường ở định dạng JSON, cho phép thực hiện các truy vấn và phân tích phức tạp.
-
Metric: Dữ liệu số được tổng hợp và đo lường theo thời gian, chẳng hạn như precision trung bình, mức tiêu thụ bộ nhớ hoặc mức sử dụng GPU. Các công cụ như Prometheus và Grafana là những công cụ tiêu chuẩn để lưu trữ dữ liệu chuỗi thời gian này nhằm trực quan hóa xu hướng.
-
Trace: Tracing theo dõi vòng đời của một request khi request đi qua nhiều microservice khác nhau. Đối với các ứng dụng AI phân tán, các tiêu chuẩn như OpenTelemetry giúp lập bản đồ đường đi của request, làm nổi bật các điểm nghẽn trong inference engine hoặc độ trễ mạng. Các công cụ chuyên dụng như Jaeger giúp trực quan hóa những giao dịch phân tán này.
Triển khai khả năng quan sát trong Python#
Bạn có thể tăng cường khả năng quan sát trong các training pipeline bằng cách sử dụng callback để ghi log các trạng thái nội bộ cụ thể. Ví dụ sau minh họa cách thêm một callback tùy chỉnh vào phiên training YOLO26 để monitoring các metric hiệu năng theo thời gian thực.
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Define a custom callback for observability
def on_train_epoch_end(trainer):
# Access and print specific metrics at the end of each epoch
map50 = trainer.metrics.get("metrics/mAP50(B)", 0)
print(f"Observability Log - Epoch {trainer.epoch + 1}: mAP50 is {map50:.4f}")
# Register the callback and start training
model.add_callback("on_train_epoch_end", on_train_epoch_end)
model.train(data="coco8.yaml", epochs=3)Các ứng dụng trong thực tế#
Khả năng quan sát đóng vai trò quan trọng khi triển khai các model hiệu năng cao trong những môi trường động, nơi test data có thể không hoàn toàn khớp với các điều kiện thực tế.
- Phương tiện tự hành: Trong quá trình phát triển phương tiện tự hành, khả năng quan sát cho phép các kỹ sư tái dựng chính xác trạng thái của hệ thống trong một sự kiện disengagement. Bằng cách đối chiếu các đầu ra object detection với log cảm biến và lệnh điều khiển, các team có thể xác định lỗi phanh là do nhiễu cảm biến, lỗi dự đoán của model hay lỗi logic trong module lập kế hoạch.
- Chẩn đoán y tế: Trong lĩnh vực AI trong chăm sóc sức khỏe, việc đảm bảo hiệu năng nhất quán là yếu tố thiết yếu đối với an toàn của bệnh nhân. Các công cụ observability có thể phát hiện data drift nếu hiệu năng của model suy giảm khi được áp dụng cho hình ảnh từ một loại máy quét MRI mới. Trace có thể cho thấy vấn đề bắt nguồn từ thay đổi trong tiền xử lý dữ liệu hình ảnh hay sự dịch chuyển trong phân phối đầu vào, qua đó cho phép khắc phục nhanh chóng mà không ảnh hưởng đến an toàn AI.
Tích hợp với các công cụ hiện đại#
Các workflow hiện đại thường tích hợp khả năng quan sát trực tiếp vào nền tảng training. Người dùng Ultralytics Platform được hưởng lợi từ các tính năng trực quan hóa tích hợp sẵn cho đường cong loss, hiệu năng hệ thống và phân tích dataset. Ngoài ra, các tích hợp tiêu chuẩn với những công cụ như TensorBoard và MLflow cho phép các data scientist duy trì việc theo dõi experiment nghiêm ngặt và khả năng quan sát trong toàn bộ vòng đời của model.









