Data Lake
Khám phá cách data lake làm nền tảng cho AI và ML. Tìm hiểu cách khai thác dữ liệu thô để training Ultralytics YOLO26 và tinh gọn workflow computer vision.
Hồ dữ liệu là một kho lưu trữ tập trung chứa một lượng lớn dữ liệu thô ở định dạng gốc cho đến khi cần sử dụng. Không giống các hệ thống lưu trữ truyền thống yêu cầu dữ liệu phải được cấu trúc trước khi nhập, hồ dữ liệu tiếp nhận dữ liệu "nguyên trạng", bao gồm dữ liệu có cấu trúc (hàng và cột), dữ liệu bán cấu trúc (CSV, log, XML, JSON), dữ liệu phi cấu trúc (email, tài liệu, PDF) và dữ liệu nhị phân (hình ảnh, âm thanh, video). Tính linh hoạt về kiến trúc này khiến hồ dữ liệu trở thành nền tảng của các chiến lược Dữ liệu lớn hiện đại, đặc biệt đối với các tổ chức ứng dụng Trí tuệ nhân tạo (AI) và Học máy (ML). Bằng cách tách biệt việc thu thập dữ liệu khỏi việc sử dụng dữ liệu, các tổ chức có thể lưu trữ những kho thông tin khổng lồ với chi phí tương đối thấp và xác định các câu hỏi phân tích cụ thể sau.
Vai trò của hồ dữ liệu trong AI và Học máy#
Trong bối cảnh phát triển AI, giá trị cốt lõi của hồ dữ liệu nằm ở khả năng hỗ trợ các quy trình Học sâu (DL). Các mạng neural tiên tiến cần dữ liệu huấn luyện đa dạng và có khối lượng lớn để đạt độ chính xác cao. Hồ dữ liệu đóng vai trò là khu vực tập kết, nơi các tài sản dữ liệu thô—chẳng hạn như hàng triệu hình ảnh độ phân giải cao cho Thị giác máy tính (CV) hoặc hàng nghìn giờ âm thanh cho Nhận dạng giọng nói—được lưu trữ trước khi xử lý.
Các nhà khoa học dữ liệu sử dụng phương pháp "schema-on-read" trong các hồ dữ liệu. Điều này có nghĩa là cấu trúc chỉ được áp dụng cho dữ liệu khi dữ liệu được đọc để xử lý, thay vì khi được ghi vào bộ nhớ. Cách tiếp cận này mang lại tính linh hoạt rất lớn; cùng một tập dữ liệu thô có thể được xử lý theo nhiều cách cho các tác vụ mô hình hóa dự đoán khác nhau mà không làm thay đổi nguồn dữ liệu ban đầu. Ngoài ra, các hồ dữ liệu mạnh mẽ thường tích hợp với các dịch vụ điện toán đám mây như Amazon S3 hoặc Azure Blob Storage, cho phép xử lý song song có khả năng mở rộng cần thiết để huấn luyện các model lớn như YOLO26.
Hồ dữ liệu và kho dữ liệu#
Mặc dù thường bị nhầm lẫn, hồ dữ liệu khác biệt với kho dữ liệu. Kho dữ liệu lưu trữ dữ liệu trong các bảng có cấu trúc và được tối ưu hóa cho các truy vấn SQL nhanh cũng như báo cáo business intelligence. Kho dữ liệu sử dụng phương pháp "schema-on-write", nghĩa là dữ liệu phải được làm sạch và chuyển đổi thông qua quy trình ETL (Trích xuất, Chuyển đổi, Nạp) trước khi được đưa vào hệ thống.
Ngược lại, hồ dữ liệu được tối ưu hóa cho khối lượng và tính đa dạng của dữ liệu. Hồ dữ liệu hỗ trợ học không giám sát và phân tích khám phá, trong đó mục tiêu có thể chưa được xác định. Ví dụ, kho dữ liệu có thể cho biết đã bán bao nhiêu sản phẩm trong tháng trước, trong khi hồ dữ liệu lưu giữ các log cảm xúc khách hàng thô và dữ liệu hình ảnh giúp model AI hiểu được tại sao những sản phẩm đó được bán.
Các ứng dụng trong thực tế#
Hồ dữ liệu đóng vai trò thiết yếu trong nhiều ngành đang thúc đẩy các giới hạn của tự động hóa:
- Xe tự hành: việc phát triển công nghệ tự lái đòi hỏi xử lý petabyte dữ liệu cảm biến. Xe tự hành tạo ra các luồng liên tục gồm đám mây điểm LiDAR, tín hiệu radar và video độ phân giải cao. Hồ dữ liệu lưu trữ dữ liệu đo từ xa thô này, cho phép các kỹ sư phát lại các tình huống trong thế giới thực để huấn luyện các model Phát hiện đối tượng nhằm nhận diện người đi bộ và chướng ngại vật trong các điều kiện thời tiết khác nhau.
- Chẩn đoán y tế: Trong phân tích hình ảnh y tế hiện đại, các bệnh viện hợp nhất lịch sử bệnh nhân, dữ liệu gene và tệp hình ảnh (MRI, ảnh chụp CT) vào một hồ dữ liệu bảo mật. Sau đó, các nhà nghiên cứu có thể truy cập dữ liệu phi cấu trúc đã được ẩn danh này để huấn luyện các model phát hiện khối u hoặc dự đoán bệnh, thường sử dụng các kỹ thuật phân đoạn để tách các vùng quan tâm trong hình ảnh y tế.
Sử dụng hồ dữ liệu với Ultralytics#
Khi làm việc với Nền tảng Ultralytics, người dùng thường lấy các tập con dữ liệu thô từ hồ dữ liệu của tổ chức để tạo các dataset đã gắn nhãn phục vụ huấn luyện. Sau khi các hình ảnh thô được truy xuất và gắn nhãn, chúng có thể được sử dụng để huấn luyện các model tiên tiến nhất.
Ví dụ sau minh họa cách một developer có thể tải một dataset cục bộ (mô phỏng việc lấy dữ liệu từ hồ dữ liệu) để huấn luyện model YOLO26 cho một tác vụ phát hiện.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Train the model using a dataset configuration file
# In a production pipeline, this data might be streamed or downloaded
# from a cloud-based data lake prior to this step.
results = model.train(data="coco8.yaml", epochs=5, imgsz=640)
# Run inference on a new image to verify performance
predictions = model("https://ultralytics.com/images/bus.jpg")








