Foundation Model
Khám phá sức mạnh của foundation model trong AI. Tìm hiểu cách điều chỉnh các model quy mô lớn như Ultralytics YOLO26 cho các tác vụ tùy chỉnh bằng Ultralytics Platform.
Mô hình nền tảng đại diện cho một bước chuyển mô hình đáng kể trong lĩnh vực Trí tuệ nhân tạo (AI). Đây là một model machine learning quy mô lớn được huấn luyện trên một lượng dữ liệu khổng lồ—thường bao gồm hàng tỷ tham số—có thể được điều chỉnh cho nhiều tác vụ hạ nguồn. Không giống các model Học máy (ML) truyền thống, vốn thường được xây dựng cho một mục đích cụ thể, duy nhất như phân loại một loại hoa cụ thể, mô hình nền tảng học các mẫu, cấu trúc và mối quan hệ tổng quát trong giai đoạn tiền huấn luyện tiêu tốn nhiều tài nguyên. Cơ sở tri thức rộng này cho phép các nhà phát triển áp dụng model vào những bài toán mới thông qua học chuyển giao, từ đó giảm đáng kể thời gian và lượng dữ liệu cần thiết để đạt được các kết quả tiên tiến nhất.
Cơ chế cốt lõi: Tiền huấn luyện và thích nghi#
Sức mạnh của mô hình nền tảng nằm ở quy trình phát triển gồm hai giai đoạn: tiền huấn luyện và tinh chỉnh. Trong quá trình tiền huấn luyện, model được cung cấp các tập dữ liệu khổng lồ, chẳng hạn như những phần lớn của Internet, các thư viện hình ảnh đa dạng hoặc những kho mã nguồn quy mô lớn. Giai đoạn này thường sử dụng học tự giám sát, một kỹ thuật trong đó model tự tạo nhãn từ chính cấu trúc dữ liệu, loại bỏ nút thắt cổ chai của việc gán nhãn dữ liệu thủ công. Ví dụ, một model ngôn ngữ có thể học cách dự đoán từ tiếp theo trong câu, trong khi một model thị giác học cách hiểu các cạnh, kết cấu và tính thường hằng của đối tượng.
Sau khi được tiền huấn luyện, model đóng vai trò là một điểm khởi đầu linh hoạt. Thông qua một quy trình gọi là tinh chỉnh, các nhà phát triển có thể điều chỉnh các trọng số của model trên một tập dữ liệu nhỏ hơn, dành riêng cho từng lĩnh vực. Khả năng này đóng vai trò trung tâm trong việc dân chủ hóa AI, vì cho phép các tổ chức có tài nguyên tính toán hạn chế tận dụng những kiến trúc mạnh mẽ. Các quy trình làm việc hiện đại thường sử dụng những công cụ như Ultralytics Platform để đơn giản hóa quy trình thích nghi này, cho phép huấn luyện hiệu quả trên các tập dữ liệu tùy chỉnh mà không cần xây dựng mạng neural từ đầu.
Các ứng dụng trong thực tế#
Mô hình nền tảng là nền móng cho các đổi mới trong nhiều ngành công nghiệp. Khả năng khái quát hóa của chúng khiến chúng phù hợp với các tác vụ từ xử lý ngôn ngữ tự nhiên đến thị giác máy tính nâng cao.
- Thị giác máy tính trong chăm sóc sức khỏe: Các mô hình nền tảng thị giác chuyên biệt có thể được tinh chỉnh để hỗ trợ phân tích hình ảnh y tế. Một model ban đầu được huấn luyện trên các hình ảnh tổng quát có thể được điều chỉnh để phát hiện khối u trong ảnh chụp MRI hoặc xác định gãy xương dạng buckle trên ảnh X-quang. Ứng dụng này cho thấy cách khả năng hiểu hình ảnh tổng quát được chuyển hóa thành các công cụ chẩn đoán có thể cứu sống con người.
- Tự động hóa công nghiệp: Trong lĩnh vực sản xuất, các model thị giác như Ultralytics YOLO26 hoạt động như những kiến trúc nền tảng cho việc phát hiện đối tượng. Các nhà máy sử dụng những model này để tự động hóa kiểm tra chất lượng, phát hiện lỗi trên dây chuyền lắp ráp với tốc độ và độ chính xác cao. Kiến thức có sẵn của model về ranh giới đối tượng giúp đẩy nhanh việc triển khai các giải pháp sản xuất thông minh này.
Ví dụ triển khai kỹ thuật#
Các nhà phát triển có thể tận dụng mô hình nền tảng để thực hiện những tác vụ phức tạp với lượng mã tối thiểu. Ví dụ sau đây minh họa cách tải model YOLO26 đã được tiền huấn luyện—một mô hình nền tảng thị giác được tối ưu hóa cho các ứng dụng thời gian thực—và thực hiện phát hiện đối tượng trên một hình ảnh.
from ultralytics import YOLO
# Load a pre-trained YOLO26 foundation model
# 'n' stands for nano, the smallest and fastest version
model = YOLO("yolo26n.pt")
# Perform inference on an image to detect objects
# The model uses its pre-trained knowledge to identify common objects
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()Phân biệt các thuật ngữ chính#
Để hiểu rõ vai trò cụ thể của chúng, cần phân biệt "Mô hình nền tảng" với các khái niệm liên quan trong hệ sinh thái AI:
- Mô hình ngôn ngữ lớn (LLM): LLM là một loại mô hình nền tảng được thiết kế chuyên biệt để xử lý và tạo văn bản. Mặc dù mọi LLM đều là mô hình nền tảng, không phải mọi mô hình nền tảng đều là LLM; danh mục này cũng bao gồm các model thị giác như SAM (Mô hình phân đoạn mọi đối tượng) và các hệ thống đa phương thức.
- Học chuyển giao: Đây là kỹ thuật được sử dụng để áp dụng mô hình nền tảng vào một tác vụ mới. Mô hình nền tảng là hiện vật (mạng neural đã lưu), trong khi học chuyển giao là quy trình cập nhật tri thức của hiện vật đó cho một trường hợp sử dụng cụ thể, chẳng hạn như kiểm soát sâu bệnh trong nông nghiệp.
- AI tạo sinh: Thuật ngữ này đề cập đến các hệ thống có thể tạo nội dung mới (văn bản, hình ảnh, mã). Nhiều mô hình nền tảng cung cấp nền tảng cho các ứng dụng AI tạo sinh, nhưng chúng cũng có thể được sử dụng cho các tác vụ phân biệt như phân loại hoặc theo dõi đối tượng, vốn không hoàn toàn mang tính "tạo sinh".
Định hướng và tác động trong tương lai#
Sự phát triển của các mô hình nền tảng đang hướng tới AI đa phương thức, trong đó một hệ thống duy nhất có thể đồng thời xử lý và liên kết thông tin từ văn bản, hình ảnh, âm thanh và dữ liệu cảm biến. Nghiên cứu từ các tổ chức như Viện Stanford về AI lấy con người làm trung tâm (HAI) nhấn mạnh tiềm năng để các hệ thống này suy luận về thế giới theo cách giống con người hơn. Khi các model này trở nên hiệu quả hơn, việc triển khai trên các thiết bị điện toán biên ngày càng khả thi, đưa các năng lực AI mạnh mẽ trực tiếp đến smartphone, drone và cảm biến IoT.









