Generative AI
Khám phá các nguyên tắc cơ bản của Generative AI. Tìm hiểu cách nó tạo ra dữ liệu tổng hợp, tích hợp với Ultralytics YOLO26 và thúc đẩy sự đổi mới trong thị giác máy tính.
Generative AI đề cập đến một tập con của trí tuệ nhân tạo (AI) tập trung vào việc tạo ra nội dung mới, chẳng hạn như văn bản, hình ảnh, âm thanh, video và mã nguồn máy tính, để đáp ứng các lệnh nhắc của người dùng. Không giống như các hệ thống AI truyền thống vốn chủ yếu được thiết kế để phân tích hoặc phân loại dữ liệu hiện có, các mô hình tạo sinh sử dụng các thuật toán học sâu (DL) để học các mẫu, cấu trúc cơ bản và phân phối xác suất của các tập dữ liệu lớn. Sau khi được huấn luyện, các hệ thống này có thể tạo ra các đầu ra mới mang điểm tương đồng thống kê với dữ liệu huấn luyện nhưng lại là những sáng tạo độc đáo. Khả năng này đã định vị Generative AI là nền tảng của các mô hình nền tảng hiện đại, thúc đẩy sự đổi mới trong các ngành công nghiệp sáng tạo, phát triển phần mềm và nghiên cứu khoa học.
Generative Model hoạt động như thế nào#
Trọng tâm của Generative AI là các kiến trúc mạng nơ-ron phức tạp có khả năng học cách mã hóa và giải mã thông tin. Các mô hình này thường được huấn luyện bằng phương pháp học không giám sát trên các tập dữ liệu khổng lồ.
- Transformers: Đối với văn bản và mã nguồn, kiến trúc Transformer sử dụng các cơ chế như self-attention để theo dõi mối quan hệ giữa các từ ở khoảng cách xa trong một chuỗi. Điều này cho phép các mô hình ngôn ngữ lớn (LLMs) tạo ra văn bản mạch lạc và có liên quan về mặt ngữ cảnh.
- Mô hình khuếch tán: Đối với việc tạo hình ảnh, các mô hình khuếch tán hoạt động bằng cách thêm nhiễu vào một hình ảnh cho đến khi không thể nhận diện được, sau đó học cách đảo ngược quá trình này để tái tạo lại một hình ảnh rõ nét từ nhiễu ngẫu nhiên.
- GANs: Mạng đối kháng sinh (GANs) sử dụng hai mạng nơ-ron — một bộ sinh (generator) và một bộ phân biệt (discriminator) — cạnh tranh với nhau, thúc đẩy bộ sinh tạo ra các đầu ra ngày càng chân thực.
Generative AI so với Discriminative AI#
Để hiểu Generative AI, điều quan trọng là phải phân biệt nó với Discriminative AI. Mặc dù cả hai đều là trụ cột của học máy, nhưng mục tiêu của chúng khác nhau đáng kể.
- Generative AI tập trung vào việc tạo ra. Nó mô hình hóa phân phối của các lớp riêng lẻ để tạo ra các mẫu mới. Ví dụ, một mô hình như Stable Diffusion tạo ra một hình ảnh mới về một chú chó dựa trên các mô tả bằng văn bản.
- Discriminative AI tập trung vào việc phân loại và dự đoán. Nó học các ranh giới quyết định giữa các lớp để phân loại dữ liệu đầu vào. Các mô hình thị giác hiệu suất cao như YOLO26 mang tính phân biệt; chúng xuất sắc trong việc phát hiện đối tượng bằng cách phân tích hình ảnh để xác định và định vị các đối tượng cụ thể (ví dụ: phát hiện một chú chó trong ảnh) thay vì tự tạo ra hình ảnh đó.
Các ứng dụng trong thực tế#
Tính linh hoạt của Generative AI cho phép nó được ứng dụng trong nhiều lĩnh vực khác nhau, thường kết hợp cùng với các mô hình phân biệt để tạo ra các quy trình làm việc mạnh mẽ.
-
Tạo dữ liệu tổng hợp: Một trong những ứng dụng thực tế nhất đối với các kỹ sư thị giác máy tính là việc tạo ra dữ liệu tổng hợp. Việc thu thập dữ liệu thế giới thực cho các trường hợp biên hiếm gặp — chẳng hạn như các lỗi công nghiệp cụ thể hoặc điều kiện đường xá nguy hiểm — có thể rất nguy hiểm hoặc tốn kém. Các mô hình tạo sinh có thể tạo ra hàng nghìn hình ảnh chân thực về các kịch bản này. Dữ liệu này sau đó được sử dụng để huấn luyện các bộ phát hiện mạnh mẽ như YOLO26, cải thiện độ chính xác của chúng trong thế giới thực.
-
Thiết kế sáng tạo và tạo mẫu nhanh: Trong lĩnh vực sáng tạo, các công cụ được hỗ trợ bởi các mô hình text-to-image cho phép các nhà thiết kế nhanh chóng hình dung các ý tưởng. Bằng cách nhập một câu lệnh, một nghệ sĩ có thể tạo ra nhiều biến thể của thiết kế sản phẩm, bố cục kiến trúc hoặc tài sản tiếp thị, giúp đẩy nhanh đáng kể giai đoạn hình thành ý tưởng.
-
Tạo và gỡ lỗi mã nguồn: Phát triển phần mềm đã được chuyển đổi nhờ các mô hình được huấn luyện trên các kho mã nguồn. Các trợ lý này hỗ trợ nhà phát triển bằng cách gợi ý các đoạn mã, viết tài liệu và thậm chí xác định lỗi, giúp tối ưu hóa vòng đời phần mềm.
Sự cộng hưởng với thị giác máy tính#
Generative AI và các mô hình thị giác máy tính phân biệt thường hoạt động như các công nghệ bổ trợ cho nhau. Một chu trình phổ biến bao gồm việc sử dụng mô hình tạo sinh để tăng cường tập dữ liệu, tiếp theo là huấn luyện mô hình phân biệt trên tập dữ liệu đã được cải thiện đó bằng các công cụ như Ultralytics Platform.
Ví dụ Python sau đây minh họa cách sử dụng gói ultralytics để tải mô hình YOLO26. Trong một quy trình làm việc kết hợp, bạn có thể sử dụng mã này để xác thực các đối tượng trong một hình ảnh được tạo tổng hợp.
from ultralytics import YOLO
# Load the YOLO26 model (Latest stable Ultralytics model)
model = YOLO("yolo26n.pt")
# Run inference on an image (e.g., a synthetic sample from a generative model)
# The model identifies objects within the generated content
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results to verify the synthetic data quality
results[0].show()Thách thức và Cân nhắc#
Mặc dù mạnh mẽ, Generative AI vẫn mang lại những thách thức cụ thể mà người dùng phải giải quyết. Các mô hình đôi khi có thể tạo ra các ảo giác (hallucinations), tạo ra thông tin nghe có vẻ hợp lý nhưng không chính xác về mặt thực tế hoặc tạo ra các hiện tượng nhiễu hình ảnh. Ngoài ra, do các mô hình này được huấn luyện trên dữ liệu quy mô internet, chúng có thể vô tình lan truyền thành kiến trong AI hiện diện trong tài liệu nguồn.
Các mối quan ngại đạo đức liên quan đến bản quyền và sở hữu trí tuệ cũng rất nổi bật, như đã thảo luận trong các khuôn khổ Đạo đức AI khác nhau. Các nhà nghiên cứu và tổ chức, chẳng hạn như Stanford Institute for Human-Centered AI, đang tích cực làm việc trên các phương pháp để đảm bảo các công cụ mạnh mẽ này được phát triển và triển khai một cách có trách nhiệm. Hơn nữa, chi phí tính toán để huấn luyện các mô hình khổng lồ này đã dẫn đến sự quan tâm ngày càng tăng đối với việc lượng tử hóa mô hình nhằm giúp quá trình suy luận tiết kiệm năng lượng hơn trên các thiết bị biên.






