Lịch sử của các model thị giác
Khám phá lịch sử, thành tựu, thách thức và định hướng tương lai của các model thị giác.

Thị giác máy tính là gì#
Hãy hình dung bạn bước vào một cửa hàng, nơi camera nhận diện khuôn mặt, phân tích tâm trạng và đề xuất các sản phẩm phù hợp với sở thích của bạn — tất cả đều diễn ra theo thời gian thực. Đây không phải là khoa học viễn tưởng mà là thực tế nhờ các model thị giác hiện đại. Theo một báo cáo của Fortune Business Insight, quy mô thị trường thị giác máy tính toàn cầu được định giá 20,31 tỷ USD vào năm 2023 và dự kiến tăng từ 25,41 tỷ USD vào năm 2024 lên 175,72 tỷ USD vào năm 2032, phản ánh những tiến bộ nhanh chóng và mức độ ứng dụng ngày càng tăng của công nghệ này trong nhiều ngành khác nhau.
Lĩnh vực thị giác máy tính cho phép máy tính phát hiện, nhận diện và phân tích các đối tượng trong hình ảnh. Tương tự các lĩnh vực khác liên quan đến AI, thị giác máy tính đã phát triển nhanh chóng trong vài thập kỷ qua và đạt được những tiến bộ đáng kể.
Lịch sử của thị giác máy tính rất lâu đời. Trong những năm đầu, các model thị giác máy tính chỉ có thể phát hiện những hình dạng và đường biên đơn giản, thường bị giới hạn ở các tác vụ cơ bản như nhận diện các mẫu hình học hoặc phân biệt vùng sáng và tối. Tuy nhiên, các model ngày nay có thể thực hiện những tác vụ phức tạp như phát hiện đối tượng theo thời gian thực, nhận diện khuôn mặt và thậm chí diễn giải cảm xúc từ biểu cảm khuôn mặt với độ chính xác và hiệu quả vượt trội. Sự tiến bộ mạnh mẽ này cho thấy những bước tiến đáng kinh ngạc về năng lực tính toán, độ tinh vi của thuật toán và khả năng cung cấp khối lượng dữ liệu khổng lồ để huấn luyện.
Trong bài viết này, chúng ta sẽ khám phá những cột mốc quan trọng trong quá trình phát triển của thị giác máy tính. Chúng ta sẽ tìm hiểu những khởi đầu ban đầu, đi sâu vào tác động mang tính chuyển đổi của Mạng nơ-ron tích chập (CNNs) và xem xét những tiến bộ đáng kể tiếp theo.
Những khởi đầu của thị giác máy tính#
Tương tự các lĩnh vực AI khác, sự phát triển ban đầu của thị giác máy tính bắt đầu từ các nghiên cứu nền tảng và công trình lý thuyết. Một cột mốc quan trọng là công trình tiên phong về nhận diện đối tượng 3D của Lawrence G. Roberts, được trình bày trong luận án "Machine Perception of Three-Dimensional Solids" vào đầu những năm 1960. Những đóng góp của ông đã đặt nền móng cho các tiến bộ sau này trong lĩnh vực này.
Các thuật toán đầu tiên - phát hiện đường biên#
Nghiên cứu ban đầu về thị giác máy tính tập trung vào các kỹ thuật xử lý hình ảnh như phát hiện đường biên và trích xuất đặc trưng. Các thuật toán như toán tử Sobel, được phát triển vào cuối những năm 1960, nằm trong số những thuật toán đầu tiên phát hiện đường biên bằng cách tính gradient cường độ ảnh.

Hình 1. Hình ảnh minh họa việc phát hiện đường biên, trong đó bên trái hiển thị đối tượng ban đầu và bên phải hiển thị phiên bản đã phát hiện đường biên.
Các kỹ thuật như bộ phát hiện đường biên Sobel và Canny đóng vai trò quan trọng trong việc xác định ranh giới trong hình ảnh, vốn cần thiết để nhận diện đối tượng và hiểu cảnh.
Machine learning và thị giác máy tính#
Nhận dạng mẫu#
Vào những năm 1970, nhận dạng mẫu nổi lên như một lĩnh vực trọng tâm của thị giác máy tính. Các nhà nghiên cứu đã phát triển những phương pháp nhận dạng hình dạng, kết cấu và đối tượng trong hình ảnh, mở đường cho các tác vụ thị giác phức tạp hơn.

Hình 2. Nhận dạng mẫu.
Một trong những phương pháp nhận dạng mẫu đầu tiên là so khớp template, trong đó một hình ảnh được so sánh với một tập hợp template để tìm kết quả khớp tốt nhất. Cách tiếp cận này bị giới hạn bởi độ nhạy với những thay đổi về tỷ lệ, phép xoay và nhiễu.

Hình 3. Một template ở bên trái được tìm thấy trong hình ảnh bên phải.
Các hệ thống thị giác máy tính ban đầu bị hạn chế bởi năng lực tính toán thấp của thời kỳ đó. Máy tính trong những năm 1960 và 1970 cồng kềnh, đắt đỏ và có khả năng xử lý hạn chế.
Deep Learning thay đổi cuộc chơi#
Deep Learning và Mạng nơ-ron tích chập#
Deep learning và Mạng nơ-ron tích chập (CNNs) đánh dấu một bước ngoặt quan trọng trong lĩnh vực thị giác máy tính. Những tiến bộ này đã biến đổi sâu sắc cách máy tính diễn giải và phân tích dữ liệu hình ảnh, cho phép triển khai nhiều ứng dụng trước đây từng được cho là bất khả thi.
CNNs hoạt động như thế nào?#

Hình 4. Kiến trúc của Mạng nơ-ron tích chập (CNN).
- Các lớp tích chập: CNNs sử dụng các lớp tích chập, là một loại model deep learning được thiết kế để xử lý dữ liệu có cấu trúc dạng lưới như hình ảnh hoặc chuỗi bằng cách tự động học các mẫu phân cấp, nhằm quét hình ảnh bằng các bộ lọc hoặc kernel. Các bộ lọc này phát hiện nhiều đặc trưng như đường biên, kết cấu và màu sắc bằng cách trượt qua hình ảnh và tính tích vô hướng. Mỗi bộ lọc kích hoạt các mẫu cụ thể trong hình ảnh, giúp model học được các đặc trưng phân cấp.
- Các hàm activation: Sau phép tích chập, các hàm activation như ReLU (Đơn vị tuyến tính chỉnh lưu), một hàm activation phổ biến trong deep learning cho đầu vào trực tiếp nếu giá trị dương và cho đầu ra bằng 0 trong các trường hợp còn lại, giúp các mạng nơ-ron học các quan hệ phi tuyến trong dữ liệu một cách hiệu quả. Điều này giúp mạng học được các mẫu và biểu diễn phức tạp.
- Các lớp pooling: Các lớp pooling thực hiện thao tác downsampling để giảm số chiều của feature map, giúp trích xuất những đặc trưng phù hợp nhất đồng thời giảm chi phí tính toán và hiện tượng overfitting.
- Các lớp fully connected: Các lớp cuối của CNN là những lớp fully connected, diễn giải các đặc trưng được trích xuất bởi các lớp tích chập và pooling để đưa ra dự đoán. Những lớp này tương tự các lớp trong mạng nơ-ron truyền thống.
Quá trình phát triển của các model thị giác CNN#
Hành trình phát triển của các model thị giác đã trải qua một chặng đường dài, với một số model nổi bật nhất:
-
LeNet (1989): LeNet là một trong những kiến trúc CNN đầu tiên, chủ yếu được sử dụng để nhận dạng chữ số trên séc viết tay. Thành công của nó đã đặt nền móng cho các CNN phức tạp hơn, chứng minh tiềm năng của deep learning trong xử lý hình ảnh.
-
AlexNet (2012): AlexNet vượt trội đáng kể so với các model hiện có trong cuộc thi ImageNet, thể hiện sức mạnh của deep learning. Model này sử dụng activation ReLU, dropout và tăng cường dữ liệu, thiết lập các chuẩn mới trong phân loại hình ảnh và khơi dậy sự quan tâm rộng rãi đối với CNNs.
-
VGGNet (2014): Bằng cách sử dụng các bộ lọc tích chập nhỏ hơn (3x3), VGGNet đạt kết quả ấn tượng trong các tác vụ phân loại hình ảnh, củng cố tầm quan trọng của độ sâu mạng trong việc đạt độ chính xác cao hơn.
-
ResNet (2015): ResNet giải quyết vấn đề suy giảm trong các mạng sâu bằng cách giới thiệu residual learning. Đổi mới này cho phép huấn luyện các mạng sâu hơn nhiều, mang lại hiệu năng tiên tiến trong nhiều tác vụ thị giác máy tính.
-
YOLO (Bạn chỉ nhìn một lần): YOLO đã cách mạng hóa phát hiện đối tượng bằng cách định dạng bài toán này thành một bài toán hồi quy duy nhất, trực tiếp dự đoán bounding box và xác suất lớp từ toàn bộ hình ảnh trong một lần đánh giá. Cách tiếp cận này cho phép phát hiện đối tượng theo thời gian thực với tốc độ và độ chính xác chưa từng có, phù hợp với các ứng dụng yêu cầu xử lý tức thời như xe tự hành và giám sát.
Các ứng dụng của thị giác máy tính#
Y tế#
Thị giác máy tính có rất nhiều ứng dụng. Chẳng hạn, các model thị giác như Ultralytics YOLOv8 được sử dụng trong chẩn đoán hình ảnh y khoa để phát hiện các bệnh như ung thư và bệnh võng mạc do tiểu đường. Chúng phân tích ảnh X-quang, MRI và CT với độ chính xác cao, xác định sớm các bất thường. Khả năng phát hiện sớm này cho phép can thiệp kịp thời và cải thiện kết quả điều trị cho bệnh nhân.

Hình 5. Phát hiện khối u não bằng Ultralytics YOLOv8.
Bảo tồn môi trường#
Các model thị giác máy tính giúp giám sát và bảo vệ các loài có nguy cơ tuyệt chủng bằng cách phân tích hình ảnh và video từ môi trường sống của động vật hoang dã. Chúng xác định và theo dõi hành vi của động vật, cung cấp dữ liệu về quần thể và sự di chuyển của chúng. Công nghệ này hỗ trợ xây dựng chiến lược bảo tồn và quyết định chính sách nhằm bảo vệ các loài như hổ và voi.
Với sự hỗ trợ của vision AI, các mối đe dọa môi trường khác như cháy rừng và phá rừng cũng có thể được giám sát, đảm bảo chính quyền địa phương phản ứng nhanh chóng.

Hình 6. Ảnh vệ tinh về một vụ cháy rừng.
Thách thức và định hướng tương lai#
Mặc dù đã đạt được những thành tựu đáng kể, do độ phức tạp rất cao và yêu cầu khắt khe trong quá trình phát triển, các model thị giác vẫn phải đối mặt với nhiều thách thức đòi hỏi nghiên cứu liên tục và những tiến bộ trong tương lai.
Khả năng diễn giải và giải thích#
Các model thị giác, đặc biệt là những model deep learning, thường được xem như các "hộp đen" với tính minh bạch hạn chế. Điều này là do các model như vậy vô cùng phức tạp. Việc thiếu khả năng diễn giải làm cản trở sự tin cậy và trách nhiệm giải trình, đặc biệt trong các ứng dụng quan trọng như chăm sóc sức khỏe.
Yêu cầu về năng lực tính toán#
Việc huấn luyện và triển khai các model AI tiên tiến đòi hỏi nguồn lực tính toán đáng kể. Điều này đặc biệt đúng với các model thị giác, vốn thường cần xử lý lượng lớn dữ liệu hình ảnh và video. Hình ảnh và video độ phân giải cao, nằm trong số những đầu vào huấn luyện tiêu tốn nhiều dữ liệu nhất, làm tăng thêm gánh nặng tính toán. Chẳng hạn, một hình ảnh HD duy nhất có thể chiếm vài megabyte dung lượng lưu trữ, khiến quá trình huấn luyện tiêu tốn nhiều tài nguyên và thời gian.
Điều này đòi hỏi phần cứng mạnh mẽ và các thuật toán thị giác máy tính được tối ưu hóa để xử lý lượng dữ liệu lớn cùng các phép tính phức tạp trong quá trình phát triển các model thị giác hiệu quả. Nghiên cứu về kiến trúc hiệu quả hơn, nén model và các bộ tăng tốc phần cứng như GPU và TPU là những lĩnh vực then chốt sẽ thúc đẩy tương lai của các model thị giác.
Những cải tiến này nhằm giảm yêu cầu tính toán và tăng hiệu quả xử lý. Hơn nữa, việc tận dụng các model được huấn luyện trước tiên tiến như Ultralytics YOLOv8 có thể giảm đáng kể nhu cầu huấn luyện trên quy mô lớn, hợp lý hóa quy trình phát triển và nâng cao hiệu quả.
Một lĩnh vực không ngừng phát triển#
Ngày nay, các ứng dụng của model thị giác rất phổ biến, từ chăm sóc sức khỏe, chẳng hạn như phát hiện khối u, đến những ứng dụng hằng ngày như giám sát giao thông. Các model tiên tiến này đã mang lại sự đổi mới cho vô số ngành bằng cách cung cấp độ chính xác, hiệu quả và năng lực cao hơn những gì trước đây khó có thể hình dung.
Khi công nghệ tiếp tục tiến bộ, tiềm năng đổi mới và cải thiện nhiều khía cạnh của đời sống cũng như công nghiệp của các model thị giác vẫn là vô hạn. Quá trình phát triển liên tục này nhấn mạnh tầm quan trọng của việc tiếp tục nghiên cứu và phát triển trong lĩnh vực thị giác máy tính.
Bạn tò mò về tương lai của vision AI? Để biết thêm thông tin về những tiến bộ mới nhất, hãy khám phá Tài liệu Ultralytics, đồng thời xem các dự án của họ trên Ultralytics GitHub và YOLOv8 GitHub. Ngoài ra, để tìm hiểu về các ứng dụng AI trong nhiều ngành khác nhau, các trang giải pháp về Xe tự lái và Sản xuất cung cấp những thông tin đặc biệt hữu ích.









