Computer Vision (CV)
Khám phá cách thị giác máy tính giúp máy móc diễn giải hình ảnh và video. Tìm hiểu các tác vụ cốt lõi, ứng dụng trong ngành và cách bắt đầu với Ultralytics YOLO.
Thị giác máy tính (CV) là lĩnh vực trí tuệ nhân tạo (AI) cho phép máy tính và hệ thống rút ra thông tin có ý nghĩa từ hình ảnh kỹ thuật số, video và các đầu vào trực quan khác. Nếu AI cho phép máy móc suy nghĩ, thì thị giác máy tính cho phép chúng nhìn, quan sát và hiểu. Không giống các công cụ xử lý hình ảnh dựa trên quy tắc, các hệ thống hiện đại học trực tiếp từ dữ liệu: chúng không được chỉ rõ ô tô hay khối u trông như thế nào, mà thay vào đó xác định các mẫu nền tảng trong hàng nghìn ví dụ đã gán nhãn và khái quát hóa kiến thức đó cho những hình ảnh chúng chưa từng gặp. Bằng cách áp dụng machine learning (ML) và deep learning (DL), thị giác máy tính biến dữ liệu trực quan phi cấu trúc thành các quyết định mà phần mềm có thể thực thi.
Cách thị giác máy tính hoạt động#
Máy tính nhìn một hình ảnh như một mảng các giá trị số đại diện cho pixel. Việc biến mảng đó thành một hành động tuân theo pipeline gồm năm giai đoạn.

Thu nhận hình ảnh. Quy trình bắt đầu với phần cứng — cảm biến CMOS, camera hồng ngoại hoặc máy quét LiDAR — thu nhận ánh sáng và chuyển đổi ánh sáng thành lưới pixel kỹ thuật số. Hiệu chuẩn camera xử lý hình học của ống kính trước khi bắt đầu phân tích.
Tiền xử lý. Dữ liệu thu được được chuẩn hóa để model nhận đầu vào nhất quán: thay đổi kích thước, giảm nhiễu và điều chỉnh độ tương phản.
Trích xuất đặc trưng. Hệ thống xác định các đặc trưng cấp thấp như cạnh, gradient và góc. Khi dữ liệu đi sâu hơn vào network, các nguyên tố cơ bản đó kết hợp thành những đặc trưng cấp cao — kết cấu, mẫu và hình học phức tạp. Một hệ thống có thể phát hiện các đường dọc, nhận ra chúng là cọc hàng rào, rồi hiểu cảnh đó là ranh giới chu vi. Quy trình này được gọi là trích xuất đặc trưng.
Suy luận model. Động cơ của thị giác máy tính hiện đại là mạng nơ-ron tích chập (CNN). Không giống một mạng nơ-ron tiêu chuẩn xử lý hình ảnh như một danh sách số phẳng, CNN bảo toàn mối quan hệ không gian giữa các pixel bằng các bộ lọc trượt qua hình ảnh để phát hiện mẫu bất kể chúng xuất hiện ở đâu trong khung hình. Gần đây hơn, Vision Transformers (ViTs) đã nổi lên như một lựa chọn thay thế mạnh mẽ, áp dụng cơ chế attention từ xử lý ngôn ngữ tự nhiên vào dữ liệu hình ảnh.
Đầu ra và hành động. Model trả về một kết quả có cấu trúc — một nhãn, một tập bounding box hoặc một mask pixel — để hệ thống xung quanh thực hiện hành động: loại bỏ linh kiện lỗi, phanh phương tiện hoặc phát cảnh báo.
Cách một model học#
Model chỉ tốt khi dữ liệu mà nó tiếp nhận có chất lượng. Supervised learning yêu cầu khối lượng lớn dữ liệu training, còn các benchmark như ImageNet và COCO cung cấp hàng triệu ví dụ đã được gán nhãn. Trong quá trình training, model đưa ra dự đoán, so sánh dự đoán đó với nhãn ground truth rồi điều chỉnh các trọng số nội bộ để giảm sai số. Sau khi được training, chính model đó thực hiện bước suy luận ở trên.
Sự chuyển đổi từ hệ thống dựa trên quy tắc sang deep learning#

Thị giác máy tính thời kỳ đầu phụ thuộc vào kỹ thuật thiết kế đặc trưng thủ công: các kỹ sư xác định các tham số hình học cứng nhắc để giúp máy nhận dạng vật thể. Những hệ thống đó dễ hỏng, thất bại mỗi khi ánh sáng thay đổi hoặc vật thể xuất hiện ở một góc lạ. Công trình AlexNet được công bố năm 2012, training trên hơn một triệu hình ảnh ImageNet đã gán nhãn, đánh dấu bước ngoặt khi chứng minh rằng các network tích chập có thể vượt qua các phương pháp thiết kế thủ công ở quy mô lớn. Deep learning thay thế các quy tắc được tinh chỉnh thủ công bằng những kiến trúc tự học đặc trưng — đủ linh hoạt để hoạt động ổn định trong các điều kiện thực tế vốn không bao giờ được kiểm soát hoàn toàn.
Thị giác máy tính và xử lý hình ảnh và machine vision#
Điều quan trọng là phân biệt thị giác máy tính với các lĩnh vực liên quan thường bị nhầm lẫn với nó.
- Xử lý hình ảnh thao tác trên hình ảnh để cải thiện hình ảnh hoặc trích xuất tín hiệu — điều chỉnh độ sáng, độ tương phản hoặc áp dụng bộ lọc. Đầu ra thường là một hình ảnh khác. Thị giác máy tính nhận hình ảnh làm đầu vào và xuất ra một diễn giải ("có ba người trong căn phòng này"). Thị giác máy tính thường sử dụng xử lý hình ảnh như một bước chuẩn bị.
- Machine vision chỉ các hệ thống kiểm tra công nghiệp hoạt động trong môi trường được kiểm soát chặt chẽ, với ánh sáng cố định và vị trí linh kiện đã biết. Thị giác máy tính là lĩnh vực rộng hơn, được xây dựng để xử lý các điều kiện không thể dự đoán và không được kiểm soát.
- Xử lý ngôn ngữ tự nhiên xử lý văn bản và giọng nói. Thị giác máy tính tập trung hoàn toàn vào dữ liệu trực quan, dù vision language model đang ngày càng kết nối hai lĩnh vực này.
Các tác vụ cốt lõi của thị giác máy tính#
Thị giác máy tính không phải là một chức năng duy nhất mà là tập hợp các tác vụ riêng biệt, mỗi tác vụ giải quyết một vấn đề khác nhau. Để xem hướng dẫn chi tiết hơn về từng tác vụ, hãy tham khảo hướng dẫn đầy đủ về các tác vụ thị giác máy tính.
- Phân loại hình ảnh: gán một nhãn duy nhất cho toàn bộ hình ảnh, trả lời câu hỏi "có gì trong bức ảnh này?" — chẳng hạn phân loại sản phẩm thành lỗi hoặc không lỗi. Có liên quan chặt chẽ là nhận dạng hình ảnh, dùng để xác định những gì xuất hiện trong hình ảnh.
- Phát hiện vật thể: xác định các vật thể riêng biệt và vẽ một bounding box quanh từng vật thể, cho phép hệ thống đếm và định vị nhiều vật thể trong cùng một khung hình.
- Phân đoạn instance: tạo mask ở cấp pixel cho từng vật thể được phát hiện, tách các instance riêng lẻ thuộc cùng một class. Phân đoạn semantic thay vào đó gán một class cho mọi pixel mà không phân biệt các instance.
- Ước lượng pose: phát hiện các keypoint trên vật thể, chẳng hạn các khớp trên cơ thể người, để theo dõi chuyển động và tư thế.
- Bounding box có hướng: khớp các box xoay với những vật thể không thẳng theo trục — rất quan trọng trong hình ảnh trên không và ảnh vệ tinh.
- Theo dõi vật thể: theo dõi một vật thể xuyên suốt luồng video, duy trì ID nhất quán giữa các khung hình. Optical flow mở rộng khả năng này bằng cách phân tích chuyển động biểu kiến giữa các khung hình liên tiếp.
- Nhận dạng ký tự quang học (OCR): chuyển hình ảnh của văn bản in hoặc viết tay thành dữ liệu mà máy có thể đọc, tự động hóa xử lý tài liệu ở quy mô lớn.
Lựa chọn tác vụ phù hợp#
Việc ngay từ đầu căn chỉnh tác vụ kỹ thuật với mục tiêu kinh doanh sẽ tránh phải làm lại tốn kém.
| Mục tiêu kinh doanh | Tác vụ cần sử dụng |
|---|---|
| Phân loại sản phẩm vào các nhóm | Phân loại hình ảnh |
| Đếm các vật thể hoặc xác định vị trí của chúng | Phát hiện đối tượng |
| Phân tích hình dạng hoặc ranh giới chính xác của vật thể | Phân đoạn instance |
| Theo dõi chuyển động qua các khung hình video | Theo dõi vật thể |
| Đo vị trí cơ thể hoặc góc khớp | Ước tính pose |
| Phát hiện vật thể xoay trong hình ảnh trên không | Bounding box có hướng |
| Đọc văn bản từ tài liệu hoặc nhãn | Nhận dạng ký tự quang học |
Các ứng dụng trong thực tế#
Thị giác máy tính hiện là nền tảng cho các hệ thống production trong hầu hết ngành công nghiệp lớn.

- Sản xuất và kiểm soát chất lượng. Các dây chuyền production hiện đại vận hành nhanh hơn khả năng quan sát của con người. Các hệ thống thị giác thực hiện kiểm tra chất lượng tức thời, phát hiện các vết nứt siêu nhỏ hoặc linh kiện bị lệch ở tốc độ dây chuyền mà không gặp tình trạng mệt mỏi tích tụ như nhân viên kiểm tra. Việc giám sát các kiểu hao mòn trên máy móc cũng cho phép bảo trì dự đoán — phát hiện dấu hiệu hỏng hóc trước khi sự cố gây ra thời gian ngừng hoạt động ngoài kế hoạch. Xem thị giác máy tính trong sản xuất và phát hiện lỗi.
- Y tế và chẩn đoán. Các thuật toán phân tích hình ảnh y tế xử lý ảnh X-quang, MRI và CT để phát hiện khối u giai đoạn sớm, vi gãy xương và bất thường võng mạc — những dấu hiệu dễ bị bỏ sót dưới áp lực thời gian. Trong phòng phẫu thuật, các hệ thống thị giác cung cấp bản đồ không gian theo thời gian thực trong các thủ thuật xâm lấn tối thiểu. Xem thị giác máy tính trong y tế.
- Bán lẻ. Các cửa hàng không cần thanh toán sử dụng sensor fusion và thuật toán thị giác để theo dõi sản phẩm rời khỏi kệ và tự động tính tiền cho khách hàng. Những hệ thống tương tự giám sát mức hàng trên kệ theo thời gian thực để kích hoạt cảnh báo bổ sung hàng, hỗ trợ quản lý hàng tồn kho và ngăn ngừa thất thoát trong bán lẻ. Xem thị giác máy tính trong bán lẻ.
- Giao thông tự hành. Lớp nhận thức là thành phần quan trọng nhất về an toàn của xe tự lái. Các hệ thống thị giác xác định vạch làn đường, biển báo giao thông, người đi bộ và các phương tiện khác theo thời gian thực, kết hợp đầu vào từ camera với radar và LiDAR để xây dựng model 360 độ về môi trường xung quanh xe thông qua phát hiện vật thể 3D. Xem phương tiện tự hành.
- An ninh và giám sát. Hạ tầng an ninh đã chuyển từ ghi hình thụ động sang can thiệp chủ động — phát hiện hành vi nấn ná trong các khu vực hạn chế, đánh dấu các mẫu hành vi bất thường ngay khi xảy ra và hỗ trợ quản lý hàng đợi tại không gian công cộng. Phát hiện bất thường là năng lực nền tảng.
- Nông nghiệp. Drone và máy kéo đánh giá tình trạng cây trồng ở cấp độ từng cây, phân tích hình ảnh đa phổ để phát hiện mất nước, sâu bệnh hoặc thiếu chất dinh dưỡng. Sau đó, nước, thuốc trừ sâu và phân bón chỉ được sử dụng ở những nơi cần thiết thay vì trên toàn bộ cánh đồng. Xem thị giác máy tính trong nông nghiệp.
Thị giác máy tính ở edge#
Phân tích hình ảnh theo thời gian thực ngày càng được thực hiện ở edge — trực tiếp trên camera hoặc một gateway cục bộ — thay vì định tuyến video đến server cloud tập trung. Điều này quan trọng vì hai lý do.
Độ trễ giảm xuống gần bằng 0, điều bắt buộc đối với robot tự hành hoặc kiểm tra dây chuyền công nghiệp, nơi độ trễ chỉ vài mili giây cũng tạo ra lỗi. Ngoài ra, vì chỉ metadata đi qua network thay vì video thô, yêu cầu băng thông giảm mạnh trong khi quyền riêng tư được cải thiện, bởi các cảnh quay nhạy cảm không bao giờ rời khỏi thiết bị cục bộ. Edge AI và suy luận theo thời gian thực giúp điều này trở nên khả thi, còn các tùy chọn triển khai model như ONNX và TensorRT cho phép một model đã training chạy trên nhiều loại hardware.
Thách thức và hạn chế#
Chất lượng dữ liệu. Model phản ánh chất lượng dữ liệu training của nó. Dataset có độ phân giải thấp, gán nhãn kém hoặc không đại diện sẽ tạo ra các model không đáng tin cậy, và việc xây dựng một dataset đa dạng đã gán nhãn thường tốn nhiều công sức hơn thiết kế thuật toán. Xem gán nhãn dữ liệu.
Biến số môi trường. Mưa lớn, flare ống kính, che khuất một phần và quy mô vật thể thay đổi đều làm suy giảm hiệu năng. Các hệ thống robust dựa vào data augmentation trong quá trình training để mô phỏng những điều kiện này và tăng khả năng chống chịu trước khi triển khai, đồng thời validation cẩn thận để tránh overfitting.
Cân nhắc đạo đức và thiên kiến. Model được training trên dataset thiếu đa dạng nhân khẩu học sẽ hoạt động không đồng đều giữa các nhóm dân cư. Các tổ chức triển khai hệ thống phân tích con người — trong chẩn đoán hình ảnh y tế, an toàn nơi làm việc hoặc không gian công cộng — phải audit dataset về tính công bằng và tuân thủ các quy định mới nổi liên quan đến việc ra quyết định tự động.
Tương lai của thị giác máy tính#
Vision Transformer đang định hình lại những gì có thể đạt được trong các tác vụ đòi hỏi hiểu mối quan hệ giữa các phần cách xa nhau trong một hình ảnh. Ngoài ra, học đa phương thức kết hợp dữ liệu hình ảnh với văn bản, âm thanh và chiều sâu để xây dựng các hệ thống có khả năng hiểu ngữ cảnh phong phú hơn — vision language model có thể trả lời câu hỏi về hình ảnh là một ví dụ ban đầu.
Generative AI đang trực tiếp giải quyết tình trạng thiếu dữ liệu. Dữ liệu tổng hợp giúp tạo ra những hình ảnh siêu chân thực về các kịch bản hiếm gặp — các dạng lỗi cụ thể, biểu hiện bệnh không phổ biến — vốn không thể được thu thập với số lượng đủ lớn trong thế giới thực. Trong khi đó, camera cảm biến chiều sâu và LiDAR đang đưa các hệ thống vượt ra ngoài phân tích hình ảnh phẳng để hướng tới điện toán không gian, nơi thông tin kỹ thuật số được phủ lên thế giới vật lý cho các ứng dụng như bảo trì có hướng dẫn bằng AR và lập bản đồ kết cấu.
Triển khai thị giác máy tính với Ultralytics#
Đối với các team thử nghiệm một dự án thị giác máy tính, Ultralytics YOLO26 là điểm khởi đầu thực tế cho phát hiện vật thể theo thời gian thực — mã nguồn mở, được tài liệu hóa đầy đủ và đủ nhanh để chạy ở edge. Các số liệu về độ chính xác và độ trễ trên nhiều hardware được công bố trên trang benchmark, cùng với các so sánh model song song trong tài liệu. Hệ sinh thái rộng hơn bao gồm OpenCV cho xử lý hình ảnh cổ điển và PyTorch làm framework training chính.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on a standard example image
# The model identifies objects and their locations
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with bounding boxes
results[0].show()Script này sử dụng một model đã được pre-train để thực hiện suy luận chỉ với vài dòng code. Các team chuyển từ pilot sang production có thể sử dụng Ultralytics Platform để gán nhãn dataset, training model trên cloud và quản lý việc triển khai, hoặc áp dụng transfer learning để điều chỉnh một model đã pre-train cho dataset tùy chỉnh với lượng dữ liệu đã gán nhãn ít hơn nhiều so với training từ đầu.
Các câu hỏi thường gặp#
Sự khác biệt giữa thị giác máy tính và machine learning là gì? Machine learning là lĩnh vực rộng hơn về xây dựng các hệ thống học từ dữ liệu. Thị giác máy tính là ứng dụng của lĩnh vực đó — thường thông qua deep learning — vào các đầu vào trực quan như hình ảnh và video. Gần như toàn bộ thị giác máy tính hiện đại đều được xây dựng trên machine learning, nhưng machine learning cũng bao quát dữ liệu văn bản, âm thanh và dạng bảng.
Thị giác máy tính có giống nhận dạng hình ảnh không? Không. Nhận dạng hình ảnh là một tác vụ trong thị giác máy tính — xác định những gì xuất hiện trong hình ảnh. Thị giác máy tính còn bao gồm phát hiện vật thể, phân đoạn, ước lượng pose, tracking và hiểu cảnh.
Cần bao nhiêu dữ liệu để training một model thị giác máy tính? Điều này phụ thuộc vào độ phức tạp của tác vụ và mức độ biến thiên mà model phải xử lý. Transfer learning từ một model đã pre-train như Ultralytics YOLO26 giúp giảm đáng kể yêu cầu dữ liệu, và các detector tùy chỉnh hữu ích thường được training trên vài trăm đến vài nghìn hình ảnh đã gán nhãn cho mỗi class, thay vì hàng triệu hình ảnh được sử dụng để training các foundation model.
Thị giác máy tính có thể chạy mà không cần kết nối Internet không? Có. Model có thể được triển khai trực tiếp lên các thiết bị edge và chạy hoàn toàn offline, đây là thực tiễn tiêu chuẩn trong những trường hợp độ trễ, băng thông hoặc quy định về quyền riêng tư dữ liệu không cho phép gửi video lên cloud.
Ngôn ngữ lập trình nào được sử dụng cho thị giác máy tính? Python chiếm ưu thế nhờ hệ sinh thái trưởng thành — package ultralytics, PyTorch và OpenCV. C++ được sử dụng khi yêu cầu hiệu năng suy luận tối đa, thường trong các hệ thống nhúng và automotive.









