Kết nối xử lý ngôn ngữ tự nhiên và thị giác máy tính
Tìm hiểu cách xử lý ngôn ngữ tự nhiên (NLP) và thị giác máy tính (CV) có thể hợp tác để chuyển đổi các ngành công nghiệp với các hệ thống AI đa phương thức thông minh hơn.

Natural language processing (NLP) và computer vision (CV) là hai nhánh riêng biệt của artificial intelligence (AI) đã trở nên rất phổ biến trong những năm gần đây. Nhờ những tiến bộ trong AI, hai nhánh này hiện nay ngày càng liên kết chặt chẽ với nhau hơn bao giờ hết.
Một ví dụ tuyệt vời về điều này là tính năng image captioning tự động. Computer vision có thể được sử dụng để phân tích và hiểu nội dung của hình ảnh, trong khi xử lý ngôn ngữ tự nhiên có thể được dùng để generate một chú thích mô tả hình ảnh đó. Tính năng chú thích ảnh tự động được sử dụng phổ biến trên các nền tảng social media nhằm cải thiện khả năng accessibility và trong các hệ thống quản lý content để giúp tổ chức và tag images một cách hiệu quả.
Những đổi mới trong NLP và Vision AI đã dẫn đến nhiều trường hợp sử dụng như vậy trong hàng loạt ngành công nghiệp. Trong bài viết này, chúng ta sẽ tìm hiểu kỹ hơn về NLP và computer vision cũng như thảo luận về cách thức hoạt động của cả hai. Chúng ta cũng sẽ khám phá các ứng dụng thú vị sử dụng song song cả hai công nghệ này. Hãy cùng bắt đầu nhé!
Hiểu về NLP và Vision AI#
NLP tập trung vào tương tác giữa máy tính và ngôn ngữ con người. Công nghệ này cho phép máy móc hiểu, diễn giải và generate text hoặc lời nói theo cách có ý nghĩa. NLP có thể được sử dụng để thực hiện các tác vụ như dịch thuật, sentiment analysis hoặc summarization.
Trong khi đó, computer vision giúp máy móc phân tích và làm việc với hình ảnh cũng như video. Công nghệ này có thể được sử dụng cho các tác vụ như detecting objects trong một bức ảnh, facial recognition, object tracking hoặc image classification. Công nghệ Vision AI giúp máy móc hiểu rõ hơn và tương tác tốt hơn với thế giới trực quan.

Fig 1. Một ví dụ về phân loại hình ảnh.
Khi được tích hợp với computer vision, NLP có thể bổ sung ý nghĩa cho visual data bằng cách kết hợp văn bản và hình ảnh, cho phép thấu hiểu sâu sắc hơn. Như người ta vẫn thường nói, "một bức ảnh có giá trị bằng ngàn lời nói," và khi kết hợp với văn bản, nó lại càng trở nên mạnh mẽ hơn, mang lại những thông tin chi tiết phong phú hơn.
Các ví dụ về NLP và thị giác máy tính làm việc cùng nhau#
Bạn có lẽ đã thấy NLP và computer vision hoạt động cùng nhau trong các everyday tools mà không hề nhận ra, chẳng hạn như khi điện thoại của bạn dịch văn bản từ một bức ảnh.
Trên thực tế, Google Translate sử dụng cả xử lý ngôn ngữ tự nhiên và computer vision để dịch văn bản từ hình ảnh. Khi bạn chụp ảnh một biển báo đường phố bằng ngôn ngữ khác, computer vision sẽ nhận diện và trích xuất văn bản, trong khi NLP dịch văn bản đó sang ngôn ngữ ưa thích của bạn.
NLP và CV làm việc cùng nhau để làm cho quy trình trở nên trôi chảy và hiệu quả, cho phép người dùng hiểu và tương tác với thông tin trên các ngôn ngữ trong thời gian thực. Sự tích hợp liền mạch các công nghệ này phá vỡ các rào cản giao tiếp.

Fig 2. Tính năng dịch của Google.
Dưới đây là một số ứng dụng khác mà NLP và thị giác máy tính làm việc cùng nhau:
- Self-driving cars: CV có thể được sử dụng để phát hiện biển báo giao thông, làn đường và các vật cản, trong khi NLP có thể xử lý các câu lệnh bằng giọng nói hoặc văn bản trên biển báo giao thông.
- Document readers: Vision AI có thể nhận diện văn bản từ các tài liệu được quét hoặc chữ viết tay, còn xử lý ngôn ngữ tự nhiên có thể diễn giải và tóm tắt thông tin.
- Visual search in shopping apps: Computer vision có thể nhận diện sản phẩm trong ảnh, trong khi NLP xử lý các từ khóa tìm kiếm để cải thiện đề xuất.
- Educational tools: CV có thể nhận diện ghi chú viết tay hoặc đầu vào trực quan, và NLP có thể cung cấp giải thích hoặc phản hồi dựa trên nội dung đó.
Các khái niệm chính liên kết thị giác máy tính và NLP#
Bây giờ chúng ta đã thấy thị giác máy tính và xử lý ngôn ngữ tự nhiên được sử dụng như thế nào, hãy cùng khám phá cách chúng kết hợp với nhau để kích hoạt AI đa phương thức.
Cross-modal AI kết hợp khả năng hiểu thị giác từ computer vision với khả năng hiểu ngôn ngữ từ NLP để xử lý và kết nối thông tin trên cả văn bản và hình ảnh. Ví dụ, trong lĩnh vực healthcare, cross-modal AI có thể giúp phân tích một bức X-ray và tạo ra một bản tóm tắt bằng văn bản rõ ràng về các vấn đề tiềm ẩn, giúp bác sĩ đưa ra quyết định nhanh chóng và chính xác hơn.
Hiểu ngôn ngữ tự nhiên (NLU)#
Natural Language Understanding là một tập con đặc biệt của NLP tập trung vào việc diễn giải và trích xuất ý nghĩa từ văn bản bằng cách phân tích ý định, ngữ cảnh, ngữ nghĩa, âm điệu và cấu trúc của văn bản đó. Trong khi NLP xử lý văn bản thô, NLU cho phép máy móc hiểu ngôn ngữ con người một cách hiệu quả hơn. Ví dụ, phân tích cú pháp là một kỹ thuật NLU chuyển đổi văn bản viết thành định dạng có cấu trúc mà máy móc có thể hiểu được.

Fig 3. Mối quan hệ giữa NLP và NLU.
NLU hoạt động cùng với computer vision khi dữ liệu hình ảnh chứa văn bản cần được hiểu rõ. Computer vision, sử dụng các công nghệ như optical character recognition (OCR), sẽ trích xuất văn bản từ hình ảnh, tài liệu hoặc video. Công nghệ này có thể bao gồm các tác vụ như quét biên nhận, đọc văn bản trên biển báo hoặc số hóa ghi chú viết tay.
Sau đó, NLU xử lý văn bản đã trích xuất để hiểu ý nghĩa, ngữ cảnh và ý định của nó. Sự kết hợp này giúp các hệ thống có thể thực hiện nhiều việc hơn là chỉ nhận dạng văn bản. Chúng có thể phân loại các khoản chi tiêu từ biên lai hoặc phân tích tông giọng và cảm xúc. Cùng nhau, thị giác máy tính và NLU biến văn bản trực quan thành thông tin có ý nghĩa và có thể hành động được.
Kỹ thuật nhắc lệnh (Prompt engineering)#
Prompt engineering là quá trình thiết kế các câu lệnh đầu vào rõ ràng, chính xác và chi tiết nhằm định hướng các hệ thống generative AI, chẳng hạn như các large language models (LLMs) và vision-language models (VLMs), tạo ra các kết quả mong muốn. Những câu lệnh này đóng vai trò như các hướng dẫn giúp mô hình AI hiểu được ý định của người dùng.
Prompt engineering hiệu quả đòi hỏi phải hiểu rõ năng lực của mô hình và tạo ra các đầu vào tối đa hóa khả năng tạo ra các phản hồi chính xác, sáng tạo hoặc sâu sắc của mô hình đó. Điều này đặc biệt quan trọng đối với các AI models hoạt động với cả văn bản và hình ảnh.
Lấy mô hình DALL·E của OpenAI's làm ví dụ. Nếu bạn yêu cầu nó tạo ra “một bức ảnh chân thực của một phi hành gia đang cưỡi ngựa,” nó có thể tạo ra chính xác nội dung đó dựa trên mô tả của bạn. Kỹ năng này cực kỳ hữu ích trong các lĩnh vực như graphic design, nơi các chuyên gia có thể nhanh chóng biến các ý tưởng bằng văn bản thành bản mẫu trực quan, giúp tiết kiệm thời gian và nâng cao năng suất.

Fig 4. Một hình ảnh được tạo ra bằng DALL-E của OpenAI.
Bạn có thể tự hỏi điều này liên quan thế nào đến computer vision - chẳng phải đây chỉ là generative AI sao? Trên thực tế, hai lĩnh vực này có mối liên hệ mật thiết với nhau. Generative AI được xây dựng dựa trên nền tảng của computer vision để tạo ra các kết quả trực quan hoàn toàn mới.
Generative AI models chuyên tạo ra hình ảnh từ các câu lệnh văn bản được huấn luyện trên các tập dữ liệu lớn gồm các hình ảnh đi kèm với mô tả dạng văn bản. Điều này cho phép chúng học hỏi mối quan hệ giữa ngôn ngữ và các khái niệm trực quan như đối tượng, kết cấu và quan hệ không gian.
Các mô hình này không diễn giải dữ liệu trực quan theo cách giống như các hệ thống computer vision truyền thống, chẳng hạn như recognizing objects trong hình ảnh thực tế. Thay vào đó, chúng sử dụng sự thấu hiểu đã học được về các khái niệm này để tạo ra các hình ảnh trực quan mới dựa trên câu lệnh. Bằng cách kết hợp kiến thức này với các câu lệnh được biên soạn kỹ lưỡng, generative AI có thể tạo ra những hình ảnh chân thực và chi tiết khớp với đầu vào của người dùng.
Trả lời câu hỏi (QA)#
Các hệ thống Question-answering được thiết kế để hiểu các câu hỏi bằng ngôn ngữ tự nhiên và cung cấp câu trả lời chính xác, phù hợp. Chúng sử dụng các kỹ thuật như truy xuất thông tin, thấu hiểu ngữ nghĩa và deep learning để diễn giải và phản hồi các truy vấn.
Các mô hình tiên tiến như OpenAI’s GPT-4o có thể xử lý tác vụ trả lời câu hỏi dựa trên hình ảnh (VQA), nghĩa là chúng có thể phân tích và trả lời các câu hỏi về hình ảnh. Tuy nhiên, GPT-4o không trực tiếp thực hiện các computer vision tasks. Thay vào đó, mô hình này sử dụng một bộ mã hóa hình ảnh chuyên dụng để xử lý ảnh, extract features, và kết hợp chúng với khả năng hiểu ngôn ngữ để đưa ra câu trả lời.

Hình 5. Khả năng trả lời câu hỏi trực quan của ChatGPT. Hình ảnh do tác giả cung cấp.
Các hệ thống khác có thể tiến xa hơn một bước bằng cách tích hợp toàn diện computer vision capabilities. Các hệ thống này có thể trực tiếp phân tích hình ảnh hoặc video để nhận diện đối tượng, bối cảnh hoặc văn bản. Khi kết hợp với xử lý ngôn ngữ tự nhiên, chúng có thể xử lý các câu hỏi phức tạp hơn về nội dung trực quan. Ví dụ, chúng có thể trả lời câu hỏi như “Có những đối tượng nào trong bức ảnh này?” hoặc “Ai có mặt trong đoạn phim này?” bằng cách phát hiện và diễn giải các thành phần trực quan.
Học không mẫu (Zero-Shot Learning - ZSL)#
Zero-shot learning (ZSL) là một phương pháp machine learning cho phép các mô hình AI xử lý các tác vụ mới, chưa từng thấy mà không cần phải được huấn luyện chuyên biệt về các tác vụ đó. Phương pháp này thực hiện điều đó bằng cách sử dụng thông tin bổ sung, chẳng hạn như mô tả hoặc mối quan hệ ngữ nghĩa, để kết nối những gì mô hình đã biết (các lớp đã thấy) với các danh mục mới, chưa từng thấy.
Trong xử lý ngôn ngữ tự nhiên, ZSL giúp các mô hình hiểu và làm việc với các chủ đề mà chúng chưa từng được huấn luyện bằng cách dựa vào mối quan hệ giữa các từ và khái niệm. Tương tự, trong computer vision, ZSL cho phép các mô hình recognize objects hoặc bối cảnh mà chúng chưa từng gặp trước đây bằng cách liên kết các đặc trưng trực quan, chẳng hạn như đôi cánh hoặc lông vũ, với các khái niệm đã biết, ví dụ như birds.
ZSL kết nối NLP và CV bằng cách kết hợp hiểu ngôn ngữ với nhận dạng trực quan, làm cho nó đặc biệt hữu ích cho các tác vụ liên quan đến cả hai. Ví dụ, trong trả lời câu hỏi trực quan, một mô hình có thể phân tích hình ảnh trong khi hiểu một câu hỏi liên quan để cung cấp câu trả lời chính xác. Nó cũng hữu ích cho các tác vụ như chú thích ảnh.
Các điểm chính cần lưu ý#
Việc kết hợp xử lý ngôn ngữ tự nhiên và computer vision đã dẫn đến các hệ thống AI có khả năng hiểu cả văn bản lẫn hình ảnh. Sự kết hợp này đang được ứng dụng trong nhiều ngành công nghiệp, từ việc giúp xe tự lái đọc biển báo giao thông cho đến cải thiện chẩn đoán y tế và làm cho mạng xã hội trở nên an toàn hơn. Khi các công nghệ này ngày càng phát triển, chúng sẽ tiếp tục đơn giản hóa cuộc sống và mở ra những cơ hội mới trong rất nhiều lĩnh vực. Để tìm hiểu thêm, hãy truy cập GitHub repository của chúng tôi và tham gia cùng community của chúng tôi. Khám phá các ứng dụng AI trong self-driving cars và agriculture trên các trang giải pháp của chúng tôi. 🚀






