Thực hành với Google Gemini 2.5 cho các tác vụ computer vision
Tìm hiểu cách thực hành với Google Gemini 2.5 cho các tác vụ computer vision như phát hiện đối tượng, tạo caption cho ảnh và OCR trong các giải pháp Vision AI.

AI đang phát triển nhanh chóng, với những đổi mới mới liên tục xuất hiện trên các tiêu đề gần như mỗi ngày. Một đột phá gần đây là Gemini 2.5, model đa phương thức mới nhất của Google DeepMind, được ra mắt vào ngày 26 tháng 3. Trong khi các mô hình ngôn ngữ lớn (LLMs) truyền thống có thể học từ lượng dữ liệu khổng lồ để tạo văn bản giống con người, Gemini 2.5 còn có khả năng vượt xa điều đó.
Model này được thiết kế như một “model tư duy”, có khả năng xử lý hình ảnh, âm thanh và video. Model sở hữu năng lực suy luận và lập trình được cải thiện. Đáng chú ý, model cũng hoạt động rất hiệu quả trong các tác vụ thị giác máy tính, trong đó máy móc diễn giải và phân tích dữ liệu trực quan, chẳng hạn như phát hiện đối tượng, tạo chú thích hình ảnh và nhận dạng ký tự quang học (OCR).

Hình 1. Ví dụ về việc sử dụng Gemini 2.5 để hiểu nội dung của một hình ảnh.
Trong bài viết này, chúng ta sẽ tìm hiểu một trong các notebook của Ultralytics, có thể giúp bạn trải nghiệm thực tế các khả năng thị giác máy tính của Gemini 2.5. Chúng ta cũng sẽ xem xét kỹ hơn các tính năng chính của Gemini 2.5 và trình bày cách sử dụng model này để xây dựng giải pháp thị giác máy tính cho các ứng dụng thực tế. Hãy bắt đầu!
Tổng quan về Gemini 2.5: tính năng và khả năng#
Phiên bản đầu tiên trong dòng model Gemini 2.5 vừa được phát hành là bản thử nghiệm của Gemini 2.5 Pro. Model này được thiết kế để xử lý các vấn đề phức tạp bằng cách suy nghĩ về câu trả lời trước khi đưa ra đáp án. Model sử dụng các phương pháp như học tăng cường (trong đó model học từ phản hồi) và prompting theo chuỗi suy nghĩ (cách tiếp cận giải quyết vấn đề từng bước).
Một trong những tính năng chính của model là cửa sổ ngữ cảnh rất lớn, có thể chứa 1 triệu token (tương đương khoảng một triệu từ hoặc phần của từ) và dự kiến sẽ tăng lên 2 triệu. Điều này cho phép model tiếp nhận nhiều thông tin cùng lúc, tạo ra kết quả chi tiết và chính xác hơn.
Ngoài việc xử lý ngôn ngữ, Gemini 2.5 có thể được sử dụng cho các tác vụ thị giác máy tính sau:
-
Phát hiện đối tượng: Đây là quá trình xác định và định vị các đối tượng trong một hình ảnh. Tính năng này có thể được sử dụng trong các ứng dụng như giám sát hoặc xe tự lái.
-
Tạo chú thích hình ảnh: Tác vụ này bao gồm việc tạo văn bản mô tả cho một hình ảnh. Tính năng này giúp nội dung trực quan trở nên dễ tiếp cận và dễ hiểu hơn.
-
Nhận dạng ký tự quang học: Công nghệ này chuyển đổi văn bản trong hình ảnh thành văn bản có thể chỉnh sửa và máy đọc được. Công nghệ này hữu ích cho việc số hóa tài liệu và tự động hóa nhập dữ liệu.
Đánh giá benchmark và so sánh Google Gemini 2.5 với các model khác#
Hiện nay có nhiều model đa phương thức trong lĩnh vực AI, vì vậy việc hiểu Gemini 2.5 Pro so sánh với các model đó như thế nào là rất quan trọng. Dựa trên kết quả benchmark do DeepMind của Google công bố, Gemini 2.5 Pro cho thấy hiệu năng ấn tượng trên nhiều nhóm tác vụ.
Ví dụ, trong bài kiểm tra có tên Humanity’s Last Exam, mô phỏng một kỳ thi khó bao quát nhiều môn học và đánh giá năng lực suy luận nâng cao cùng kiến thức tổng quát, Gemini 2.5 Pro đạt khoảng 18,8%, vượt qua các model như o3-mini của OpenAI, đạt khoảng 14%.

Hình 2. Tổng quan về hiệu năng benchmark của Gemini 2.5 Pro.
Model này cũng hoạt động rất tốt trong các thử thách về toán học và lập trình, thường đạt hoặc vượt hiệu năng của các model như OpenAI GPT-4.5, Claude 3.7 Sonnet, Grok 3 Beta và DeepSeek R1, cho thấy khả năng xử lý các tác vụ phức tạp và lượng dữ liệu lớn.
Trải nghiệm thực tế Gemini 2.5: Cách sử dụng Google Gemini API#
Gemini 2.5 Pro hiện có trên nhiều nền tảng. Bạn có thể thử nghiệm model này trong Google AI Studio và truy cập thông qua ứng dụng Gemini nếu là người dùng Gemini Advanced. Trong thông báo ra mắt, Google DeepMind cũng cho biết model sẽ sớm được hỗ trợ trên Vertex AI. Các phương thức truy cập này giúp developer dễ dàng sử dụng Gemini 2.5 Pro cho các ứng dụng AI thực tế.
Tuy nhiên, nếu bạn muốn sử dụng Google Gemini API và bắt đầu chỉ trong vài phút mà không cần thiết lập phức tạp, đồng thời muốn hiểu rõ hơn về các khả năng thị giác máy tính của model, bạn có thể xem notebook của Ultralytics, trình bày các tác vụ như phát hiện đối tượng và tạo chú thích hình ảnh bằng Gemini 2.5 Pro. Hãy cùng tìm hiểu chi tiết những gì bạn có thể mong đợi trong notebook.
Thiết lập inferencing với notebook Google Gemini 2.5#
Để bắt đầu với notebook của Ultralytics và sử dụng Google Gemini 2.5, trước tiên bạn cần tạo API key thông qua Google AI Studio. Key này cung cấp quyền truy cập vào Gemini API để bạn có thể sử dụng model.
Sau khi có API key, hãy đảm bảo môi trường của bạn đã cài đặt các thư viện cần thiết, bao gồm các package từ Ultralytics và bộ công cụ AI của Google. Bước này được trình bày rõ ràng trong notebook, vì vậy bạn có thể dễ dàng làm theo hướng dẫn để thiết lập workspace.
Sau khi cấu hình xong mọi thứ, bạn có thể kết nối với Gemini API bằng cách nhập API key (như minh họa bên dưới), qua đó tạo liên kết giữa workspace và model. Sau đó, bạn sẽ sẵn sàng gửi hình ảnh và prompt văn bản đến Gemini 2.5.
Về cơ bản, bạn có thể cung cấp một hình ảnh và một hướng dẫn đơn giản (chẳng hạn như “phát hiện các đối tượng trong hình ảnh này” hoặc “mô tả những gì bạn nhìn thấy”) cho model, rồi model sẽ trả về kết quả bạn cần. Quy trình đơn giản này giúp bạn dễ dàng bắt đầu khám phá các khả năng thị giác máy tính của Gemini 2.5.
Phát hiện đối tượng với Google Gemini 2.5#
Một trong những ví dụ chính trong notebook là phát hiện đối tượng bằng Gemini 2.5 Pro. Trong ví dụ này, bạn cung cấp cho model một hình ảnh và một prompt đơn giản để phát hiện các đối tượng.
Model xử lý hình ảnh và trả về một tập hợp tọa độ cùng nhãn cho từng đối tượng tìm được; các tọa độ này được cung cấp ở dạng chuẩn hóa. Sau đó, các hàm từ package Python của Ultralytics được sử dụng để chuyển đổi các giá trị chuẩn hóa này cho khớp với kích thước thực tế của hình ảnh và vẽ các bounding box rõ ràng quanh từng đối tượng, như minh họa bên dưới.

Hình 3. Sử dụng Google Gemini 2.5 để phát hiện đối tượng.
Tạo chú thích hình ảnh bằng Gemini 2.5#
Một ví dụ thú vị khác trong notebook là tạo chú thích hình ảnh bằng Gemini 2.5 Pro. Trong ví dụ này, bạn cung cấp cho model một hình ảnh và một prompt yêu cầu tạo chú thích chi tiết mô tả nội dung trong hình ảnh.
Sau đó, model phân tích nội dung trực quan và trả về một phần mô tả, thường được định dạng thành nhiều câu, thể hiện cả nội dung lẫn ngữ cảnh của hình ảnh. Tính năng này hữu ích trong việc cải thiện khả năng tiếp cận, tóm tắt thông tin trực quan và thậm chí nâng cao hoạt động kể chuyện sáng tạo.
Cải thiện độ chính xác của OCR với các model Google Gemini#
Một tác vụ thị giác máy tính tận dụng khả năng đọc văn bản trong hình ảnh của Gemini 2.5 Pro là OCR. Trong notebook, bạn có thể cung cấp cho model một hình ảnh chứa văn bản cùng với prompt yêu cầu trích xuất văn bản đó. Model xử lý hình ảnh và trả về cả văn bản được phát hiện lẫn tọa độ vị trí của văn bản, như minh họa bên dưới.
Sau đó, các hàm từ package Python của Ultralytics được sử dụng để chuyển đổi các tọa độ chuẩn hóa này sang kích thước thực tế của hình ảnh và vẽ bounding box quanh các vùng văn bản. Kết quả được chú thích này cho biết rõ vị trí của văn bản, hữu ích cho việc số hóa tài liệu, tự động hóa nhập dữ liệu và cải thiện khả năng tiếp cận.

Hình 4. Trích xuất dữ liệu văn bản trong hình ảnh bằng Google Gemini 2.5.
Các ứng dụng thực tế của Google Gemini 2.5#
Sau khi tìm hiểu cách sử dụng Google Gemini 2.5 Pro cho nhiều tác vụ thị giác máy tính, hãy cùng khám phá một số ứng dụng thực tế có thể tận dụng các khả năng này.
Chẳng hạn, khả năng phát hiện đối tượng của Gemini 2.5 Pro có thể giúp tự động gắn nhãn và sắp xếp các tập hợp hình ảnh lớn, khiến những tác vụ như tạo dataset hoặc quản lý nội dung trở nên nhanh hơn nhiều. Model cũng có thể được sử dụng để phân tích hình ảnh trong các lĩnh vực như bán lẻ và nông nghiệp, chẳng hạn như phát hiện sản phẩm trên kệ hoặc xác định dấu hiệu cây trồng bị stress trong ảnh chụp tại trang trại.

Hình 5. Gemini 2.5 Pro phân tích tình trạng của một cây.
Trong khi đó, tính năng tạo chú thích hình ảnh của model có thể giúp người khiếm thị hiểu nội dung trong một hình ảnh. Ví dụ, nếu bạn có ảnh một con phố đông đúc, model có thể tạo chú thích mô tả chi tiết khung cảnh, đề cập đến các loại phương tiện, hoạt động của người đi bộ và thậm chí cả thời điểm trong ngày dựa trên các dấu hiệu về ánh sáng.
Ngoài ra, chức năng OCR của Gemini 2.5 có thể được sử dụng trong nhiều ứng dụng. Ví dụ, bạn có thể số hóa tài liệu in bằng cách quét các trang giấy hoặc hóa đơn. Khả năng này lý tưởng cho việc tự động hóa các tác vụ nhập dữ liệu, xử lý biểu mẫu hoặc thậm chí đọc văn bản từ danh thiếp và biển hiệu.
Nhìn chung, Google Gemini 2.5 Pro mở ra nhiều ứng dụng AI thực tiễn.
Những điểm chính#
Không chỉ tạo và phân tích văn bản, Google Gemini 2.5 Pro còn có thể được sử dụng cho các tác vụ thị giác máy tính như phát hiện đối tượng, tạo chú thích hình ảnh và OCR. Với cửa sổ ngữ cảnh khổng lồ cùng khả năng suy luận được cải thiện, model tạo ra các kết quả chi tiết, nhận biết ngữ cảnh và hoạt động hiệu quả trong các tình huống thực tế.
Khi các model AI tiếp tục phát triển, những công cụ như Gemini 2.5 Pro đang giúp giải quyết các vấn đề phức tạp trong nhiều ngành dễ dàng hơn. Nhiều khả năng AI sẽ được áp dụng rộng rãi hơn khi ngày càng có nhiều tổ chức tìm kiếm các giải pháp đa phương thức linh hoạt, có thể xử lý nhiều loại tác vụ, từ hiểu nội dung trực quan đến xử lý ngôn ngữ.
Trở thành một phần của cộng đồng của chúng tôi và tìm hiểu về các dự án AI tiên tiến trên repository GitHub của chúng tôi. Xem các ứng dụng của Vision AI trong nông nghiệp và vai trò của AI trong sản xuất trên các trang giải pháp của chúng tôi. Khám phá các gói cấp phép của chúng tôi và xây dựng giải pháp thị giác máy tính ngay hôm nay!









