Coloque a mão na massa com o Google Gemini 2.5 para tarefas de visão computacional
Veja como você pode colocar a mão na massa com o Google Gemini 2.5 para tarefas de visão computacional, como detecção de objetos, legendagem de imagens e OCR para soluções de Vision AI.

Os avanços na IA estão a avançar rapidamente, com novas inovações a fazerem manchetes quase todos os dias. Um desses avanços recentes é o Gemini 2.5, o mais recente modelo multimodal da Google DeepMind, lançado a 26 de março. Enquanto os Large Language Models (LLMs) tradicionais conseguem aprender com quantidades massivas de dados para gerar texto semelhante ao humano, o Gemini 2.5 vai além disso.
Foi concebido como um "modelo de raciocínio" capaz de processar imagens, áudio e vídeo. Possui capacidades melhoradas de raciocínio e programação. Curiosamente, também apresenta um desempenho excecional em tarefas de visão computacional, onde as máquinas interpretam e analisam dados visuais, tais como deteção de objetos, legendagem de imagens e reconhecimento ótico de caracteres (OCR).

Fig 1. Um exemplo de uso do Gemini 2.5 para entender o conteúdo de uma imagem.
Neste artigo, vamos explorar um dos notebooks da Ultralytics que te pode ajudar a começar a utilizar as capacidades de visão computacional do Gemini 2.5. Também vamos analisar mais de perto as principais funcionalidades do Gemini 2.5 e mostrar como pode ser utilizado para criar soluções de visão computacional para aplicações do mundo real. Vamos começar!
Visão geral do Gemini 2.5: recursos e capacidades#
A primeira versão da série de modelos Gemini 2.5 que acabou de ser lançada é uma versão experimental do Gemini 2.5 Pro. Ele foi projetado para lidar com problemas complexos pensando em suas respostas antes de dar uma solução. Ele usa métodos como aprendizado por reforço (onde o modelo aprende com o feedback) e chain-of-thought prompting (uma abordagem passo a passo para resolver problemas).
Um de seus principais recursos é sua enorme janela de contexto, que pode armazenar 1 milhão de tokens (aproximadamente um milhão de palavras ou partes de palavras) e espera-se que cresça para 2 milhões. Isso significa que o modelo pode absorver muitas informações de uma só vez, levando a resultados mais detalhados e precisos.
Além de processar linguagem, o Gemini 2.5 pode ser usado para as seguintes tarefas de visão computacional:
-
Deteção de objetos: É o processo de identificar e localizar objetos dentro de uma imagem. Pode ser utilizada em aplicações como vigilância ou carros autónomos.
-
Legendagem de imagens: Esta tarefa envolve a geração de um texto descritivo para uma imagem. Ela torna o conteúdo visual mais acessível e fácil de entender.
-
Reconhecimento ótico de caracteres: Esta tecnologia converte texto encontrado em imagens num formato editável e legível por máquina. É útil para digitalizar documentos e automatizar a introdução de dados.
Benchmarking e comparação do Google Gemini 2.5 com outros modelos#
Existem vários modelos multimodais disponíveis no espaço de IA hoje, por isso é importante entender como o Gemini 2.5 Pro se compara a eles. Com base nos resultados de benchmarking compartilhados pelo Google DeepMind, o Gemini 2.5 Pro apresenta um desempenho impressionante em uma série de tarefas.
Por exemplo, em um teste chamado Humanity’s Last Exam, que simula um exame desafiador cobrindo muitos assuntos e testa raciocínio avançado e conhecimento geral, o Gemini 2.5 Pro pontua cerca de 18,8%, superando modelos como o o3-mini da OpenAI, que pontua cerca de 14%.

Fig 2. Uma visão geral do desempenho do Gemini 2.5 Pro em benchmarks.
Também apresenta um desempenho muito bom em desafios de matemática e programação, igualando ou superando frequentemente o desempenho de modelos como o OpenAI GPT-4.5, Claude 3.7 Sonnet, Grok 3 Beta e DeepSeek R1, demonstrando a sua capacidade para lidar com tarefas complexas e processar grandes quantidades de dados.
Colocando a mão na massa com o Gemini 2.5: Como usar a Google Gemini API#
O Gemini 2.5 Pro está disponível em várias plataformas. Você pode experimentar no Google AI Studio e acessá-lo através do aplicativo Gemini para usuários do Gemini Advanced. Em seu anúncio de lançamento, o Google DeepMind também mencionou que o modelo será suportado no Vertex AI em breve. Esses pontos de acesso facilitam para os desenvolvedores usarem o Gemini 2.5 Pro para aplicações de IA no mundo real.
No entanto, se quiseres utilizar a Google Gemini API e começar em poucos minutos sem configurações complicadas, e procuras obter uma melhor compreensão das suas capacidades de visão computacional, podes consultar o notebook da Ultralytics que demonstra tarefas como deteção de objetos e legendagem de imagens utilizando o Gemini 2.5 Pro. Vamos ver em detalhe o que podes esperar do notebook.
Configurando a inferência com o notebook do Google Gemini 2.5#
Para começares com o notebook da Ultralytics e utilizares o Google Gemini 2.5, primeiro precisas de gerar uma chave de API através do Google AI Studio. Esta chave dá-te acesso à Gemini API para que possas utilizar o modelo.
Assim que tiveres a tua chave de API, certifica-te de que o teu ambiente tem as bibliotecas necessárias instaladas — estas incluem pacotes da Ultralytics e o toolkit de IA da Google. Este passo está claramente descrito no notebook, para que possas seguir facilmente as instruções e configurar o teu espaço de trabalho.
Com tudo configurado, você pode se conectar à Gemini API inserindo sua chave de API (conforme mostrado abaixo), o que cria um link entre seu espaço de trabalho e o modelo. Depois disso, você estará pronto para enviar imagens e comandos de texto para o Gemini 2.5.
Essencialmente, você pode fornecer uma imagem e uma instrução simples (como "detecte objetos nesta imagem" ou "descreva o que você vê") para o modelo, e ele retorna os resultados de que você precisa. Esse processo direto facilita o início da exploração das capacidades de visão computacional do Gemini 2.5.
Detecção de objetos com o Google Gemini 2.5#
Um dos principais exemplos no notebook é a detecção de objetos usando o Gemini 2.5 Pro. Neste exemplo, você fornece ao modelo uma imagem e um comando simples para detectar objetos.
O modelo processa a imagem e devolve um conjunto de coordenadas e etiquetas para cada objeto que encontra; estas coordenadas são fornecidas em formato normalizado. As funções do pacote Python da Ultralytics são então utilizadas para converter estes valores normalizados de modo a corresponderem às dimensões reais da imagem e desenhar caixas delimitadoras claras à volta de cada objeto, conforme mostrado abaixo.

Fig 3. Usando o Google Gemini 2.5 para detecção de objetos.
Legendagem de imagens usando o Gemini 2.5#
Outro exemplo interessante no notebook é a legendagem de imagens utilizando o Gemini 2.5 Pro. Neste exemplo, forneces ao modelo uma imagem e um prompt a pedir-lhe para gerar uma legenda detalhada que descreva o que está na imagem.
O modelo então analisa o conteúdo visual e retorna uma narrativa, muitas vezes formatada como várias frases, que captura tanto o conteúdo quanto o contexto da imagem. Este recurso é útil para melhorar a acessibilidade, resumir informações visuais e até mesmo aprimorar a narrativa criativa.
Aprimorando a precisão do OCR com modelos do Google Gemini#
Uma tarefa de visão computacional que usa a capacidade do Gemini 2.5 Pro de ler texto em imagens é o OCR. No notebook, você pode fornecer ao modelo uma imagem contendo texto junto com um comando para extrair esse texto. O modelo processa a imagem e retorna tanto o texto detectado quanto as coordenadas onde o texto está localizado, como mostrado abaixo.
As funções do pacote Python da Ultralytics são então utilizadas para converter estas coordenadas normalizadas nas dimensões reais da imagem e desenhar caixas delimitadoras à volta das regiões de texto. Este resultado anotado torna claro onde o texto está localizado, o que é útil para digitalizar documentos, automatizar a introdução de dados e melhorar a acessibilidade.

Fig 4. Extraindo dados textuais em uma imagem usando o Google Gemini 2.5.
Aplicações do mundo real do Google Gemini 2.5#
Agora que percorremos como o Google Gemini 2.5 Pro pode ser usado para várias tarefas de visão computacional, vamos explorar algumas aplicações do mundo real onde esses recursos podem ser utilizados.
A capacidade de deteção de objetos do Gemini 2.5 Pro, por exemplo, pode ajudar a etiquetar e organizar automaticamente grandes conjuntos de imagens, tornando tarefas como a criação de conjuntos de dados ou a gestão de conteúdos muito mais rápidas. Também pode ser utilizada para analisar imagens em áreas como o retalho e a agricultura — por exemplo, detetar produtos nas prateleiras ou identificar sinais de stress nas culturas em fotografias de explorações agrícolas.

Fig 5. Gemini 2.5 Pro analisando a saúde de uma planta.
Enquanto isso, o recurso de legendagem de imagens do modelo pode ajudar usuários com deficiência visual a entender o que está em uma imagem. Por exemplo, se você tiver uma foto de uma rua movimentada, o modelo pode produzir uma legenda que descreve a cena em detalhes, mencionando os tipos de veículos, a atividade dos pedestres e até mesmo a hora do dia com base em pistas de iluminação.
Além disso, a funcionalidade de OCR do Gemini 2.5 pode ser usada em uma variedade de aplicações. Por exemplo, você pode digitalizar documentos impressos escaneando páginas ou recibos. Essa capacidade é ideal para automatizar tarefas de entrada de dados, processar formulários ou até mesmo ler texto de cartões de visita e sinalização.
No geral, o Google Gemini 2.5 Pro abre as portas para uma ampla gama de aplicações práticas de IA.
Principais pontos#
Indo além da geração e análise de texto, o Google Gemini 2.5 Pro pode ser usado para tarefas de visão computacional como detecção de objetos, legendagem de imagens e OCR. Com sua enorme janela de contexto e habilidades de raciocínio aprimoradas, ele produz resultados detalhados e conscientes do contexto que funcionam bem em cenários do mundo real.
À medida que os modelos de IA continuam a evoluir, ferramentas como o Gemini 2.5 Pro estão tornando mais fácil resolver problemas complexos em todos os setores. É provável que vejamos uma adoção ainda mais ampla da IA à medida que mais organizações buscam soluções multimodais flexíveis que possam lidar com uma ampla gama de tarefas, desde a compreensão visual até o processamento de linguagem.
Traz o teu contributo para a nossa comunidade e aprende sobre projetos de IA de última geração no nosso repositório do GitHub. Vê as aplicações da Vision AI na agricultura e o papel da IA na manufatura nas nossas páginas de soluções. Explora os nossos planos de licenciamento e cria soluções de visão computacional hoje mesmo!






