Experimenta o Google Gemini 2.5 em tarefas de visão computacional
Vê como podes experimentar o Google Gemini 2.5 em tarefas de visão computacional, como deteção de objetos, criação de legendas para imagens e OCR, para soluções de IA de visão.

Os avanços na IA estão a acontecer rapidamente, com novas inovações a serem notícia quase todos os dias. Um desses avanços recentes é o Gemini 2.5, o mais recente modelo multimodal da Google DeepMind, lançado a 26 de março. Embora os modelos de linguagem de grande escala (LLMs) tradicionais possam aprender com enormes quantidades de dados para gerar texto semelhante ao humano, o Gemini 2.5 vai além disso.
Foi concebido como um “modelo de raciocínio” capaz de processar imagens, áudio e vídeo. Tem capacidades aprimoradas de raciocínio e programação. Curiosamente, também apresenta um desempenho excecional em tarefas de visão computacional, nas quais as máquinas interpretam e analisam dados visuais, como deteção de objetos, geração de legendas para imagens e reconhecimento ótico de caracteres (OCR).

Fig. 1. Um exemplo de utilização do Gemini 2.5 para compreender o conteúdo de uma imagem.
Neste artigo, vamos explorar um dos notebooks da Ultralytics que pode ajudar-te a experimentar na prática as capacidades de visão computacional do Gemini 2.5. Também vamos analisar mais detalhadamente as principais funcionalidades do Gemini 2.5 e mostrar como pode ser utilizado para criar soluções de visão computacional para aplicações do mundo real. Vamos começar!
Visão geral do Gemini 2.5: funcionalidades e capacidades#
A primeira versão da série de modelos Gemini 2.5 a ser lançada é uma versão experimental do Gemini 2.5 Pro. Foi concebida para lidar com problemas complexos, refletindo sobre as respostas antes de dar uma resposta. Utiliza métodos como a aprendizagem por reforço (em que o modelo aprende com base no feedback) e a geração de prompts com cadeia de pensamento (uma abordagem passo a passo para resolver problemas).
Uma das suas principais funcionalidades é a enorme janela de contexto, que pode conter 1 milhão de tokens (aproximadamente um milhão de palavras ou partes de palavras) e deverá aumentar para 2 milhões. Isto significa que o modelo pode receber muitas informações de uma só vez, produzindo resultados mais detalhados e precisos.
Além de processar linguagem, o Gemini 2.5 pode ser utilizado para as seguintes tarefas de visão computacional:
-
Deteção de objetos: é o processo de identificar e localizar objetos numa imagem. Pode ser utilizada em aplicações como vigilância ou carros autónomos.
-
Geração de legendas para imagens: esta tarefa envolve gerar um texto descritivo para uma imagem. Torna o conteúdo visual mais acessível e fácil de compreender.
-
Reconhecimento ótico de caracteres: esta tecnologia converte o texto encontrado em imagens em texto editável e legível por máquinas. É útil para digitalizar documentos e automatizar a introdução de dados.
Avaliação comparativa e comparação do Google Gemini 2.5 com outros modelos#
Atualmente, existem vários modelos multimodais disponíveis no setor da IA, por isso é importante compreender como o Gemini 2.5 Pro se compara com eles. Com base nos resultados de avaliações comparativas partilhados pela DeepMind da Google, o Gemini 2.5 Pro apresenta um desempenho impressionante numa ampla variedade de tarefas.
Por exemplo, no teste chamado Humanity’s Last Exam, que simula um exame desafiante abrangendo muitas disciplinas e avalia o raciocínio avançado e o conhecimento geral, o Gemini 2.5 Pro obtém cerca de 18,8%, superando modelos como o o3-mini da OpenAI, que obtém aproximadamente 14%.

Fig. 2. Visão geral do desempenho do Gemini 2.5 Pro em avaliações comparativas.
Também apresenta um desempenho muito bom em desafios de matemática e programação, igualando ou superando frequentemente o desempenho de modelos como o GPT-4.5 da OpenAI, o Claude 3.7 Sonnet, o Grok 3 Beta e o DeepSeek R1, demonstrando a sua capacidade de lidar com tarefas complexas e processar grandes quantidades de dados.
Experimenta o Gemini 2.5 na prática: como utilizar a API do Google Gemini#
O Gemini 2.5 Pro está disponível em várias plataformas. Podes experimentá-lo no Google AI Studio e aceder-lhe através da aplicação Gemini, caso tenhas o Gemini Advanced. No anúncio de lançamento, a Google DeepMind também mencionou que o modelo será brevemente suportado no Vertex AI. Estes pontos de acesso facilitam a utilização do Gemini 2.5 Pro por parte dos programadores em aplicações de IA do mundo real.
No entanto, se quiseres utilizar a API do Google Gemini e começar em apenas alguns minutos, sem uma configuração complicada, e quiseres compreender melhor as suas capacidades de visão computacional, consulta o notebook da Ultralytics, que demonstra tarefas como deteção de objetos e geração de legendas para imagens com o Gemini 2.5 Pro. Vamos explorar detalhadamente o que podes esperar do notebook.
Configuração da inferência com o notebook do Google Gemini 2.5#
Para começar a utilizar o notebook da Ultralytics e o Google Gemini 2.5, primeiro tens de gerar uma chave de API através do Google AI Studio. Esta chave dá-te acesso à API do Gemini, para que possas utilizar o modelo.
Depois de obteres a chave de API, certifica-te de que o teu ambiente tem as bibliotecas necessárias instaladas — incluindo pacotes da Ultralytics e o kit de ferramentas de IA da Google. Este passo está claramente explicado no notebook, para que possas seguir facilmente as instruções e configurar o teu espaço de trabalho.
Com tudo configurado, podes ligar-te à API do Gemini introduzindo a tua chave de API (como mostrado abaixo), o que cria uma ligação entre o teu espaço de trabalho e o modelo. Depois disso, estarás pronto para enviar imagens e prompts de texto ao Gemini 2.5.
Essencialmente, podes fornecer uma imagem e uma instrução simples (como “deteta objetos nesta imagem” ou “descreve o que vês”) ao modelo, que devolve os resultados de que precisas. Este processo simples facilita a exploração das capacidades de visão computacional do Gemini 2.5.
Deteção de objetos com o Google Gemini 2.5#
Um dos principais exemplos no notebook é a deteção de objetos com o Gemini 2.5 Pro. Neste exemplo, forneces ao modelo uma imagem e um prompt simples para detetar objetos.
O modelo processa a imagem e devolve um conjunto de coordenadas e etiquetas para cada objeto encontrado; estas coordenadas são fornecidas de forma normalizada. Em seguida, são utilizadas funções do pacote Python da Ultralytics para converter estes valores normalizados de modo a corresponderem às dimensões reais da imagem e desenhar caixas delimitadoras claras à volta de cada objeto, como mostrado abaixo.

Fig. 3. Utilizar o Google Gemini 2.5 para deteção de objetos.
Geração de legendas para imagens com o Gemini 2.5#
Outro exemplo interessante no notebook é a geração de legendas para imagens com o Gemini 2.5 Pro. Neste exemplo, forneces ao modelo uma imagem e um prompt que lhe pede para gerar uma legenda detalhada que descreva o que está na imagem.
O modelo analisa então o conteúdo visual e devolve uma narrativa, frequentemente formatada como várias frases, que capta tanto o conteúdo como o contexto da imagem. Esta funcionalidade é útil para melhorar a acessibilidade, resumir informações visuais e até enriquecer a narrativa criativa.
Melhorar a precisão do OCR com os modelos Google Gemini#
Uma tarefa de visão computacional que utiliza a capacidade do Gemini 2.5 Pro para ler texto em imagens é o OCR. No notebook, podes fornecer ao modelo uma imagem que contenha texto, juntamente com um prompt para extrair esse texto. O modelo processa a imagem e devolve tanto o texto detetado como as coordenadas onde o texto está localizado, como mostrado abaixo.
Em seguida, são utilizadas funções do pacote Python da Ultralytics para converter estas coordenadas normalizadas nas dimensões reais da imagem e desenhar caixas delimitadoras à volta das regiões de texto. Este resultado anotado mostra claramente onde o texto está localizado, sendo útil para digitalizar documentos, automatizar a introdução de dados e melhorar a acessibilidade.

Fig. 4. Extrair dados textuais de uma imagem com o Google Gemini 2.5.
Aplicações do Google Gemini 2.5 no mundo real#
Agora que explorámos como o Google Gemini 2.5 Pro pode ser utilizado em várias tarefas de visão computacional, vamos conhecer algumas aplicações do mundo real em que estas capacidades podem ser utilizadas.
A capacidade de deteção de objetos do Gemini 2.5 Pro, por exemplo, pode ajudar a etiquetar e organizar automaticamente grandes conjuntos de imagens, tornando tarefas como a criação de conjuntos de dados ou a gestão de conteúdos muito mais rápidas. Também pode ser utilizado para analisar imagens em áreas como o comércio e a agricultura — por exemplo, para detetar produtos nas prateleiras ou identificar sinais de stress nas culturas em fotografias de campos agrícolas.

Fig. 5. Gemini 2.5 Pro a analisar a saúde de uma planta.
Entretanto, a funcionalidade de geração de legendas para imagens do modelo pode ajudar pessoas com deficiência visual a compreender o que está numa imagem. Por exemplo, se tiveres uma fotografia de uma rua movimentada, o modelo poderá produzir uma legenda que descreva detalhadamente a cena, mencionando os tipos de veículos, a atividade dos peões e até a hora do dia com base nos indícios de iluminação.
Além disso, a funcionalidade de OCR do Gemini 2.5 pode ser utilizada numa variedade de aplicações. Por exemplo, podes digitalizar documentos impressos através da digitalização de páginas ou recibos. Esta capacidade é ideal para automatizar tarefas de introdução de dados, processar formulários ou até ler texto de cartões de visita e sinalética.
De um modo geral, o Google Gemini 2.5 Pro abre caminho a uma ampla variedade de aplicações práticas de IA.
Principais conclusões#
Para além de gerar e analisar texto, o Google Gemini 2.5 Pro pode ser utilizado em tarefas de visão computacional, como deteção de objetos, geração de legendas para imagens e OCR. Com a sua enorme janela de contexto e capacidades aprimoradas de raciocínio, produz resultados detalhados e conscientes do contexto, que funcionam bem em cenários do mundo real.
À medida que os modelos de IA continuam a evoluir, ferramentas como o Gemini 2.5 Pro facilitam a resolução de problemas complexos em vários setores. É provável que assistamos a uma adoção ainda mais ampla da IA, à medida que mais organizações procuram soluções multimodais flexíveis capazes de lidar com uma grande variedade de tarefas, desde a compreensão visual ao processamento de linguagem.
Faz parte da nossa comunidade e aprende sobre projetos de IA de vanguarda no nosso repositório do GitHub. Conhece as aplicações da IA de visão na agricultura e o papel da IA na indústria nas nossas páginas de soluções. Explora os nossos planos de licenciamento e cria soluções de visão computacional hoje!









