Ultralytics YOLO27:
IA para visão

Experimenta o Google Gemini 2.5 em tarefas de visão computacional

Vê como podes experimentar o Google Gemini 2.5 em tarefas de visão computacional, como deteção de objetos, criação de legendas para imagens e OCR, para soluções de IA de visão.

ABAbirami Vina9 min read
Utilizar o Google Gemini 2.5 para tarefas de visão computacional

Os avanços na IA estão a acontecer rapidamente, com novas inovações a serem notícia quase todos os dias. Um desses avanços recentes é o Gemini 2.5, o mais recente modelo multimodal da Google DeepMind, lançado a 26 de março. Embora os modelos de linguagem de grande escala (LLMs) tradicionais possam aprender com enormes quantidades de dados para gerar texto semelhante ao humano, o Gemini 2.5 vai além disso.

Foi concebido como um “modelo de raciocínio” capaz de processar imagens, áudio e vídeo. Tem capacidades aprimoradas de raciocínio e programação. Curiosamente, também apresenta um desempenho excecional em tarefas de visão computacional, nas quais as máquinas interpretam e analisam dados visuais, como deteção de objetos, geração de legendas para imagens e reconhecimento ótico de caracteres (OCR).

Utilizar o Gemini 2.5 para compreender o conteúdo de uma imagem

Fig. 1. Um exemplo de utilização do Gemini 2.5 para compreender o conteúdo de uma imagem.

Neste artigo, vamos explorar um dos notebooks da Ultralytics que pode ajudar-te a experimentar na prática as capacidades de visão computacional do Gemini 2.5. Também vamos analisar mais detalhadamente as principais funcionalidades do Gemini 2.5 e mostrar como pode ser utilizado para criar soluções de visão computacional para aplicações do mundo real. Vamos começar!

Visão geral do Gemini 2.5: funcionalidades e capacidades#

A primeira versão da série de modelos Gemini 2.5 a ser lançada é uma versão experimental do Gemini 2.5 Pro. Foi concebida para lidar com problemas complexos, refletindo sobre as respostas antes de dar uma resposta. Utiliza métodos como a aprendizagem por reforço (em que o modelo aprende com base no feedback) e a geração de prompts com cadeia de pensamento (uma abordagem passo a passo para resolver problemas).

Uma das suas principais funcionalidades é a enorme janela de contexto, que pode conter 1 milhão de tokens (aproximadamente um milhão de palavras ou partes de palavras) e deverá aumentar para 2 milhões. Isto significa que o modelo pode receber muitas informações de uma só vez, produzindo resultados mais detalhados e precisos.

Além de processar linguagem, o Gemini 2.5 pode ser utilizado para as seguintes tarefas de visão computacional:

  • Deteção de objetos: é o processo de identificar e localizar objetos numa imagem. Pode ser utilizada em aplicações como vigilância ou carros autónomos.

  • Geração de legendas para imagens: esta tarefa envolve gerar um texto descritivo para uma imagem. Torna o conteúdo visual mais acessível e fácil de compreender.

  • Reconhecimento ótico de caracteres: esta tecnologia converte o texto encontrado em imagens em texto editável e legível por máquinas. É útil para digitalizar documentos e automatizar a introdução de dados.

Avaliação comparativa e comparação do Google Gemini 2.5 com outros modelos#

Atualmente, existem vários modelos multimodais disponíveis no setor da IA, por isso é importante compreender como o Gemini 2.5 Pro se compara com eles. Com base nos resultados de avaliações comparativas partilhados pela DeepMind da Google, o Gemini 2.5 Pro apresenta um desempenho impressionante numa ampla variedade de tarefas.

Por exemplo, no teste chamado Humanity’s Last Exam, que simula um exame desafiante abrangendo muitas disciplinas e avalia o raciocínio avançado e o conhecimento geral, o Gemini 2.5 Pro obtém cerca de 18,8%, superando modelos como o o3-mini da OpenAI, que obtém aproximadamente 14%.

Visão geral do desempenho do Gemini 2.5 Pro em avaliações comparativas

Fig. 2. Visão geral do desempenho do Gemini 2.5 Pro em avaliações comparativas.

Também apresenta um desempenho muito bom em desafios de matemática e programação, igualando ou superando frequentemente o desempenho de modelos como o GPT-4.5 da OpenAI, o Claude 3.7 Sonnet, o Grok 3 Beta e o DeepSeek R1, demonstrando a sua capacidade de lidar com tarefas complexas e processar grandes quantidades de dados.

Experimenta o Gemini 2.5 na prática: como utilizar a API do Google Gemini#

O Gemini 2.5 Pro está disponível em várias plataformas. Podes experimentá-lo no Google AI Studio e aceder-lhe através da aplicação Gemini, caso tenhas o Gemini Advanced. No anúncio de lançamento, a Google DeepMind também mencionou que o modelo será brevemente suportado no Vertex AI. Estes pontos de acesso facilitam a utilização do Gemini 2.5 Pro por parte dos programadores em aplicações de IA do mundo real.

No entanto, se quiseres utilizar a API do Google Gemini e começar em apenas alguns minutos, sem uma configuração complicada, e quiseres compreender melhor as suas capacidades de visão computacional, consulta o notebook da Ultralytics, que demonstra tarefas como deteção de objetos e geração de legendas para imagens com o Gemini 2.5 Pro. Vamos explorar detalhadamente o que podes esperar do notebook.

Configuração da inferência com o notebook do Google Gemini 2.5#

Para começar a utilizar o notebook da Ultralytics e o Google Gemini 2.5, primeiro tens de gerar uma chave de API através do Google AI Studio. Esta chave dá-te acesso à API do Gemini, para que possas utilizar o modelo.

Depois de obteres a chave de API, certifica-te de que o teu ambiente tem as bibliotecas necessárias instaladas — incluindo pacotes da Ultralytics e o kit de ferramentas de IA da Google. Este passo está claramente explicado no notebook, para que possas seguir facilmente as instruções e configurar o teu espaço de trabalho.

Com tudo configurado, podes ligar-te à API do Gemini introduzindo a tua chave de API (como mostrado abaixo), o que cria uma ligação entre o teu espaço de trabalho e o modelo. Depois disso, estarás pronto para enviar imagens e prompts de texto ao Gemini 2.5.

Essencialmente, podes fornecer uma imagem e uma instrução simples (como “deteta objetos nesta imagem” ou “descreve o que vês”) ao modelo, que devolve os resultados de que precisas. Este processo simples facilita a exploração das capacidades de visão computacional do Gemini 2.5.

Deteção de objetos com o Google Gemini 2.5#

Um dos principais exemplos no notebook é a deteção de objetos com o Gemini 2.5 Pro. Neste exemplo, forneces ao modelo uma imagem e um prompt simples para detetar objetos.

O modelo processa a imagem e devolve um conjunto de coordenadas e etiquetas para cada objeto encontrado; estas coordenadas são fornecidas de forma normalizada. Em seguida, são utilizadas funções do pacote Python da Ultralytics para converter estes valores normalizados de modo a corresponderem às dimensões reais da imagem e desenhar caixas delimitadoras claras à volta de cada objeto, como mostrado abaixo.

Utilizar o Google Gemini 2.5 para deteção de objetos

Fig. 3. Utilizar o Google Gemini 2.5 para deteção de objetos.

Geração de legendas para imagens com o Gemini 2.5#

Outro exemplo interessante no notebook é a geração de legendas para imagens com o Gemini 2.5 Pro. Neste exemplo, forneces ao modelo uma imagem e um prompt que lhe pede para gerar uma legenda detalhada que descreva o que está na imagem.

O modelo analisa então o conteúdo visual e devolve uma narrativa, frequentemente formatada como várias frases, que capta tanto o conteúdo como o contexto da imagem. Esta funcionalidade é útil para melhorar a acessibilidade, resumir informações visuais e até enriquecer a narrativa criativa.

Melhorar a precisão do OCR com os modelos Google Gemini#

Uma tarefa de visão computacional que utiliza a capacidade do Gemini 2.5 Pro para ler texto em imagens é o OCR. No notebook, podes fornecer ao modelo uma imagem que contenha texto, juntamente com um prompt para extrair esse texto. O modelo processa a imagem e devolve tanto o texto detetado como as coordenadas onde o texto está localizado, como mostrado abaixo.

Em seguida, são utilizadas funções do pacote Python da Ultralytics para converter estas coordenadas normalizadas nas dimensões reais da imagem e desenhar caixas delimitadoras à volta das regiões de texto. Este resultado anotado mostra claramente onde o texto está localizado, sendo útil para digitalizar documentos, automatizar a introdução de dados e melhorar a acessibilidade.

Extrair dados textuais de uma imagem com o Google Gemini 2.5

Fig. 4. Extrair dados textuais de uma imagem com o Google Gemini 2.5.

Aplicações do Google Gemini 2.5 no mundo real#

Agora que explorámos como o Google Gemini 2.5 Pro pode ser utilizado em várias tarefas de visão computacional, vamos conhecer algumas aplicações do mundo real em que estas capacidades podem ser utilizadas.

A capacidade de deteção de objetos do Gemini 2.5 Pro, por exemplo, pode ajudar a etiquetar e organizar automaticamente grandes conjuntos de imagens, tornando tarefas como a criação de conjuntos de dados ou a gestão de conteúdos muito mais rápidas. Também pode ser utilizado para analisar imagens em áreas como o comércio e a agricultura — por exemplo, para detetar produtos nas prateleiras ou identificar sinais de stress nas culturas em fotografias de campos agrícolas.

Gemini 2.5 Pro a analisar a saúde de uma planta

Fig. 5. Gemini 2.5 Pro a analisar a saúde de uma planta.

Entretanto, a funcionalidade de geração de legendas para imagens do modelo pode ajudar pessoas com deficiência visual a compreender o que está numa imagem. Por exemplo, se tiveres uma fotografia de uma rua movimentada, o modelo poderá produzir uma legenda que descreva detalhadamente a cena, mencionando os tipos de veículos, a atividade dos peões e até a hora do dia com base nos indícios de iluminação.

Além disso, a funcionalidade de OCR do Gemini 2.5 pode ser utilizada numa variedade de aplicações. Por exemplo, podes digitalizar documentos impressos através da digitalização de páginas ou recibos. Esta capacidade é ideal para automatizar tarefas de introdução de dados, processar formulários ou até ler texto de cartões de visita e sinalética.

De um modo geral, o Google Gemini 2.5 Pro abre caminho a uma ampla variedade de aplicações práticas de IA.

Principais conclusões#

Para além de gerar e analisar texto, o Google Gemini 2.5 Pro pode ser utilizado em tarefas de visão computacional, como deteção de objetos, geração de legendas para imagens e OCR. Com a sua enorme janela de contexto e capacidades aprimoradas de raciocínio, produz resultados detalhados e conscientes do contexto, que funcionam bem em cenários do mundo real.

À medida que os modelos de IA continuam a evoluir, ferramentas como o Gemini 2.5 Pro facilitam a resolução de problemas complexos em vários setores. É provável que assistamos a uma adoção ainda mais ampla da IA, à medida que mais organizações procuram soluções multimodais flexíveis capazes de lidar com uma grande variedade de tarefas, desde a compreensão visual ao processamento de linguagem.

Faz parte da nossa comunidade e aprende sobre projetos de IA de vanguarda no nosso repositório do GitHub. Conhece as aplicações da IA de visão na agricultura e o papel da IA na indústria nas nossas páginas de soluções. Explora os nossos planos de licenciamento e cria soluções de visão computacional hoje!

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática