Ultralytics YOLO27:
IA para visão

PaliGemma 2 da Google: perspetivas sobre modelos VLM avançados

Acompanha-nos numa análise mais detalhada dos novos modelos de linguagem e visão da Google: PaliGemma 2. Estes modelos podem ajudar a compreender e analisar imagens e texto.

ABAbirami Vina9 min read
Modelo de linguagem e visão PaliGemma 2 da Google

Em 5 de dezembro de 2024, a Google apresentou o PaliGemma 2, a versão mais recente do seu avançado modelo de visão e linguagem (VLM). O PaliGemma 2 foi concebido para lidar com tarefas que combinam imagens e texto, como gerar legendas, responder a perguntas visuais e detetar objetos em imagens.

Baseado no PaliGemma original, que já era uma ferramenta sólida para gerar legendas multilingues e reconhecer objetos, o PaliGemma 2 traz várias melhorias importantes. Entre elas estão modelos maiores, suporte para imagens de maior resolução e melhor desempenho em tarefas visuais complexas. Estas atualizações tornam-no ainda mais flexível e eficaz para uma vasta gama de utilizações.

Neste artigo, vamos analisar mais detalhadamente o PaliGemma 2, incluindo o seu funcionamento, as suas principais funcionalidades e as aplicações em que se destaca. Vamos começar!

Do Gemma 2 ao PaliGemma 2#

O PaliGemma 2 baseia-se em duas tecnologias fundamentais: o codificador visual SigLIP e o modelo de linguagem Gemma 2. O codificador SigLIP processa dados visuais, como imagens ou vídeos, e divide-os em características que o modelo pode analisar. Entretanto, o Gemma 2 processa texto, permitindo que o modelo compreenda e gere texto multilingue. Juntos, formam um VLM concebido para interpretar e relacionar informações visuais e textuais de forma integrada.

O que torna o PaliGemma 2 um grande avanço é a sua escalabilidade e versatilidade. Ao contrário da versão original, o PaliGemma 2 está disponível em três tamanhos: 3 mil milhões (3B), 10 mil milhões (10B) e 28 mil milhões (28B) de parâmetros. Estes parâmetros funcionam como definições internas do modelo, ajudando-o a aprender e a processar dados de forma eficaz. Também suporta diferentes resoluções de imagem (por exemplo, 224 x 224 píxeis para tarefas rápidas e 896 x 896 para análises detalhadas), tornando-o adaptável a várias aplicações.

Uma visão geral do PaliGemma 2

Fig. 1 Uma visão geral do PaliGemma 2.

A integração das capacidades linguísticas avançadas do Gemma 2 com o processamento de imagens do SigLIP torna o PaliGemma 2 significativamente mais inteligente. Pode lidar com tarefas como:

  • Geração de legendas para imagens ou vídeos: o modelo pode gerar descrições textuais detalhadas de elementos visuais, sendo útil para criar legendas automaticamente.
  • Resposta a perguntas visuais: o PaliGemma 2 pode responder a perguntas com base em imagens, como identificar objetos, pessoas ou ações numa cena.
  • Reconhecimento de objetos: identifica e classifica objetos numa imagem, como distinguir entre um gato, uma mesa ou um carro numa fotografia.

O PaliGemma 2 vai além do processamento separado de imagens e texto: combina-os de formas significativas. Por exemplo, pode compreender relações numa cena, como reconhecer que «O gato está sentado na mesa», ou identificar objetos acrescentando contexto, como reconhecer um monumento famoso.

Como funcionam os modelos VLM PaliGemma 2 da Google#

De seguida, vamos analisar um exemplo que utiliza o gráfico apresentado na imagem abaixo para compreender melhor como o PaliGemma 2 processa dados visuais e textuais. Suponhamos que carregas este gráfico e perguntas ao modelo: «O que representa este gráfico?»

Um exemplo das capacidades do PaliGemma 2

Fig. 2 Um exemplo das capacidades do PaliGemma 2.

O processo começa com o codificador visual SigLIP do PaliGemma 2, que analisa imagens e extrai características importantes. No caso de um gráfico, isto inclui identificar elementos como eixos, pontos de dados e etiquetas. O codificador é treinado para captar tanto padrões gerais como detalhes precisos. Também utiliza reconhecimento ótico de caracteres (OCR) para detetar e processar qualquer texto incorporado na imagem. Estas características visuais são convertidas em tokens, que são representações numéricas que o modelo pode processar. De seguida, estes tokens são ajustados através de uma camada de projeção linear, uma técnica que garante que podem ser combinados facilmente com dados textuais.

Ao mesmo tempo, o modelo de linguagem Gemma 2 processa a consulta associada para determinar o seu significado e objetivo. O texto da consulta é convertido em tokens, que são combinados com os tokens visuais do SigLIP para criar uma representação multimodal, um formato unificado que relaciona dados visuais e textuais.

Utilizando esta representação integrada, o PaliGemma 2 gera uma resposta passo a passo através de uma descodificação autorregressiva, um método em que o modelo prevê uma parte da resposta de cada vez com base no contexto que já processou.

Principais capacidades do PaliGemma 2#

Agora que compreendemos o seu funcionamento, vamos explorar as principais funcionalidades que tornam o PaliGemma 2 num modelo de visão e linguagem fiável:

  • Flexibilidade de ajuste fino: adapta-se facilmente a conjuntos de dados e tarefas específicos, apresentando um bom desempenho em aplicações como geração de legendas para imagens, raciocínio espacial e imagiologia médica.
  • Dados de treino diversificados: treinado com conjuntos de dados como WebLI e OpenImages, o que lhe confere fortes capacidades de reconhecimento de objetos e geração de resultados multilingues.
  • Integração de OCR: inclui reconhecimento ótico de caracteres para extrair e interpretar texto de imagens, sendo ideal para análise de documentos e outras tarefas baseadas em texto.
  • Resultados multilingues: gera legendas e respostas em vários idiomas, sendo ideal para aplicações globais.
  • Integração com ferramentas: é compatível com frameworks como Hugging Face Transformers, PyTorch e Keras, permitindo uma implementação e experimentação simples.

Comparação entre PaliGemma 2 e PaliGemma: o que melhorou?#

Analisar a arquitetura da primeira versão do PaliGemma é uma boa forma de observar as melhorias do PaliGemma 2. Uma das alterações mais importantes é a substituição do modelo de linguagem Gemma original pelo Gemma 2, que proporciona melhorias substanciais tanto no desempenho como na eficiência.

O Gemma 2, disponível em tamanhos de 9B e 27B parâmetros, foi concebido para oferecer precisão e velocidade líderes da categoria, reduzindo simultaneamente os custos de implementação. Consegue isto através de uma arquitetura redesenhada e otimizada para a eficiência da inferência em várias configurações de hardware, desde GPUs potentes até configurações mais acessíveis.

Uma retrospetiva da primeira versão do PaliGemma

Fig. 3 Retrospetiva da primeira versão do PaliGemma 2.

Como resultado, o PaliGemma 2 é um modelo altamente preciso. A versão 10B do PaliGemma 2 obtém uma pontuação Non-Entailment Sentence (NES) mais baixa, de 20,3, em comparação com 34,3 do modelo original, o que significa que produz menos erros factuais. Estes avanços tornam o PaliGemma 2 mais escalável, preciso e adaptável a uma gama mais ampla de aplicações, desde a geração detalhada de legendas até à resposta a perguntas visuais.

Aplicações do PaliGemma 2: utilizações reais para modelos VLM#

O PaliGemma 2 tem potencial para redefinir setores ao combinar perfeitamente a compreensão visual e linguística. Por exemplo, no que diz respeito à acessibilidade, pode gerar descrições detalhadas de objetos, cenas e relações espaciais, prestando uma assistência essencial a pessoas com deficiência visual. Esta capacidade ajuda os utilizadores a compreender melhor o seu ambiente, proporcionando maior independência nas tarefas do dia a dia.

O PaliGemma 2 pode tornar o mundo mais acessível

Fig. 4 O PaliGemma 2 pode tornar o mundo mais acessível.

Além da acessibilidade, o PaliGemma 2 está a causar impacto em vários setores, incluindo:

  • Comércio eletrónico: o modelo melhora a categorização de produtos ao analisar e descrever itens em imagens, simplificando a gestão de inventário e melhorando a experiência de pesquisa dos utilizadores.
  • Saúde: apoia profissionais de saúde ao interpretar imagens médicas, como radiografias e ressonâncias magnéticas, juntamente com notas clínicas, para fornecer diagnósticos mais precisos e fundamentados.
  • Educação: o PaliGemma 2 ajuda os educadores a criar materiais didáticos descritivos e acessíveis, gerando legendas e fornecendo informações contextuais para imagens.
  • Criação de conteúdo: o modelo automatiza o processo de geração de legendas e descrições visuais para conteúdos multimédia, poupando tempo aos criadores.

Experimenta por ti: PaliGemma 2#

Para experimentares o PaliGemma 2, podes começar pela demonstração interativa do Hugging Face. Esta permite explorar as suas capacidades em tarefas como geração de legendas para imagens e resposta a perguntas visuais. Basta carregar uma imagem e fazer perguntas ao modelo sobre ela ou pedir uma descrição da cena.

Uma demonstração do PaliGemma 2

Fig. 5. Uma demonstração do PaliGemma 2 (Fonte: Hugging Face).

Se quiseres aprofundar o tema, eis como podes começar a trabalhar com ele:

  • Modelos pré-treinados: podes aceder a modelos pré-treinados e código em plataformas como Hugging Face e Kaggle. Estes recursos fornecem tudo o que precisas para começar a trabalhar com o modelo.
  • Notebooks: existe documentação abrangente e notebooks de exemplo para te familiarizares com o PaliGemma 2. Podes começar pelos exemplos de inferência e experimentar ajustar o modelo com o teu próprio conjunto de dados para tarefas específicas.
  • Integrações: o PaliGemma 2 é compatível com frameworks amplamente utilizados, como Hugging Face Transformers, Keras, PyTorch, JAX e Gemma.cpp, permitindo integrá-lo facilmente nos teus fluxos de trabalho existentes.

Vantagens e desvantagens do PaliGemma 2 da Google#

Agora que compreendemos como começar a utilizar o PaliGemma 2, vamos analisar mais detalhadamente os seus principais pontos fortes e limitações a ter em conta ao utilizar estes modelos.

Eis o que distingue o PaliGemma 2 enquanto modelo de visão e linguagem:

  • Ganhos de eficiência: aproveitando a arquitetura otimizada do Gemma 2, o PaliGemma 2 oferece um elevado desempenho e minimiza os custos de implementação.
  • Funcionalidades de segurança melhoradas: o PaliGemma 2 inclui melhorias significativas de segurança no seu processo de treino, como uma filtragem robusta dos dados de pré-treino para reduzir enviesamentos e uma avaliação rigorosa face a referências de segurança.
  • Baixa latência em configurações mais pequenas: o modelo 3B oferece tempos de inferência mais rápidos, sendo adequado para casos de utilização em que a velocidade é essencial, como recomendações de produtos no comércio eletrónico ou sistemas de apoio em direto.

Entretanto, eis algumas áreas em que o PaliGemma 2 pode enfrentar limitações:

  • Latência: embora sejam potentes, os modelos maiores podem enfrentar problemas de latência, especialmente quando implementados em tarefas que exigem respostas imediatas, como sistemas de IA interativos em tempo real.
  • Dependência de grandes conjuntos de dados: o desempenho do PaliGemma 2 está estreitamente ligado à qualidade e diversidade dos seus conjuntos de dados de treino, o que pode limitar a sua eficácia em domínios sub-representados ou em idiomas que não estejam incluídos nos dados de treino.
  • Elevados requisitos de recursos: apesar das otimizações, as versões com 10B e 28B parâmetros exigem um poder computacional significativo, tornando-as menos acessíveis a organizações mais pequenas com recursos limitados.

Principais conclusões#

O PaliGemma 2 é um avanço fascinante na modelação de visão e linguagem, oferecendo maior escalabilidade, flexibilidade de ajuste fino e precisão. Pode ser uma ferramenta valiosa para aplicações que vão desde soluções de acessibilidade e comércio eletrónico até diagnósticos de saúde e educação.

Embora tenha limitações, como os requisitos computacionais e a dependência de dados de elevada qualidade, os seus pontos fortes tornam-no uma escolha prática para lidar com tarefas complexas que integram dados visuais e textuais. O PaliGemma 2 pode fornecer uma base sólida para investigadores e programadores explorarem e expandirem o potencial da IA em aplicações multimodais.

Faz parte da conversa sobre IA consultando o nosso repositório do GitHub e a nossa comunidade. Lê sobre como a IA está a avançar na agricultura e na saúde! 🚀

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática