Compreender modelos de linguagem visual e as suas aplicações
Aprende sobre modelos de linguagem visual, como funcionam e as suas várias aplicações em IA. Descobre como estes modelos combinam capacidades visuais e linguísticas.

Num artigo anterior, exploramos como o GPT-4o consegue compreender e descrever imagens utilizando palavras. Também estamos a ver esta capacidade noutros modelos novos como o Google Gemini e o Claude 3. Hoje, vamos aprofundar este conceito para explicar como funcionam os Modelos de Linguagem Visual e como combinam dados visuais e textuais.
Esses modelos podem ser usados para realizar uma série de tarefas impressionantes, como gerar legendas detalhadas para fotos, responder a perguntas sobre imagens e até criar novos conteúdos visuais com base em descrições textuais. Ao integrar perfeitamente informações visuais e linguísticas, os modelos de linguagem visual estão mudando a forma como interagimos com a tecnologia e entendemos o mundo ao nosso redor.
Como funcionam os modelos de linguagem visual#
Antes de analisarmos onde os modelos de linguagem visual (VLMs) podem ser usados, vamos entender o que são e como funcionam. Os VLMs são modelos de IA avançados que combinam as capacidades dos modelos de visão e de linguagem para lidar com imagens e texto. Esses modelos recebem imagens junto com suas descrições de texto e aprendem a conectar as duas coisas. A parte de visão do modelo captura detalhes das imagens, enquanto a parte de linguagem entende o texto. Esse trabalho em equipe permite que os VLMs entendam e analisem imagens e textos.
Aqui estão as principais capacidades dos modelos de linguagem visual:
- Legendas de imagens: Geração de texto descritivo com base no conteúdo das imagens.
- Perguntas e respostas visuais (VQA): Respostas a perguntas relacionadas ao conteúdo de uma imagem.
- De Texto para Geração de Imagens: Criação de imagens com base em descrições textuais.
- Recuperação de imagem-texto: Busca de imagens relevantes para uma consulta de texto específica e vice-versa.
- Criação de conteúdo multimodal: Combinação de imagens e texto para gerar novo conteúdo.
- Compreensão de Cenas e Deteção de Objetos: Identificação e categorização de objetos e detalhes dentro de uma imagem.

Fig 1. Um exemplo das capacidades de um modelo de linguagem visual.
A seguir, vamos explorar arquiteturas comuns de VLM e técnicas de aprendizado usadas por modelos conhecidos como CLIP, SimVLM e VisualGPT.
Aprendizado contrastivo#
O aprendizado contrastivo é uma técnica que ajuda os modelos a aprender comparando diferenças entre pontos de dados. Ele calcula o quão semelhantes ou diferentes são as instâncias e visa minimizar a perda contrastiva, que mede essas diferenças. É especialmente útil no aprendizado semissupervisionado, onde um pequeno conjunto de exemplos rotulados orienta o modelo a rotular novos dados não vistos. Por exemplo, para entender como é um gato, o modelo o compara a imagens semelhantes de gatos e de cães. Ao identificar características como estrutura facial, tamanho do corpo e pelos, as técnicas de aprendizado contrastivo podem diferenciar um gato de um cão.

Fig 2. Como funciona a aprendizagem contrastiva.
O CLIP é um Modelo de Linguagem Visual que utiliza aprendizagem contrastiva para fazer corresponder descrições de texto a imagens. Funciona em três passos simples. Primeiro, treina as partes do modelo que compreendem tanto texto como imagens. Segundo, converte as categorias de um conjunto de dados em descrições textuais. Terceiro, identifica a descrição mais adequada para uma determinada imagem. Graças a este método, o modelo CLIP consegue fazer previsões precisas mesmo para tarefas para as quais não foi especificamente treinado.
PrefixLM#
PrefixLM é uma técnica de processamento de linguagem natural (NLP) usada para treinar modelos. Ela começa com parte de uma frase (um prefixo) e aprende a prever a palavra seguinte. Nos modelos de linguagem visual, o PrefixLM ajuda o modelo a prever as próximas palavras com base em uma imagem e em um determinado trecho de texto. Ele usa um Transformer de visão (ViT), que quebra uma imagem em pequenos patches, cada um representando uma parte da imagem, e os processa em sequência.

Fig 3. Um exemplo de treino de um VLM que utiliza a técnica PrefixLM.
O SimVLM é um VLM que utiliza a técnica de aprendizagem PrefixLM. Utiliza uma arquitetura Transformer mais simples em comparação com modelos anteriores, mas atinge melhores resultados em vários testes. A arquitetura do seu modelo envolve aprender a associar imagens a prefixos de texto utilizando um codificador transformer e, em seguida, gerar texto utilizando um descodificador transformer.
Fusão multimodal com atenção cruzada#
A fusão multimodal com atenção cruzada é uma técnica que melhora a capacidade de um modelo de linguagem visual pré-treinado de entender e processar dados visuais. Ela funciona adicionando camadas de atenção cruzada ao modelo, o que permite que ele preste atenção tanto em informações visuais quanto textuais ao mesmo tempo.
Veja como funciona:
- Objetos-chave em uma imagem são identificados e destacados.
- Objetos destacados são processados por um codificador visual, traduzindo as informações visuais para um formato que o modelo possa entender.
- As informações visuais são passadas para um decodificador, que interpreta a imagem usando o conhecimento do modelo de linguagem pré-treinado.
O VisualGPT é um bom exemplo de um modelo que utiliza esta técnica. Inclui uma funcionalidade especial chamada unidade de ativação auto-ressurrecionada (SRAU), que ajuda o modelo a evitar um problema comum chamado gradientes descendentes desaparecidos. Os gradientes desaparecidos podem fazer com que os modelos percam informação importante durante o treino, mas o SRAU mantém o desempenho do modelo forte.

Fig 4. Arquitetura do modelo VisualGPT.
Aplicações de modelos de linguagem visual#
Os modelos de linguagem visual estão causando impacto em diversos setores. Desde a melhoria das plataformas de comércio eletrônico até tornar a internet mais acessível, os usos potenciais dos VLMs são empolgantes. Vamos explorar algumas dessas aplicações.
Geração de descrições de produtos#
Quando compras online, vês descrições detalhadas de cada produto, mas criar essas descrições pode ser demorado. Os VLM agilizam este processo ao automatizarem a geração destas descrições. Os retalhistas online podem gerar diretamente descrições detalhadas e precisas a partir de imagens de produtos utilizando Modelos de Linguagem Visual.
Descrições de produtos de alta qualidade ajudam os mecanismos de busca a identificar produtos com base em atributos específicos mencionados na descrição. Por exemplo, uma descrição contendo "manga comprida" e "gola de algodão" ajuda os clientes a encontrar uma "camisa de algodão de manga comprida" mais facilmente. Isso também ajuda os clientes a encontrar o que desejam rapidamente e, por sua vez, aumenta as vendas e a satisfação do cliente.

Fig 5. Um exemplo de uma descrição de produto gerada por IA.
Os modelos de Inteligência Artificial Generativa, como o BLIP-2, são exemplos de VLM sofisticados que conseguem prever atributos de produtos diretamente a partir de imagens. O BLIP-2 utiliza vários componentes para compreender e descrever produtos de e-commerce com precisão. Começa por processar e compreender os aspetos visuais do produto com um codificador de imagens. Em seguida, um transformer de consulta interpreta esta informação visual no contexto de perguntas ou tarefas específicas. Finalmente, um grande modelo de linguagem gera descrições de produtos detalhadas e precisas.
Tornando a internet mais acessível#
Os Modelos de Linguagem Visual podem tornar a internet mais acessível através da legendagem de imagens, especialmente para indivíduos com deficiência visual. Tradicionalmente, os utilizadores precisam de inserir descrições de conteúdo visual em sites e redes sociais. Por exemplo, quando publicas no Instagram, podes adicionar texto alternativo para leitores de ecrã. Os VLM, no entanto, podem automatizar este processo.
Quando um VLM vê a imagem de um gato sentado em um sofá, ele pode gerar a legenda "Um gato sentado em um sofá", tornando a cena clara para usuários com deficiência visual. Os VLMs usam técnicas como o "few-shot prompting", em que aprendem com alguns exemplos de pares imagem-legenda, e o "chain-of-thought prompting", que os ajuda a decompor cenas complexas logicamente. Essas técnicas tornam as legendas geradas mais coerentes e detalhadas.

Fig 6. Utilização de IA para gerar legendas de imagens.
Para este efeito, a funcionalidade "Obter Descrições de Imagem do Google" do Google no Chrome gera automaticamente descrições para imagens sem texto alternativo. Embora estas descrições geradas por IA possam não ser tão detalhadas como as escritas por humanos, continuam a fornecer informações valiosas.
Benefícios e limitações dos modelos de linguagem visual#
Os modelos de linguagem visual (VLMs) oferecem muitas vantagens ao combinar dados visuais e textuais. Alguns dos principais benefícios incluem:
- Melhor interação humano-máquina: Permite que os sistemas entendam e respondam a entradas visuais e textuais, melhorando assistentes virtuais, chatbots e robótica.
- Diagnósticos e Análise Avançados: Ajudam no campo médico através da análise de imagens e geração de descrições, apoiando os profissionais de saúde com segundas opiniões e deteção de anomalias.
- Contação de histórias e entretenimento interativo: Geram narrativas envolventes ao combinar entradas visuais e textuais para melhorar as experiências do usuário em jogos e realidade virtual.
Apesar de suas capacidades impressionantes, os modelos de linguagem visual também apresentam certas limitações. Aqui estão algumas coisas para manter em mente quando se trata de VLMs:
- Elevados Requisitos Computacionais: O treino e a implementação de VLM exigem recursos computacionais substanciais, tornando-os dispendiosos e menos acessíveis.
- Dependência de dados e viés: Os VLMs podem produzir resultados tendenciosos se treinados em conjuntos de dados não diversos ou tendenciosos, o que pode perpetuar estereótipos e desinformação.
- Compreensão limitada de contexto: Os VLMs podem ter dificuldade em entender o cenário geral ou o contexto e gerar saídas simplificadas ou incorretas.
Principais pontos#
Os Modelos de Linguagem Visual têm um potencial incrível em vários campos, como o e-commerce e os cuidados de saúde. Ao combinarem dados visuais e textuais, podem impulsionar a inovação e transformar indústrias. No entanto, é essencial desenvolver estas tecnologias de forma responsável e ética para garantir que são utilizadas de forma justa. À medida que os VLM continuam a evoluir, vão melhorar tarefas como a pesquisa baseada em imagens e tecnologias de assistência.
Para continuares a aprender sobre IA, junta-te à nossa comunidade! Explora o nosso repositório do GitHub para veres como estamos a usar a IA para criar soluções inovadoras em indústrias como a manufatura e os cuidados de saúde. 🚀






