YOLO Vision 2026:
IA para visão

Compreender os modelos de linguagem e visão e as suas aplicações

Aprende sobre os modelos de linguagem e visão, como funcionam e as suas várias aplicações em IA. Descobre como estes modelos combinam capacidades visuais e linguísticas.

ABAbirami Vina6 min read
Modelos de linguagem e visão que combinam a compreensão de imagens e texto

Num artigo anterior, explorámos como o GPT-4o consegue compreender e descrever imagens usando palavras. Também vemos esta capacidade noutros modelos recentes, como o Google Gemini e o Claude 3. Hoje, vamos aprofundar este conceito para explicar como funcionam os Modelos de Visão e Linguagem e como combinam dados visuais e textuais.

Estes modelos podem ser usados para realizar uma série de tarefas impressionantes, como gerar legendas detalhadas para fotografias, responder a perguntas sobre imagens e até criar novo conteúdo visual com base em descrições textuais. Ao integrarem perfeitamente informação visual e linguística, os Modelos de Visão e Linguagem estão a mudar a forma como interagimos com a tecnologia e compreendemos o mundo à nossa volta.

Como funcionam os modelos de visão e linguagem#

Antes de vermos onde os Modelos de Visão e Linguagem (VLMs) podem ser usados, vamos compreender o que são e como funcionam. Os VLMs são modelos avançados de IA que combinam as capacidades dos modelos de visão e de linguagem para processar imagens e texto. Estes modelos recebem imagens juntamente com as respetivas descrições textuais e aprendem a estabelecer uma ligação entre ambas. A componente de visão do modelo capta detalhes das imagens, enquanto a componente de linguagem compreende o texto. Esta colaboração permite aos VLMs compreender e analisar imagens e texto.

Eis as principais capacidades dos Modelos de Visão e Linguagem:

  • Geração de legendas de imagens: Geração de texto descritivo com base no conteúdo das imagens.
  • Resposta a perguntas visuais (VQA): Resposta a perguntas relacionadas com o conteúdo de uma imagem.
  • Texto-para-Geração de imagens: Criação de imagens com base em descrições textuais.
  • Recuperação de imagens e texto: Localização de imagens relevantes para uma determinada consulta textual e vice-versa.
  • Criação de conteúdo multimodal: Combinação de imagens e texto para gerar novo conteúdo.
  • Compreensão de cenas edeteção de objetos: Identificação e categorização de objetos e detalhes numa imagem.

Exemplo das capacidades de um modelo de visão e linguagem

Fig. 1. Um exemplo das capacidades de um modelo de visão e linguagem.

De seguida, vamos explorar arquiteturas comuns de VLMs e técnicas de aprendizagem usadas por modelos conhecidos, como CLIP, SimVLM e VisualGPT.

Aprendizagem contrastiva#

A aprendizagem contrastiva é uma técnica que ajuda os modelos a aprender ao comparar diferenças entre pontos de dados. Calcula o grau de semelhança ou diferença entre instâncias e procura minimizar a perda contrastiva, que mede essas diferenças. É especialmente útil na aprendizagem semissupervisionada, na qual um pequeno conjunto de exemplos anotados orienta o modelo a rotular dados novos e nunca vistos. Por exemplo, para compreender o aspeto de um gato, o modelo compara-o com imagens semelhantes de gatos e com imagens de cães. Ao identificar características como a estrutura facial, o tamanho do corpo e o pelo, as técnicas de aprendizagem contrastiva conseguem distinguir um gato de um cão.

Diagrama de como funciona a aprendizagem contrastiva

Fig. 2. Como funciona a aprendizagem contrastiva.

O CLIP é um Modelo de Visão e Linguagem que utiliza aprendizagem contrastiva para associar descrições textuais a imagens. Funciona em três passos simples. Primeiro, treina as componentes do modelo que compreendem texto e imagens. Segundo, converte as categorias de um conjunto de dados em descrições textuais. Terceiro, identifica a descrição mais adequada para uma determinada imagem. Graças a este método, o modelo CLIP consegue fazer previsões precisas mesmo em tarefas para as quais não foi especificamente treinado.

PrefixLM#

PrefixLM é uma técnica de Processamento de Linguagem Natural (NLP) usada para treinar modelos. Começa com parte de uma frase (um prefixo) e aprende a prever a palavra seguinte. Nos Modelos de Visão e Linguagem, o PrefixLM ajuda o modelo a prever as palavras seguintes com base numa imagem e num determinado fragmento de texto. Utiliza um Transformer de Visão (ViT), que divide uma imagem em pequenos blocos, cada um representando uma parte da imagem, e processa-os em sequência.

Exemplo do treino de um VLM com a técnica PrefixLM

Fig. 3. Um exemplo do treino de um VLM que utiliza a técnica PrefixLM.

O SimVLM é um VLM que utiliza a técnica de aprendizagem PrefixLM. Usa uma arquitetura Transformer mais simples em comparação com modelos anteriores, mas obtém melhores resultados em vários testes. A arquitetura do seu modelo envolve aprender a associar imagens a prefixos de texto usando um codificador Transformer e, em seguida, gerar texto usando um descodificador Transformer.

Fusão multimodal com atenção cruzada#

A fusão multimodal com atenção cruzada é uma técnica que melhora a capacidade de um Modelo de Visão e Linguagem pré-treinado para compreender e processar dados visuais. Funciona através da adição de camadas de atenção cruzada ao modelo, permitindo-lhe prestar atenção simultaneamente à informação visual e textual.

Eis como funciona:

  • Os objetos principais de uma imagem são identificados e destacados.
  • Os objetos destacados são processados por um codificador visual, que traduz a informação visual para um formato que o modelo consegue compreender.
  • A informação visual é transmitida a um descodificador, que interpreta a imagem usando o conhecimento do modelo de linguagem pré-treinado.

O VisualGPT é um bom exemplo de um modelo que utiliza esta técnica. Inclui uma funcionalidade especial chamada unidade de ativação autorregenerativa (SRAU), que ajuda o modelo a evitar um problema comum chamado gradientes evanescentes. Os gradientes evanescentes podem fazer com que os modelos percam informação importante durante o treino, mas a SRAU mantém o desempenho do modelo elevado.

Diagrama da arquitetura do modelo VisualGPT

Fig. 4. Arquitetura do modelo VisualGPT.

Aplicações dos modelos de visão e linguagem#

Os Modelos de Visão e Linguagem estão a causar impacto numa variedade de setores. Desde melhorar as plataformas de comércio eletrónico até tornar a Internet mais acessível, os potenciais usos dos VLMs são promissores. Vamos explorar algumas destas aplicações.

Geração de descrições de produtos#

Quando compras online, vês descrições detalhadas de cada produto, mas criar essas descrições pode consumir muito tempo. Os VLMs simplificam este processo ao automatizar a geração dessas descrições. Os retalhistas online podem gerar diretamente descrições detalhadas e precisas a partir de imagens de produtos usando Modelos de Visão e Linguagem.

As descrições de produtos de elevada qualidade ajudam os motores de pesquisa a identificar produtos com base em atributos específicos mencionados na descrição. Por exemplo, uma descrição que contenha "manga comprida" e "gola de algodão" ajuda os clientes a encontrar mais facilmente uma "camisa de algodão de manga comprida". Também ajuda os clientes a encontrar rapidamente o que procuram e, por sua vez, aumenta as vendas e a satisfação dos clientes.

Exemplo de uma descrição de produto gerada por IA

Fig. 5. Um exemplo de uma descrição de produto gerada por IA.

Os modelos de IA generativa, como o BLIP-2, são exemplos de VLMs sofisticados que conseguem prever diretamente os atributos dos produtos a partir de imagens. O BLIP-2 utiliza vários componentes para compreender e descrever produtos de comércio eletrónico com precisão. Começa por processar e compreender os aspetos visuais do produto com um codificador de imagens. Em seguida, um Transformer de consulta interpreta esta informação visual no contexto de perguntas ou tarefas específicas. Por fim, um modelo de linguagem de grande dimensão gera descrições de produtos detalhadas e precisas.

Tornar a Internet mais acessível#

Os Modelos de Visão e Linguagem podem tornar a Internet mais acessível através da geração de legendas de imagens, especialmente para pessoas com deficiência visual. Tradicionalmente, os utilizadores têm de introduzir descrições do conteúdo visual em sites e redes sociais. Por exemplo, quando publicas no Instagram, podes adicionar texto alternativo para leitores de ecrã. No entanto, os VLMs podem automatizar este processo.

Quando um VLM vê uma imagem de um gato sentado num sofá, pode gerar a legenda "Um gato sentado num sofá", tornando a cena clara para utilizadores com deficiência visual. Os VLMs utilizam técnicas como prompting de poucos exemplos, em que aprendem a partir de alguns exemplos de pares imagem-legenda, e prompting de cadeia de pensamento, que os ajuda a decompor logicamente cenas complexas. Estas técnicas tornam as legendas geradas mais coerentes e detalhadas.

Utilização de IA para gerar legendas de imagens

Fig. 6. Utilização de IA para gerar legendas de imagens.

Para este efeito, a funcionalidade do Google "Obter descrições de imagens do Google" no Chrome gera automaticamente descrições para imagens sem texto alternativo. Embora estas descrições geradas por IA possam não ser tão detalhadas como as escritas por humanos, continuam a fornecer informação útil.

Vantagens e limitações dos Modelos de Visão e Linguagem#

Os Modelos de Visão e Linguagem (VLMs) oferecem muitas vantagens ao combinar dados visuais e textuais. Algumas das principais vantagens incluem:

  • Melhor interação entre humanos e máquinas: Permitem que os sistemas compreendam e respondam a entradas visuais e textuais, melhorando os assistentes virtuais, os chatbots e a robótica.
  • Diagnóstico e análise avançados: Ajudam na área médica ao analisar imagens e gerar descrições, apoiando os profissionais de saúde com segundas opiniões e na deteção de anomalias.
  • Narrativa interativa e entretenimento: Geram narrativas envolventes ao combinar entradas visuais e textuais para melhorar as experiências dos utilizadores em jogos e realidade virtual.

Apesar das suas capacidades impressionantes, os Modelos de Visão e Linguagem também apresentam algumas limitações. Eis alguns aspetos a ter em conta relativamente aos VLMs:

  • Elevados requisitos computacionais: O treino e a implementação de VLMs exigem recursos computacionais substanciais, o que os torna dispendiosos e menos acessíveis.
  • Dependência dos dados e enviesamento: Os VLMs podem produzir resultados enviesados se forem treinados com conjuntos de dados não diversificados ou enviesados, perpetuando estereótipos e desinformação.
  • Compreensão limitada do contexto: Os VLMs podem ter dificuldade em compreender o contexto ou a visão geral e gerar resultados demasiado simplificados ou incorretos.

Principais conclusões#

Os Modelos de Visão e Linguagem têm um potencial extraordinário em muitas áreas, como o comércio eletrónico e os cuidados de saúde. Ao combinar dados visuais e textuais, podem impulsionar a inovação e transformar setores. No entanto, é essencial desenvolver estas tecnologias de forma responsável e ética para garantir que são usadas de maneira justa. À medida que os VLMs continuam a evoluir, melhorarão tarefas como a pesquisa baseada em imagens e as tecnologias de assistência.

Para continuares a aprender sobre IA, junta-te à nossa comunidade! Explora o nosso repositório do GitHub para veres como estamos a usar IA para criar soluções inovadoras em setores como a indústria transformadora e os cuidados de saúde. 🚀

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática