Ultralytics YOLO27:
IA para visão

Modelos multimodais e aprendizagem multimodal: a expansão das capacidades da IA

Explora como os modelos multimodais integram texto, imagens, áudio e dados de sensores para melhorar a perceção, o raciocínio e a tomada de decisões da IA.

ABAbdelrahman Elgendy13 min read
Modelos de IA multimodais que integram texto, imagens, áudio e dados de sensores

Os sistemas tradicionais de IA normalmente processam informações de uma única fonte de dados, como texto, imagens ou áudio. Embora estas abordagens unimodais sejam excelentes em tarefas especializadas, muitas vezes não conseguem lidar com cenários complexos do mundo real que envolvem várias entradas simultâneas. A aprendizagem multimodal resolve este problema ao integrar diversos fluxos de dados numa estrutura unificada, permitindo uma compreensão mais rica e consciente do contexto.

Inspirados na perceção humana, os modelos multimodais analisam, interpretam e atuam com base em entradas combinadas, tal como os seres humanos integram naturalmente a visão, o som e a linguagem. Estes modelos permitem que a IA lide com cenários complexos com maior precisão, robustez e adaptabilidade.

Neste artigo, vamos explorar a evolução dos modelos multimodais, explicar como funcionam, abordar as suas aplicações práticas na visão computacional e avaliar as vantagens e os desafios associados à integração de vários tipos de dados.

O que é a aprendizagem multimodal?#

Podes estar a perguntar-te o que é exatamente a aprendizagem multimodal e por que razão é importante para a inteligência artificial (AI). Os modelos tradicionais de IA normalmente processam um tipo de dados de cada vez, sejam imagens, texto, áudio ou dados de sensores.

A aprendizagem multimodal, contudo, vai um passo mais além ao permitir que os sistemas analisem, interpretem e integrem simultaneamente vários fluxos de dados diversificados. Esta abordagem reproduz de perto a forma como o cérebro humano integra naturalmente entradas visuais, auditivas e linguísticas para formar uma compreensão coerente do mundo.

Ao combinar estas diferentes modalidades, a IA multimodal alcança uma compreensão mais profunda e matizada de cenários complexos.

Por exemplo, ao analisar uma gravação de vídeo, um sistema multimodal não processa apenas o conteúdo visual; também considera o diálogo falado, os sons ambiente e as legendas.

Esta perspetiva integrada permite à IA captar o contexto e as subtilezas que seriam ignorados se cada tipo de dados fosse analisado de forma independente.

Os modelos de aprendizagem multimodal integram diversos tipos de dados

Fig. 1. Os modelos de aprendizagem multimodal integram diversos tipos de dados.

Na prática, a aprendizagem multimodal amplia aquilo que a IA consegue fazer. Permite aplicações como a criação de legendas para imagens, a resposta a perguntas com base no contexto visual, a geração de imagens realistas a partir de descrições textuais e a melhoria de sistemas interativos, tornando-os mais intuitivos e conscientes do contexto.

Mas como é que os modelos multimodais combinam estes diferentes tipos de dados para alcançar estes resultados? Vamos explicar passo a passo os mecanismos fundamentais por detrás do seu sucesso.

Como funcionam os modelos de IA multimodal?#

Os modelos de IA multimodal alcançam as suas capacidades avançadas através de processos especializados: extração separada de características para cada modalidade (processamento independente de cada tipo de dados, como imagens, texto ou áudio), métodos de fusão (combinação dos detalhes extraídos) e técnicas avançadas de alinhamento (garantia de que as informações combinadas se encaixam de forma coerente).

Pipeline de integração e fusão de dados multimodais para tarefas preditivas

Fig. 2. Pipeline de integração e fusão de dados multimodais para tarefas preditivas.

Vamos analisar com mais detalhe como funciona cada um destes processos.

Extração separada de características por modalidade#

Os modelos de IA multimodal utilizam arquiteturas diferentes e especializadas para cada tipo de dados. Isto significa que as entradas visuais, textuais e de áudio ou sensores são processadas por sistemas concebidos especificamente para elas. Desta forma, o modelo consegue captar os detalhes únicos de cada entrada antes de os combinar.

Eis alguns exemplos de como diferentes arquiteturas especializadas são utilizadas para extrair características de vários tipos de dados:

  • Dados visuais: As redes neuronais convolucionais (CNNs) ou os Vision Transformers interpretam informações visuais de imagens e vídeos, produzindo representações detalhadas das características.
  • Dados textuais: Os modelos baseados em Transformer, como os da família GPT, convertem entradas textuais em embeddings semânticos relevantes.
  • Dados de áudio e sensores: As redes neuronais especializadas processam formas de onda de áudio ou entradas de sensores espaciais, garantindo que cada modalidade seja representada com precisão e que as suas características distintas sejam preservadas.

Depois de processada individualmente, cada modalidade gera características de alto nível otimizadas para captar as informações únicas contidas nesse tipo específico de dados.

Técnicas de fusão de características#

Depois de extraírem as características, os modelos multimodais combinam-nas numa representação unificada e coerente. Para o fazer de forma eficaz, são utilizadas várias estratégias de fusão:

  • Fusão precoce: Combina os vetores de características extraídos imediatamente após o processamento de cada modalidade. Esta estratégia promove interações intermodais mais profundas numa fase inicial do pipeline de análise.
  • Fusão tardia: Mantém as modalidades separadas até às fases finais da tomada de decisões, nas quais as previsões de cada modalidade são combinadas, normalmente através de métodos de ensemble, como a média ou a votação.
  • Fusão híbrida: As arquiteturas modernas integram frequentemente as características várias vezes ao longo das diferentes camadas do modelo, utilizando mecanismos de coatenção para destacar e alinhar dinamicamente interações intermodais importantes. Por exemplo, a fusão híbrida pode dar prioridade ao alinhamento de palavras faladas ou frases textuais específicas com as características visuais correspondentes em tempo real.

Alinhamento intermodal e mecanismos de atenção#

Por fim, os sistemas multimodais utilizam técnicas avançadas de alinhamento e atenção para garantir que os dados de diferentes modalidades correspondem de forma eficaz.

Métodos como a aprendizagem contrastiva ajudam a alinhar estreitamente as representações visuais e textuais num espaço semântico partilhado. Desta forma, os modelos multimodais conseguem estabelecer ligações fortes e relevantes entre diversos tipos de dados, garantindo a consistência entre aquilo que o modelo "vê" e "lê".

Os mecanismos de atenção baseados em Transformer melhoram ainda mais este alinhamento ao permitir que os modelos se concentrem dinamicamente nos aspetos mais relevantes de cada entrada. Por exemplo, as camadas de atenção permitem ao modelo ligar diretamente descrições textuais específicas às regiões correspondentes nos dados visuais, melhorando significativamente a precisão em tarefas complexas como a resposta a perguntas visuais (VQA) e a criação de legendas para imagens.

Estas técnicas melhoram a capacidade da IA multimodal para compreender profundamente o contexto, tornando possível fornecer interpretações mais matizadas e precisas de dados complexos do mundo real.

A evolução da IA multimodal#

A IA multimodal evoluiu significativamente, passando das primeiras técnicas baseadas em regras para sistemas avançados de aprendizagem profunda capazes de realizar uma integração sofisticada.

Nos primórdios, os sistemas multimodais combinavam diferentes tipos de dados, como imagens, áudio ou entradas de sensores, utilizando regras criadas manualmente por especialistas humanos ou métodos estatísticos simples. Por exemplo, os primeiros sistemas de navegação robótica combinavam imagens de câmaras com dados de sonar para detetar e evitar obstáculos. Embora fossem eficazes, estes sistemas exigiam uma engenharia manual extensa de características e tinham capacidades limitadas de adaptação e generalização.

Com o surgimento da aprendizagem profunda, os modelos multimodais tornaram-se muito mais populares. As redes neuronais, como os autoencoders multimodais, começaram a aprender representações conjuntas de diferentes tipos de dados, especialmente dados de imagens e texto, permitindo à IA realizar tarefas como a recuperação intermodal e a pesquisa de imagens baseada exclusivamente em descrições textuais.

Os avanços continuaram à medida que sistemas como a resposta a perguntas visuais (VQA) integraram CNNs para processar imagens e RNNs ou transformers para interpretar texto. Isto permitiu aos modelos de IA responder com precisão a perguntas complexas e dependentes do contexto sobre conteúdos visuais.

Mais recentemente, os modelos multimodais de grande escala treinados em conjuntos de dados massivos à escala da Internet revolucionaram ainda mais as capacidades da IA.

Estes modelos utilizam técnicas como a aprendizagem contrastiva, permitindo-lhes identificar relações generalizáveis entre conteúdos visuais e descrições textuais. Ao colmatar as lacunas entre modalidades, as arquiteturas multimodais modernas melhoraram a capacidade da IA para realizar tarefas complexas de raciocínio visual com uma precisão quase humana, demonstrando até que ponto a IA multimodal evoluiu desde as suas fases iniciais.

Explorar a aprendizagem multimodal na visão computacional#

Agora que explorámos como os modelos multimodais integram diversos fluxos de dados, vamos analisar como estas capacidades podem ser aplicadas aos modelos de visão computacional.

Fluxo de trabalho da aprendizagem multimodal aplicada à visão computacional

Fig. 3. Fluxo de trabalho da aprendizagem multimodal aplicada à visão computacional.

Ao combinar entradas visuais com dados de texto, áudio ou sensores, a aprendizagem multimodal permite que os sistemas de IA enfrentem aplicações cada vez mais sofisticadas e ricas em contexto.

Criação de legendas para imagens#

A criação de legendas para imagens consiste em gerar descrições em linguagem natural para dados visuais. Os métodos tradicionais de deteção de objetos identificam objetos individuais, mas a criação multimodal de legendas vai mais longe, interpretando relações e contextos.

Por exemplo, um modelo multimodal pode analisar uma imagem de pessoas num piquenique e gerar uma legenda descritiva como “Uma família a fazer um piquenique num parque soalheiro”, fornecendo um resultado mais rico e acessível.

Esta aplicação é importante para a acessibilidade. Pode ser utilizada para gerar texto alternativo para pessoas com deficiência visual e para etiquetar conteúdos em grandes bases de dados. As arquiteturas Transformer desempenham aqui um papel fundamental, permitindo que o módulo de geração de texto se concentre em áreas visuais relevantes através de mecanismos de atenção, alinhando dinamicamente as descrições textuais com as características visuais.

Resposta a perguntas visuais (VQA)#

Os modelos de VQA respondem a perguntas em linguagem natural com base em conteúdos visuais, combinando visão computacional com compreensão da linguagem. Estas tarefas exigem uma compreensão detalhada do conteúdo, do contexto e do raciocínio semântico das imagens.

As arquiteturas Transformer melhoraram a VQA ao permitir que os componentes textuais e visuais do modelo interajam dinamicamente, identificando com precisão as regiões da imagem relacionadas com a pergunta.

O modelo PaLI da Google, por exemplo, utiliza arquiteturas avançadas baseadas em transformer que integram transformers visuais (ViT) com codificadores e descodificadores de linguagem, permitindo responder com precisão a perguntas sofisticadas como “O que está a fazer a mulher na imagem?” ou “Quantos animais estão visíveis?”.

As camadas de atenção, que ajudam os modelos a concentrar-se nas partes mais relevantes de uma entrada, garantem que cada palavra da pergunta estabelece uma ligação dinâmica com pistas visuais, permitindo respostas matizadas que vão além da deteção básica de objetos.

Geração de texto para imagem#

A geração de texto para imagem refere-se à capacidade da IA de criar conteúdos visuais diretamente a partir de descrições textuais, colmatando a lacuna entre a compreensão semântica e a criação visual.

Os modelos multimodais que realizam esta tarefa utilizam arquiteturas neuronais avançadas, como transformers ou processos de difusão, para gerar imagens detalhadas e contextualmente precisas.

Por exemplo, imagina gerar dados de treino sintéticos para modelos de visão computacional encarregados da deteção de veículos. A partir de descrições textuais como "um sedan vermelho estacionado numa rua movimentada" ou "um SUV branco a circular numa autoestrada", estes modelos multimodais podem produzir imagens diversificadas e de alta qualidade que representam estes cenários específicos.

Esta capacidade permite aos investigadores e programadores expandir eficazmente os conjuntos de dados de deteção de objetos sem captarem manualmente milhares de imagens, reduzindo significativamente o tempo e os recursos necessários para a recolha de dados.

Resultados de um modelo de deteção de objetos treinado em conjuntos de dados sintéticos

Fig. 4. Exemplo de resultados de um modelo de deteção de objetos treinado em conjuntos de dados sintéticos.

Os métodos mais recentes aplicam técnicas baseadas em difusão, começando com ruído visual aleatório e refinando progressivamente a imagem para a alinhar estreitamente com a entrada textual. Este processo iterativo pode criar exemplos realistas e variados, garantindo dados de treino robustos que abrangem múltiplas perspetivas, condições de iluminação, tipos de veículos e fundos.

Esta abordagem é particularmente valiosa na visão computacional, permitindo uma expansão rápida dos conjuntos de dados, melhorando a precisão dos modelos e aumentando a diversidade dos cenários que os sistemas de IA conseguem reconhecer de forma fiável.

Recuperação de imagens e texto#

Os sistemas de recuperação multimodal facilitam a pesquisa ao converter texto e imagens numa linguagem comum de significado. Por exemplo, os modelos treinados em enormes conjuntos de dados, como o CLIP, que aprendeu com milhões de pares imagem-texto, conseguem associar consultas textuais às imagens corretas, proporcionando resultados de pesquisa mais intuitivos e precisos.

Por exemplo, uma consulta de pesquisa como “pôr do sol numa praia” devolve resultados visualmente precisos, melhorando significativamente a eficiência da descoberta de conteúdos em plataformas de comércio eletrónico, arquivos multimédia e bases de dados de fotografias de arquivo.

A abordagem multimodal garante a precisão da recuperação mesmo quando as consultas e as descrições das imagens utilizam línguas diferentes, graças aos alinhamentos semânticos aprendidos entre os domínios visual e textual.

Vantagens e desvantagens dos modelos multimodais na IA#

A aprendizagem multimodal oferece várias vantagens importantes que melhoram as capacidades da IA na visão computacional e não só:

  • Compreensão contextual mais rica: Ao combinar vários fluxos de entrada, os modelos multimodais alcançam uma compreensão mais profunda e matizada de cenários complexos do mundo real.
  • Maior precisão: A referência cruzada entre várias fontes de dados reduz os erros de reconhecimento e raciocínio, melhorando a fiabilidade geral.
  • Maior robustez: Os sistemas multimodais continuam eficazes mesmo quando uma fonte de dados está comprometida, como em condições de iluminação insuficiente nas entradas visuais ou com ruído nos dados de áudio.

Apesar destas vantagens, os modelos multimodais também apresentam o seu próprio conjunto de desafios:

  • Complexidade computacional: O processamento simultâneo de várias modalidades exige recursos computacionais significativos, aumentando as necessidades de infraestrutura.
  • Alinhamento e sincronização de dados: Alinhar diferentes modalidades com precisão, como associar pistas de áudio exatamente aos fotogramas visuais, é tecnicamente desafiante, mas essencial para um desempenho ideal.
  • Implicações éticas: Os sistemas multimodais podem amplificar inadvertidamente os preconceitos presentes nos conjuntos de dados de treino, evidenciando a importância de uma curadoria cuidadosa dos dados e de uma avaliação ética contínua.

Principais conclusões#

A aprendizagem multimodal está a transformar a IA ao permitir uma compreensão mais rica e contextualizada de vários fluxos de dados. As aplicações na visão computacional, como a criação de legendas para imagens, a resposta a perguntas visuais, a geração de texto para imagem e a recuperação melhorada de imagens, demonstram o potencial da integração de diversas modalidades.

Embora persistam desafios computacionais e éticos, as inovações contínuas nas arquiteturas, como a fusão baseada em transformer e o alinhamento contrastivo, continuam a responder a estas preocupações, conduzindo a IA multimodal rumo a uma inteligência cada vez mais semelhante à humana.

À medida que este campo evolui, os modelos multimodais tornar-se-ão essenciais para tarefas complexas de IA no mundo real, melhorando tudo, desde o diagnóstico médico até à robótica autónoma. Adotar a aprendizagem multimodal permite às indústrias aproveitar capacidades poderosas que irão moldar o futuro da IA.

Junta-te à nossa comunidade em crescimento! Explora o nosso repositório no GitHub para saberes mais sobre IA. Queres começar os teus próprios projetos de visão computacional? Consulta as nossas opções de licenciamento. Descobre a IA na indústria e a IA de visão na condução autónoma visitando as nossas páginas de soluções!

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática