Multimodal RAG
Explore o RAG multimodal para processar texto, imagens e vídeo. Saiba como o Ultralytics YOLO26 melhora os pipelines de recuperação de IA para respostas mais precisas e sensíveis ao contexto.
A Geração Aumentada por Recuperação Multimodal (Multimodal RAG) é uma estrutura avançada de inteligência artificial (AI) que expande os sistemas RAG tradicionais para processar e raciocinar sobre diversos tipos de dados, como texto, imagens, vídeo e áudio. Enquanto a Geração Aumentada por Recuperação (RAG) padrão melhora a precisão de um Modelo de Linguagem de Grande Escala (LLM) ao recuperar documentos textuais relevantes, o Multimodal RAG permite que os modelos "vejam" e "ouçam" ao recuperar contexto de uma base de conhecimento multimédia. Esta abordagem fundamenta a geração do modelo em evidências visuais ou auditivas concretas, reduzindo significativamente as alucinações em LLMs e permitindo tarefas complexas, como responder a perguntas visuais sobre conjuntos de dados privados. Ao tirar partido da aprendizagem multimodal, estes sistemas conseguem sintetizar informações da consulta de um utilizador (por exemplo, texto) e dos recursos recuperados (por exemplo, um diagrama ou uma imagem de videovigilância) para produzir respostas abrangentes e conscientes do contexto.
Como funciona o Multimodal RAG#
A arquitetura de um sistema Multimodal RAG normalmente reproduz o pipeline padrão "Recuperar e depois gerar", mas adapta-o a dados não textuais. Este processo depende fortemente de bases de dados vetoriais e de espaços semânticos partilhados.
-
Indexação: Os dados provenientes de várias fontes — PDFs, vídeos e apresentações — são processados. Os modelos de extração de características convertem estas diferentes modalidades em vetores numéricos de alta dimensionalidade conhecidos como embeddings. Por exemplo, um modelo como o CLIP da OpenAI alinha embeddings de imagens e de texto para que a imagem de um cão e a palavra "cão" fiquem matematicamente próximas.
-
Recuperação: Quando um utilizador faz uma pergunta (por exemplo, "Mostra-me o defeito nesta placa de circuito"), o sistema realiza uma pesquisa semântica na base de dados vetorial para encontrar as imagens ou os clips de vídeo mais relevantes que correspondam à intenção da consulta.
-
Geração: O contexto visual recuperado é introduzido num Modelo de Visão-Linguagem (VLM). O VLM processa tanto o prompt de texto do utilizador como as características da imagem recuperada para gerar uma resposta final, conversando efetivamente com os dados.
Aplicações no mundo real#
O Multimodal RAG está a transformar vários setores ao permitir que agentes de AI interajam com o mundo físico através de dados visuais.
- Manutenção Industrial e Fabrico: Na AI no fabrico, os técnicos podem consultar um sistema com uma fotografia de uma peça de máquina avariada. O sistema Multimodal RAG recupera registos históricos de manutenção semelhantes, esquemas técnicos e tutoriais em vídeo para orientar o processo de reparação. Isto reduz o tempo de inatividade e democratiza o conhecimento especializado.
- Descoberta no Retalho e no Comércio Eletrónico: As aplicações que utilizam AI no retalho permitem que os clientes carreguem uma imagem de um conjunto de roupa de que gostam. O sistema recupera artigos visualmente semelhantes do inventário atual e gera recomendações de estilo ou comparações de produtos, criando uma experiência de compra altamente personalizada.
Diferenciação de Termos Relacionados#
Para compreender o nicho específico do Multimodal RAG, é útil distingui-lo de conceitos relacionados:
- Multimodal RAG vs. Modelo Multimodal: Um modelo multimodal (como o GPT-4o ou o Gemini) cria a resposta. O Multimodal RAG é a arquitetura que fornece a esse modelo dados externos e privados (imagens e documentos) com os quais não foi treinado. O modelo é o motor; o RAG é a linha de combustível.
- Multimodal RAG vs. Ajuste Fino: O ajuste fino atualiza permanentemente os pesos do modelo para aprender uma nova tarefa ou estilo. O RAG fornece conhecimento temporário no momento da inferência. O RAG é preferível para dados dinâmicos (por exemplo, inventário diário), nos quais o novo treino frequente é impraticável.
Implementação com Ultralytics#
Os programadores podem criar o componente de recuperação de um pipeline Multimodal RAG utilizando o Ultralytics YOLO. Ao detetar e classificar objetos em imagens, o YOLO fornece metadados estruturados que podem ser indexados para recuperação baseada em texto ou utilizados para recortar regiões de imagem relevantes para um VLM. A Ultralytics Platform simplifica o treino destes modelos de visão especializados para reconhecer objetos personalizados essenciais ao teu domínio específico.
O exemplo seguinte demonstra como utilizar o YOLO26 para extrair contexto visual (objetos detetados) de uma imagem, que poderia depois ser transmitido a um LLM como parte de um fluxo de trabalho RAG.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personLeitura adicional e recursos#
- Documentação do LangChain: Um guia abrangente para criar pipelines de recuperação, incluindo suporte multimodal.
- Guia multimodal do LlamaIndex: Documentação detalhada sobre a indexação e recuperação de tipos de dados complexos para LLMs.
- Google Cloud Vertex AI Search: Funcionalidades de pesquisa vetorial de nível empresarial para criar aplicações RAG escaláveis.
- Soluções da Ultralytics: Explora como a visão computacional se integra com sistemas de AI mais abrangentes em vários setores.









