Ultralytics YOLO27:
IA para visão

Melhorar aplicações de IA com RAG e visão computacional

Saiba como combinar a geração aumentada por recuperação (RAG) com a visão computacional está a ajudar os sistemas de IA a interpretar documentos, elementos visuais e conteúdos complexos do mundo real.

ABAbirami Vina10 min read
Melhorar aplicações de IA com RAG e visão computacional

Usar ferramentas de IA como o ChatGPT ou o Gemini está rapidamente a tornar-se uma forma comum de encontrar informação. Quer estejas a redigir uma mensagem, a resumir um documento ou a responder a uma pergunta, estas ferramentas oferecem frequentemente uma solução mais rápida e simples.

Mas, se já usaste modelos de linguagem de grande escala (LLMs) algumas vezes, provavelmente já reparaste nas suas limitações. Quando recebem perguntas muito específicas ou sensíveis ao tempo, podem responder incorretamente, muitas vezes com grande confiança.

Isto acontece porque os LLMs autónomos dependem exclusivamente dos dados com que foram treinados. Não têm acesso às atualizações mais recentes nem a conhecimentos especializados para além desse conjunto de dados. Como resultado, as suas respostas podem estar desatualizadas ou ser imprecisas.

Para ajudar a resolver este problema, os investigadores desenvolveram um método chamado geração aumentada por recuperação (RAG). O RAG melhora os modelos de linguagem ao permitir-lhes obter informação atualizada e relevante de fontes fidedignas ao responder a perguntas.

Neste artigo, vamos explorar como funciona o RAG e como melhora as ferramentas de IA ao recuperar informação relevante e atualizada. Vamos também analisar como funciona em conjunto com a visão computacional, um campo da inteligência artificial focado na interpretação de dados visuais, para ajudar os sistemas a compreender não só texto, mas também imagens, esquemas e documentos visualmente complexos.

Compreender a geração aumentada por recuperação (RAG)#

Quando fazemos uma pergunta a um chatbot de IA, geralmente esperamos mais do que uma resposta que apenas pareça boa. Idealmente, uma boa resposta deve ser clara, precisa e genuinamente útil. Para fornecer isso, o modelo de IA precisa de mais do que competências linguísticas; também precisa de acesso à informação certa, especialmente no caso de tópicos específicos ou sensíveis ao tempo.

O RAG é uma técnica que ajuda a colmatar esta lacuna. Combina a capacidade do modelo de linguagem para compreender e gerar texto com o poder de recuperar informação relevante de fontes externas. Em vez de depender exclusivamente dos seus dados de treino, o modelo obtém ativamente conteúdo de apoio a partir de bases de conhecimento fidedignas enquanto formula a sua resposta.

Principais casos de utilização do RAG

Fig. 1. Principais casos de utilização do RAG. Imagem do autor.

Podes pensar nisto como fazer uma pergunta a alguém e essa pessoa consultar uma referência fiável antes de responder. A resposta continua a ser dada pelas suas próprias palavras, mas é informada pela informação mais relevante e atualizada.

Esta abordagem ajuda os LLMs a responder com respostas mais completas, precisas e adaptadas à pergunta do utilizador, tornando-os muito mais fiáveis em aplicações do mundo real nas quais a precisão é realmente importante.

Uma análise de como funciona o RAG#

O RAG melhora a forma como um modelo de linguagem de grande escala responde ao introduzir dois passos fundamentais: recuperação e geração. Primeiro, recupera informação relevante de uma base de conhecimento externa. Depois, utiliza essa informação para gerar uma resposta bem estruturada e consciente do contexto.

Vejamos um exemplo simples para perceber como funciona este processo. Imagina que estás a utilizar um assistente de IA para gerir as tuas finanças pessoais e queres verificar se respeitaste o teu objetivo de despesas do mês.

O processo começa quando fazes ao assistente uma pergunta como: "Mantive-me dentro do meu orçamento este mês?" Em vez de depender apenas do que aprendeu durante o treino, o sistema utiliza um recuperador para pesquisar os teus registos financeiros mais recentes (como extratos bancários ou resumos de transações). Concentra-se em compreender a intenção por trás da tua pergunta e reúne a informação mais relevante.

Depois de recuperar essa informação, o modelo de linguagem assume o controlo. Processa tanto a tua pergunta como os dados obtidos dos teus registos para gerar uma resposta clara e útil. Em vez de apresentar detalhes em bruto, a resposta resume as tuas despesas e fornece uma conclusão direta e relevante — por exemplo, confirmando se atingiste o teu objetivo e destacando as principais áreas de despesa.

Esta abordagem ajuda o LLM a fornecer respostas que não só são precisas, como também se baseiam na tua informação real e atualizada, tornando a experiência muito mais útil do que a de um modelo que trabalha apenas com dados de treino estáticos.

Compreender como funciona o RAG

Fig. 2. Compreender como funciona o RAG.

A necessidade de sistemas RAG multimodais#

Normalmente, a informação nem sempre é partilhada em texto simples. Desde exames médicos e diagramas a diapositivos de apresentações e documentos digitalizados, os elementos visuais contêm frequentemente detalhes importantes. Os LLMs tradicionais, que são desenvolvidos principalmente para ler e compreender texto, podem ter dificuldades com este tipo de conteúdo.

No entanto, o RAG pode ser utilizado em conjunto com a visão computacional para colmatar essa lacuna. Quando combinados, formam o que é conhecido como um sistema RAG multimodal — uma configuração capaz de processar texto e elementos visuais, ajudando os chatbots de IA a fornecer respostas mais precisas e completas.

No centro desta abordagem estão os modelos de visão-linguagem (VLMs), concebidos para processar e raciocinar sobre ambos os tipos de entrada. Nesta configuração, o RAG recupera a informação mais relevante de grandes fontes de dados, enquanto o VLM, possibilitado pela visão computacional, interpreta imagens, esquemas e diagramas.

Isto é especialmente útil para documentos do mundo real, como formulários digitalizados, relatórios médicos ou diapositivos de apresentações, nos quais podem ser encontrados detalhes vitais tanto no texto como nos elementos visuais. Por exemplo, ao analisar um documento que inclui imagens juntamente com tabelas e parágrafos, um sistema multimodal pode extrair elementos visuais, gerar um resumo do que mostram e combinar essa informação com o texto envolvente para fornecer uma resposta mais completa e útil.

RAG multimodal que utiliza imagens e texto para fornecer respostas melhores

Fig. 3. O RAG multimodal utiliza imagens e texto para fornecer respostas melhores.

Aplicações do RAG para dados visuais#

Agora que abordámos o que é o RAG e como funciona com a visão computacional, vejamos alguns exemplos do mundo real e projetos de investigação que mostram como esta abordagem está a ser utilizada.

Compreender documentos visuais com o VisRAG#

Imagina que estás a tentar extrair informações de um relatório financeiro ou de um documento jurídico digitalizado. Estes tipos de ficheiros incluem frequentemente não só texto, mas também tabelas, gráficos e esquemas que ajudam a explicar a informação. Um modelo de linguagem convencional pode ignorar ou interpretar incorretamente estes elementos visuais, resultando em respostas incompletas ou imprecisas.

O VisRAG foi criado por investigadores para responder a este desafio. É um pipeline RAG baseado em VLM que trata cada página como uma imagem, em vez de processar apenas o texto. Isto permite ao sistema compreender tanto o conteúdo como a sua estrutura visual. Como resultado, consegue encontrar as partes mais relevantes e fornecer respostas mais claras, precisas e baseadas no contexto integral do documento.

O VisRAG lê documentos como imagens para captar o conteúdo e o esquema

Fig. 4. O VisRAG consegue ler documentos como imagens para captar o conteúdo textual e o esquema.

Resposta a perguntas visuais com RAG#

A resposta a perguntas visuais (VQA) é uma tarefa na qual um sistema de IA responde a perguntas sobre imagens. Muitos sistemas de VQA existentes concentram-se em responder a perguntas sobre um único documento sem precisarem de pesquisar informação adicional — isto é conhecido como uma configuração fechada.

O VDocRAG é uma estrutura RAG que adota uma abordagem mais realista. Integra VQA com a capacidade de recuperar primeiro documentos relevantes. Isto é útil em situações do mundo real nas quais a pergunta de um utilizador pode aplicar-se a um de muitos documentos e o sistema precisa de encontrar o documento certo antes de responder. Para isso, o VDocRAG utiliza VLMs para analisar documentos como imagens, preservando tanto o texto como a estrutura visual.

Isto torna o VDocRAG especialmente impactante em aplicações como pesquisa empresarial, automação de documentos e apoio ao cliente. Pode ajudar as equipas a extrair rapidamente respostas de documentos complexos e visualmente formatados, como manuais ou documentos de políticas, nos quais compreender o esquema é tão importante como ler as palavras.

A diferença entre o VDocRAG e as soluções baseadas em LLM

Fig. 5. A diferença entre o VDocRAG e as soluções baseadas em LLM.

Melhorar a legendagem de imagens com RAG#

A legendagem de imagens consiste em gerar uma descrição escrita do que está a acontecer numa imagem. É utilizada numa variedade de aplicações — desde tornar o conteúdo online mais acessível a potenciar a pesquisa de imagens e apoiar sistemas de moderação e recomendação de conteúdos.

No entanto, gerar legendas precisas nem sempre é fácil para os modelos de IA. É especialmente difícil quando a imagem mostra algo diferente daquilo com que o modelo foi treinado. Muitos sistemas de legendagem dependem fortemente dos dados de treino, por isso, quando se deparam com cenas desconhecidas, as suas legendas podem ser vagas ou imprecisas.

Para resolver este problema, os investigadores desenvolveram o Re-ViLM, um método que introduz a geração aumentada por recuperação (RAG) na legendagem de imagens. Em vez de gerar uma legenda de raiz, o Re-ViLM recupera pares semelhantes de imagem e texto de uma base de dados e utiliza-os para orientar a saída da legenda.

Esta abordagem baseada em recuperação ajuda o modelo a fundamentar as suas descrições em exemplos relevantes, melhorando tanto a precisão como a fluência. Os primeiros resultados mostram que o Re-ViLM gera legendas mais naturais e conscientes do contexto através da utilização de exemplos reais, ajudando a reduzir descrições vagas ou imprecisas.

O Re-ViLM melhora as legendas de imagens ao recuperar exemplos visuais e textuais

Fig. 6. O Re-ViLM melhora as legendas de imagens ao recuperar exemplos visuais e textuais.

Vantagens e desvantagens da utilização do RAG para compreender dados visuais#

Vejamos rapidamente as vantagens de aplicar técnicas de geração aumentada por recuperação para obter e utilizar informação visual:

  • Capacidades de sumarização melhoradas: Os resumos podem incorporar informações provenientes de elementos visuais (como tendências em gráficos ou elementos de infografias), e não apenas de texto.
  • Pesquisa e recuperação mais robustas: Os passos de recuperação podem identificar páginas visuais relevantes mesmo quando não existem palavras-chave no texto, utilizando a compreensão baseada em imagens.
  • Suporte para documentos digitalizados, manuscritos ou baseados em imagens: Os pipelines RAG possibilitados por VLMs podem processar conteúdos que seriam ilegíveis para modelos baseados apenas em texto.

Apesar destas vantagens, ainda existem algumas limitações a ter em conta ao utilizar RAG para trabalhar com dados visuais. Eis algumas das principais:

  • Elevados requisitos computacionais: Analisar imagens e texto utiliza mais memória e capacidade de processamento, o que pode tornar o desempenho mais lento ou aumentar os custos.
  • Questões de privacidade e segurança dos dados: Os documentos visuais, especialmente em setores como o da saúde ou das finanças, podem conter informação sensível que complica os fluxos de trabalho de recuperação e processamento.
  • Tempos de inferência mais longos: Como o processamento visual acrescenta complexidade, a geração de respostas pode demorar mais tempo em comparação com sistemas baseados apenas em texto.

Principais conclusões#

A geração aumentada por recuperação está a melhorar a forma como os modelos de linguagem de grande escala respondem a perguntas, permitindo-lhes obter informação relevante e atualizada de fontes externas. Quando combinados com a visão computacional, estes sistemas conseguem processar não só texto, mas também conteúdos visuais, como gráficos, tabelas, imagens e documentos digitalizados, resultando em respostas mais precisas e abrangentes.

Esta abordagem torna os LLMs mais adequados para tarefas do mundo real que envolvem documentos complexos. Ao combinar recuperação e compreensão visual, estes modelos conseguem interpretar formatos diversos de forma mais eficaz e fornecer informações mais úteis em contextos práticos do dia a dia.

Junta-te à nossa comunidade em crescimento! Explora o nosso repositório no GitHub para aprofundares os teus conhecimentos sobre IA. Queres começar os teus próprios projetos de visão computacional? Consulta as nossas opções de licenciamento. Descobre mais sobre IA na área da saúde e visão computacional no retalho nas nossas páginas de soluções!

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática