Vision Language Model (VLM)
Explore os modelos de linguagem e visão (VLM) com a Ultralytics. Saiba como eles conectam visão computacional e LLMs para VQA e detecção de vocabulário aberto usando o Ultralytics YOLO26.
Um Modelo de Visão-Linguagem (VLM) é um tipo de inteligência artificial capaz de processar e interpretar simultaneamente informações visuais (imagens ou vídeos) e textuais. Ao contrário dos modelos tradicionais de visão computacional, que se concentram apenas em dados de píxeis, ou dos Grandes Modelos de Linguagem (LLMs), que compreendem apenas texto, os VLMs fazem a ponte entre estas duas modalidades. Ao serem treinados com conjuntos de dados enormes que contêm pares de imagem e texto, estes modelos aprendem a associar características visuais a conceitos linguísticos, o que lhes permite descrever imagens, responder a perguntas sobre cenas visuais e até executar comandos com base no que «veem».
Como funcionam os Modelos de Visão-Linguagem#
Na sua essência, os VLMs são normalmente compostos por dois componentes principais: um codificador visual e um codificador de texto. O codificador visual processa imagens para extrair mapas de características e representações visuais, enquanto o codificador de texto processa a entrada linguística. Estes fluxos de dados distintos são então fundidos usando mecanismos como a atenção cruzada, para alinhar as informações visuais e textuais num espaço de incorporação partilhado.
Os avanços recentes de 2024 e 2025 apontam para arquiteturas mais unificadas, nas quais uma única base transformer processa ambas as modalidades. Por exemplo, modelos como o Google PaliGemma 2 demonstram como a integração eficaz destes fluxos pode melhorar o desempenho em tarefas complexas de raciocínio. Este alinhamento permite que o modelo compreenda o contexto, por exemplo, reconhecendo que a palavra «apple» se refere a uma fruta numa imagem de supermercado, mas a uma empresa de tecnologia num logótipo.
Aplicações no mundo real#
A capacidade de compreender o mundo através da visão e da linguagem abre diversas aplicações em vários setores:
- Perguntas e respostas visuais (VQA): Os VLMs são amplamente utilizados em diagnósticos de saúde para ajudar radiologistas. Um médico pode perguntar ao sistema: «Há alguma fratura nesta radiografia?», e o modelo analisa a imagem médica para fornecer uma avaliação preliminar, reduzindo os erros de diagnóstico.
- Pesquisa inteligente em comércio eletrónico: Em ambientes de retalho, os VLMs permitem que os usuários pesquisem produtos usando descrições em linguagem natural combinadas com imagens. Um comprador pode carregar uma fotografia do vestuário de uma celebridade e perguntar: «Encontra-me um vestido com este padrão, mas azul», e o sistema utiliza a pesquisa semântica para encontrar correspondências precisas.
- Geração automática de legendas e acessibilidade: Os VLMs geram automaticamente texto alternativo descritivo para imagens na web, tornando o conteúdo digital mais acessível para usuários com deficiência visual que dependem de leitores de ecrã.
Diferenças entre VLMs e conceitos relacionados#
É útil distinguir os VLMs de outras categorias de IA para compreender a sua função específica:
- VLM vs. LLM: Um Grande Modelo de Linguagem (como as versões apenas textuais do GPT-4) processa somente dados de texto. Embora possa gerar histórias criativas ou código, não consegue «ver» uma imagem. Um VLM dá efetivamente olhos a um LLM.
- VLM vs. deteção de objetos: Os modelos tradicionais de deteção de objetos, como as primeiras versões do YOLO, identificam onde estão os objetos e a que classe pertencem (por exemplo, «Carro: 99%»). Um VLM vai mais além, compreendendo relações e atributos, como «um carro desportivo vermelho estacionado junto a um hidrante».
- VLM vs. IA multimodal: A IA multimodal é um termo abrangente. Embora todos os VLMs sejam multimodais (combinam visão e linguagem), nem todos os modelos multimodais são VLMs; alguns podem combinar áudio e texto (como conversão de fala em texto) ou vídeo e dados de sensores sem um componente linguístico.
Deteção de vocabulário aberto com YOLO#
Os VLMs modernos permitem a deteção de «vocabulário aberto», na qual podes detetar objetos usando prompts de texto livres em vez de classes predefinidas. Esta é uma funcionalidade essencial de modelos como Ultralytics YOLO-World, que permite definir classes dinamicamente sem novo treinamento.
O exemplo seguinte demonstra como utilizar o pacote ultralytics para detetar objetos específicos descritos por texto:
from ultralytics import YOLOWorld
# Carrega um modelo capaz de compreender visão e linguagem
model = YOLOWorld("yolov8s-world.pt")
# Define classes personalizadas usando prompts de texto em linguagem natural
model.set_classes(["person wearing sunglasses", "red backpack"])
# Executa a inferência para encontrar numa imagem estes objetos definidos por texto
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Apresenta os resultados da deteção
results[0].show()Desafios e direções futuras#
Apesar do seu poder, os Modelos de Visão-Linguagem enfrentam desafios significativos. Um dos principais problemas é a alucinação, na qual o modelo descreve com confiança objetos ou texto numa imagem que simplesmente não estão lá. Os pesquisadores estão a trabalhar ativamente em técnicas como a Aprendizagem por Reforço com Feedback Humano (RLHF) para melhorar o ancoramento e a precisão.
Outro desafio é o custo computacional. O treino destes modelos enormes exige recursos substanciais de GPU. No entanto, o lançamento de arquiteturas eficientes, como Ultralytics YOLO26, está a ajudar a levar capacidades avançadas de visão para dispositivos de borda. À medida que avançamos, esperamos que os VLMs desempenhem um papel crucial em agentes robóticos, permitindo que os robôs naveguem e manipulem objetos com base em instruções verbais complexas.
Para quem se interessa pelos fundamentos teóricos, o artigo original sobre CLIP da OpenAI oferece excelentes informações sobre o pré-treinamento contrastivo de linguagem e imagem. Além disso, acompanhar os artigos da conferência CVPR é essencial para seguir a rápida evolução destas arquiteturas. Para experimentar o treinamento dos teus próprios modelos visuais, podes utilizar a Ultralytics Platform para simplificar a gestão de conjuntos de dados e a implementação de modelos.









