Vision Language Model (VLM)
Explora Vision Language Models (VLM) com o Ultralytics. Aprende como unem visão computacional e LLMs para VQA e deteção de vocabulário aberto usando o Ultralytics YOLO26.
Um Vision Language Model (VLM) é um tipo de inteligência artificial capaz de processar e interpretar informações visuais (imagens ou vídeos) e textuais simultaneamente. Ao contrário dos modelos de computer vision tradicionais que focam apenas em dados de pixels, ou dos Large Language Models (LLMs) que compreendem apenas texto, os VLMs fazem a ponte entre essas duas modalidades. Ao treinar com maciços conjuntos de dados contendo pares de imagem e texto, estes modelos aprendem a associar caraterísticas visuais a conceitos linguísticos, permitindo-lhes descrever imagens, responder a perguntas sobre cenários visuais e até executar comandos com base no que "veem".
Como Funcionam os Vision Language Models#
Na sua essência, os VLMs consistem tipicamente em dois componentes principais: um codificador de visão e um codificador de texto. O codificador de visão processa imagens para extrair feature maps e representações visuais, enquanto o codificador de texto lida com a entrada linguística. Estes fluxos de dados distintos são depois fundidos utilizando mecanismos como cross-attention para alinhar a informação visual e textual num espaço de embedding partilhado.
Avanços recentes em 2024 e 2025 têm evoluído para arquiteturas mais unificadas onde um único backbone de Transformer lida com ambas as modalidades. Por exemplo, modelos como Google PaliGemma 2 demonstram quão eficazmente a integração destes fluxos pode melhorar o desempenho em tarefas de raciocínio complexas. Este alinhamento permite ao modelo compreender o contexto, tal como reconhecer que a palavra "apple" se refere a uma fruta numa imagem de um supermercado, mas a uma empresa de tecnologia num logótipo.
Aplicações no Mundo Real#
A capacidade de entender o mundo através da visão e da linguagem abre diversas aplicações em vários setores:
- Visual Question Answering (VQA): Os VLMs são amplamente utilizados no healthcare diagnostics para assistir radiologistas. Um médico pode perguntar a um sistema: "Existe uma fratura nesta radiografia?" e o modelo analisa a imagem médica para fornecer uma avaliação preliminar, reduzindo erros de diagnóstico.
- Smart E-Commerce Search: Em retail environments, os VLMs permitem aos utilizadores procurar produtos utilizando descrições em linguagem natural combinadas com imagens. Um comprador pode carregar a fotografia da roupa de uma celebridade e perguntar: "Encontra-me um vestido com este padrão mas em azul", e o sistema utiliza semantic search para recuperar correspondências precisas.
- Automated Captioning and Accessibility: Os VLMs geram automaticamente alt text descritivo para imagens na web, tornando o conteúdo digital mais acessível a utilizadores com deficiência visual que dependem de leitores de ecrã.
Diferenciar VLMs de Conceitos Relacionados#
É útil distinguir os VLMs de outras categorias de IA para entender o seu papel específico:
- VLM vs. LLM: Um Large Language Model (como as versões apenas de texto do GPT-4) processa apenas dados textuais. Embora consiga gerar histórias criativas ou código, não consegue "ver" uma imagem. Um VLM dá efetivamente olhos a um LLM.
- VLM vs. Object Detection: Os modelos de object detection tradicionais, tais como as primeiras versões do YOLO, identificam onde estão os objetos e a que classe pertencem (por exemplo, "Car: 99%"). Um VLM vai mais além ao compreender as relações e os atributos, tais como "um carro desportivo vermelho estacionado ao lado de umhidrante".
- VLM vs. Multimodal AI: Multimodal AI é um termo abrangente mais amplo. Embora todos os VLMs sejam multimodais (combinando visão e linguagem), nem todos os modelos multimodais são VLMs; alguns podem combinar áudio e texto (como fala para texto) ou vídeo e dados de sensores sem um componente de linguagem.
Deteção de Vocabulário Aberto com YOLO#
Os VLMs modernos permitem a deteção de "vocabulário aberto", onde podes detetar objetos utilizando comandos de texto de formato livre em vez de classes pré-definidas. Esta é uma funcionalidade chave de modelos como Ultralytics YOLO-World, que permite definições de classes dinâmicas sem necessidade de re-treino.
O exemplo seguinte demonstra como usar o pacote ultralytics para detetar objetos específicos descritos por texto:
from ultralytics import YOLOWorld
# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])
# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the detection results
results[0].show()Desafios e Direções Futuras#
Apesar de poderosos, os Vision Language Models enfrentam desafios significativos. Um dos principais problemas é a hallucination, em que o modelo descreve com confiança objetos ou texto numa imagem que simplesmente não lá estão. Os investigadores trabalham ativamente em técnicas como Reinforcement Learning from Human Feedback (RLHF) para melhorar a fundamentação e a precisão.
Outro desafio é o custo computacional. Treinar estes modelos massivos requer GPU resources substanciais. No entanto, o lançamento de arquiteturas eficientes como Ultralytics YOLO26 está a ajudar a trazer capacidades avançadas de visão para dispositivos de edge. À medida que avançamos, esperamos ver os VLMs a desempenhar um papel crucial em robotic agents, permitindo aos robôs navegar e manipular objetos com base em instruções verbais complexas.
Para aqueles interessados nos fundamentos teóricos, o CLIP paper by OpenAI original fornece excelentes perspetivas sobre a pré-treinagem contraste imagem-linguagem. Adicionalmente, acompanhar os CVPR conference papers é essencial para seguir a rápida evolução destas arquiteturas. Para fazeres experiências com o treino dos teus próprios modelos de visão, podes utilizar a Ultralytics Platform para uma gestão de conjuntos de dados e implementação de modelos simplificadas.






