YOLO Vision 2026:
Voltar para o Glossário da Ultralytics

Vision Language Model (VLM)

Explora Vision Language Models (VLM) com o Ultralytics. Aprende como unem visão computacional e LLMs para VQA e deteção de vocabulário aberto usando o Ultralytics YOLO26.

Um Vision Language Model (VLM) é um tipo de inteligência artificial capaz de processar e interpretar informações visuais (imagens ou vídeos) e textuais simultaneamente. Ao contrário dos modelos de computer vision tradicionais que focam apenas em dados de pixels, ou dos Large Language Models (LLMs) que compreendem apenas texto, os VLMs fazem a ponte entre essas duas modalidades. Ao treinar com maciços conjuntos de dados contendo pares de imagem e texto, estes modelos aprendem a associar caraterísticas visuais a conceitos linguísticos, permitindo-lhes descrever imagens, responder a perguntas sobre cenários visuais e até executar comandos com base no que "veem".

Como Funcionam os Vision Language Models#

Na sua essência, os VLMs consistem tipicamente em dois componentes principais: um codificador de visão e um codificador de texto. O codificador de visão processa imagens para extrair feature maps e representações visuais, enquanto o codificador de texto lida com a entrada linguística. Estes fluxos de dados distintos são depois fundidos utilizando mecanismos como cross-attention para alinhar a informação visual e textual num espaço de embedding partilhado.

Avanços recentes em 2024 e 2025 têm evoluído para arquiteturas mais unificadas onde um único backbone de Transformer lida com ambas as modalidades. Por exemplo, modelos como Google PaliGemma 2 demonstram quão eficazmente a integração destes fluxos pode melhorar o desempenho em tarefas de raciocínio complexas. Este alinhamento permite ao modelo compreender o contexto, tal como reconhecer que a palavra "apple" se refere a uma fruta numa imagem de um supermercado, mas a uma empresa de tecnologia num logótipo.

Aplicações no Mundo Real#

A capacidade de entender o mundo através da visão e da linguagem abre diversas aplicações em vários setores:

  • Visual Question Answering (VQA): Os VLMs são amplamente utilizados no healthcare diagnostics para assistir radiologistas. Um médico pode perguntar a um sistema: "Existe uma fratura nesta radiografia?" e o modelo analisa a imagem médica para fornecer uma avaliação preliminar, reduzindo erros de diagnóstico.
  • Smart E-Commerce Search: Em retail environments, os VLMs permitem aos utilizadores procurar produtos utilizando descrições em linguagem natural combinadas com imagens. Um comprador pode carregar a fotografia da roupa de uma celebridade e perguntar: "Encontra-me um vestido com este padrão mas em azul", e o sistema utiliza semantic search para recuperar correspondências precisas.
  • Automated Captioning and Accessibility: Os VLMs geram automaticamente alt text descritivo para imagens na web, tornando o conteúdo digital mais acessível a utilizadores com deficiência visual que dependem de leitores de ecrã.

Diferenciar VLMs de Conceitos Relacionados#

É útil distinguir os VLMs de outras categorias de IA para entender o seu papel específico:

  • VLM vs. LLM: Um Large Language Model (como as versões apenas de texto do GPT-4) processa apenas dados textuais. Embora consiga gerar histórias criativas ou código, não consegue "ver" uma imagem. Um VLM dá efetivamente olhos a um LLM.
  • VLM vs. Object Detection: Os modelos de object detection tradicionais, tais como as primeiras versões do YOLO, identificam onde estão os objetos e a que classe pertencem (por exemplo, "Car: 99%"). Um VLM vai mais além ao compreender as relações e os atributos, tais como "um carro desportivo vermelho estacionado ao lado de umhidrante".
  • VLM vs. Multimodal AI: Multimodal AI é um termo abrangente mais amplo. Embora todos os VLMs sejam multimodais (combinando visão e linguagem), nem todos os modelos multimodais são VLMs; alguns podem combinar áudio e texto (como fala para texto) ou vídeo e dados de sensores sem um componente de linguagem.

Deteção de Vocabulário Aberto com YOLO#

Os VLMs modernos permitem a deteção de "vocabulário aberto", onde podes detetar objetos utilizando comandos de texto de formato livre em vez de classes pré-definidas. Esta é uma funcionalidade chave de modelos como Ultralytics YOLO-World, que permite definições de classes dinâmicas sem necessidade de re-treino.

O exemplo seguinte demonstra como usar o pacote ultralytics para detetar objetos específicos descritos por texto:

from ultralytics import YOLOWorld

# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])

# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

Desafios e Direções Futuras#

Apesar de poderosos, os Vision Language Models enfrentam desafios significativos. Um dos principais problemas é a hallucination, em que o modelo descreve com confiança objetos ou texto numa imagem que simplesmente não lá estão. Os investigadores trabalham ativamente em técnicas como Reinforcement Learning from Human Feedback (RLHF) para melhorar a fundamentação e a precisão.

Outro desafio é o custo computacional. Treinar estes modelos massivos requer GPU resources substanciais. No entanto, o lançamento de arquiteturas eficientes como Ultralytics YOLO26 está a ajudar a trazer capacidades avançadas de visão para dispositivos de edge. À medida que avançamos, esperamos ver os VLMs a desempenhar um papel crucial em robotic agents, permitindo aos robôs navegar e manipular objetos com base em instruções verbais complexas.

Para aqueles interessados nos fundamentos teóricos, o CLIP paper by OpenAI original fornece excelentes perspetivas sobre a pré-treinagem contraste imagem-linguagem. Adicionalmente, acompanhar os CVPR conference papers é essencial para seguir a rápida evolução destas arquiteturas. Para fazeres experiências com o treino dos teus próprios modelos de visão, podes utilizar a Ultralytics Platform para uma gestão de conjuntos de dados e implementação de modelos simplificadas.

Explore solutions

Real-time AI that works with your team

IA em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

IA na Logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

IA no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

IA na Saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

IA na Fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

IA no Setor Automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

IA na Agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais
Real-time AI that works with your team

IA em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

IA na Logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

IA no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

IA na Saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

IA na Fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

IA no Setor Automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

IA na Agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais
Real-time AI that works with your team

IA em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

IA na Logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

IA no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

IA na Saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

IA na Fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

IA no Setor Automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

IA na Agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais

Vamos construir o futuro da IA juntos!

Começa a tua jornada com o futuro da aprendizagem automática