O que é YOLOE? Levando modelos de visão computacional mais longe
Aprenda como o YOLOE permite encontrar objetos usando um simples prompt ou foto. Ele possibilita uma visão computacional mais inteligente e rápida sem a necessidade de retreinar ou ajustar modelos.

A deteção de objetos é uma tarefa fundamental de visão computacional, em que o objetivo é identificar e localizar objetos em imagens ou vídeos. É uma parte crucial de computer vision, um campo da inteligência artificial (AI) que permite às máquinas compreender e interpretar dados visuais. Por exemplo, a deteção de objetos pode ajudar a identificar um carro numa fotografia ou detetar uma pessoa num feed de vídeo.
Uma das séries de modelos mais conhecidas que suporta computer vision tasks como a deteção de objetos é a série de modelos YOLO (You Only Look Once). Concebidos para oferecer velocidade e precisão, os modelos YOLO têm melhorado continuamente ao longo do tempo. Por exemplo, uma das versões mais recentes, o Ultralytics YOLO11, tem um excelente desempenho em situações do mundo real, fornecendo resultados precisos mesmo em ambientes mais complexos.
Levando esse progresso ainda mais longe, um novo modelo chamado YOLOE visa expandir as capacidades dos modelos YOLO. Ao contrário dos modelos tradicionais que exigem retreinamento para reconhecer novos objetos, o YOLOE pode seguir simples prompts de texto ou imagem para detectar objetos que nunca viu antes, tornando-o muito mais adaptável a ambientes em constante mudança.
Neste artigo, vamos analisar mais de perto what makes YOLOE unique, como se compara com os modelos YOLO anteriores e como podes começar a usá-lo hoje mesmo. Vamos a isso!
Uma visão geral do YOLOE#
O YOLOE é um modelo de visão computacional que leva a detecção de objetos um passo adiante. Foi introduzido em março de 2025 por pesquisadores da Universidade de Tsinghua. O que diferencia o YOLOE dos modelos tradicionais é o uso da detecção de vocabulário aberto.
Embora a maioria dos modelos seja treinada para reconhecer uma lista fixa de objetos, o YOLOE permite que você especifique o que procurar usando uma breve descrição ou um exemplo de imagem. Por exemplo, se estiver procurando por uma “mochila verde”, você pode digitar essa descrição ou mostrar uma foto ao modelo, e o YOLOE a localizará dentro da cena.
Além disso, mesmo sem qualquer prompt, o YOLOE consegue detetar muitos objetos do dia a dia por conta própria. Esta capacidade de reconhecer objetos que nunca viu antes chama-se zero-shot detection. É particularmente útil em ambientes dinâmicos onde a tarefa ou os objetos de interesse podem mudar inesperadamente.

Fig 1. Uma vista geral das capacidades do YOLOE.
Principais recursos do YOLOE#
YOLOE suporta uma vasta gama de funcionalidades concebidas para melhorar o seu desempenho em aplicações do mundo real. Com a sua capacidade de lidar com dados de entrada estruturados e não estruturados, o YOLOE abre novas possibilidades para a deteção e segmentação de objetos.
Aqui estão alguns dos principais recursos que o modelo traz:
- Detecção baseada em prompt: O YOLOE pode procurar objetos com base em um pequeno prompt de texto ou em um exemplo de imagem. Isso significa que você não precisa retreinar o modelo sempre que sua tarefa mudar; basta descrever ou mostrar ao modelo o que você está procurando.
- Instance segmentation: Para além de desenhar caixas delimitadoras à volta dos objetos, o YOLOE consegue delinear a sua forma exata utilizando a segmentação de instâncias. Isto é especialmente útil quando os objetos se sobrepõem ou quando precisas de saber os limites precisos de um objeto.
- Reconhecimento de objetos sem prompt: O YOLOE pode reconhecer objetos mesmo sem instruções específicas. Ele usa um conjunto de descrições pré-aprendidas para identificar objetos rapidamente, tornando o processo mais rápido e eficiente.
Comparando o YOLOE com outros modelos YOLO#
Agora que temos uma compreensão melhor do que é o YOLOE, vamos dar uma olhada em alguns dos modelos da família YOLO que são semelhantes.
À medida que a visão computacional progrediu, o mesmo aconteceu com os modelos YOLO. Por exemplo, o Ultralytics YOLOv8 trouxe suporte para novas tarefas como a segmentação e a classificação, enquanto versões posteriores, como o Ultralytics YOLO11, se têm focado em melhorar a precisão e o desempenho para uma gama mais ampla de tarefas.
Além disso, o YOLO-World foi lançado em janeiro de 2024 e introduziu a capacidade de utilizar prompts escritas, permitindo aos utilizadores descrever os objetos que querem encontrar. Embora o YOLO-World tenha sido uma excelente opção para deteção zero-shot, faltavam-lhe funcionalidades como a segmentação de instâncias e o suporte a prompts visuais.
O YOLOE baseia-se no YOLO-World adicionando essas capacidades, melhorando a flexibilidade e o desempenho, e oferecendo uma ferramenta mais impactante para aplicações de visão computacional do mundo real.

Fig 2. Tanto o YOLO-World como o YOLOE suportam deteção zero-shot.
Usando o YOLOE com o pacote Python do Ultralytics#
Se você quer detectar objetos específicos ou explorar tudo em uma imagem, começar com o YOLOE é simples. Este modelo é suportado pelo pacote Python do Ultralytics, facilitando a integração em seus projetos. A seguir, vamos ver como usá-lo.
Instalando o pacote Ultralytics#
O primeiro passo é instalar o Ultralytics Python package utilizando um gestor de pacotes como o 'pip'. Podes fazê-lo executando o comando “pip install ultralytics” no teu terminal ou linha de comandos.
Assim que o pacote estiver instalado, terás tudo o que precisas para carregar o modelo, fazer previsões e experienciar diferentes modos de deteção. Se encontrares algum problema durante a instalação, a documentação oficial da Ultralytics oferece uma útil troubleshooting section.
Existem algumas maneiras diferentes de usar o YOLOE para realizar previsões. Executar previsões significa usar o modelo treinado para identificar e localizar objetos dentro de imagens ou vídeos. Esses métodos diferentes permitem que você personalize como interage com o modelo com base em suas necessidades específicas.
Vamos discutir cada um desses métodos, um por um.
Detectando objetos específicos com prompts de texto ou imagem#
O YOLOE pode detectar objetos com base em uma breve descrição de texto. Por exemplo, se você está procurando por um cavalo em movimento, pode usar um prompt como "horse walking".
Para começar, primeiro carregue o modelo YOLOE pré-treinado e defina seu prompt (a descrição do que você quer que o modelo procure), como mostrado no trecho de código abaixo.
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg.pt")
prompt = ["horse walking"]
model.set_classes(prompt, model.get_text_pe(prompt))Uma vez que seu modelo e prompt estejam definidos, você pode executar o modelo em uma imagem ou vídeo. Substitua o caminho do arquivo no código pelo caminho para seu arquivo de imagem ou vídeo:
results = model.predict("path/to/your/image.jpg")
results[0].show()Isso exibirá a imagem com o objeto detectado claramente marcado com base no seu prompt. Você pode alterar o prompt para procurar objetos diferentes, como "red suitcase", "bicycle" ou "zebra", dependendo do que você está procurando.

Fig 3. Um exemplo do uso do YOLOE para detectar objetos específicos usando um prompt de texto.
Da mesma forma, você pode usar uma imagem para solicitar o YOLOE com o pacote Python do Ultralytics. No modo de prompt visual, o modelo usa a imagem para encontrar itens de aparência semelhante em outra cena. Isso é particularmente útil para objetos difíceis de descrever ou que não possuem rótulos claros.
Para explorar o código para isto em mais detalhe, podes consultar a Ultralytics documentation.
Detecção geral de objetos usando o YOLOE#
Em alguns casos, você pode não saber exatamente o que procurar, ou pode não estar procurando por um objeto em particular. É aí que o modo sem prompt se torna útil.
Com esta opção, não precisas de escrever uma descrição ou fornecer uma imagem de exemplo. O YOLOE simplesmente analisa imagens por conta própria e detects tudo o que consegue reconhecer, tais como pessoas, animais, mobiliário ou objetos do dia a dia.
É uma maneira útil de explorar uma cena sem dar ao modelo instruções específicas. Seja examinando uma sala lotada ou revisando filmagens com muita atividade, o modo sem prompt lhe dá uma visão rápida do que está presente em uma imagem.
Você pode usar o código a seguir para executar o YOLOE no modo sem prompt. Primeiro, o modelo é carregado, então ele processa a imagem e detecta automaticamente os objetos nela. Finalmente, os resultados são exibidos e os objetos detectados são destacados.
Certifique-se de substituir o caminho do arquivo pelo caminho real para sua imagem.
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg-pf.pt")
results = model.predict("path/to/image.jpg")
results[0].show()A imagem mostrada abaixo é um exemplo do que o YOLOE pode detectar no modo sem prompt.

Fig 4. Usando o YOLOE no modo sem prompt.
Aplicações em tempo real do YOLOE#
A capacidade do YOLOE de responder a prompts de texto e imagem o torna uma ferramenta confiável para aplicações em tempo real. Sua flexibilidade é particularmente útil em ambientes dinâmicos onde o tempo e a precisão são essenciais.
Vamos explorar alguns exemplos do mundo real de como o YOLOE pode ser usado.
Melhorando o manuseio de bagagem: detecção de bagagem em tempo real#
Em airports movimentados, localizar bagagem específica pode ser um desafio, especialmente quando se lida com malas perdidas. O YOLOE pode simplificar este processo ao ajudar a analisar vídeos em direto e a identificar rapidamente itens com base em prompts simples como "mala vermelha".
Se uma mala estiver perdida ou extraviada, a equipe pode facilmente alterar o prompt para procurar um item diferente, como uma “black suitcase”. Essa capacidade de adaptação instantânea pode ajudar a equipe do aeroporto a localizar rapidamente a bagagem certa sem precisar revisar longas horas de filmagem ou retreinar o modelo, tornando o manuseio de bagagem e a resolução de problemas de malas perdidas muito mais rápidos e eficientes.
Monitorando espaços públicos com o YOLOE#
Filmagens de segurança de espaços públicos, como mercados e cafés lotados, geralmente incluem uma mistura de pessoas, objetos e atividades que mudam ao longo do dia. O YOLOE pode analisar essas filmagens em tempo real usando o modo sem prompt, detectando automaticamente itens como malas, mesas ou bicicletas sem precisar de instruções específicas.

Fig 5. O YOLOE pode detectar vários objetos em um espaço público movimentado.
Isto é particularmente útil para as security teams detetarem itens abandonados ou monitorizarem o movimento de multidões. A capacidade do YOLOE de detetar vários objetos em simultâneo torna mais fácil gerir espaços públicos durante eventos ou períodos movimentados, ajudando as equipas a manterem-se informadas e prontas a agir.
Prós e contras do YOLOE#
Aqui estão alguns dos principais benefícios de usar o YOLOE para aplicações de visão computacional:
- Desempenho em tempo real: O YOLOE é otimizado para um processamento rápido e eficiente, permitindo a detecção em tempo real, mesmo em ambientes dinâmicos como transmissões de vídeo ao vivo ou espaços públicos movimentados.
- Scalability: O YOLOE é escalável e funciona bem para uma grande variedade de aplicações, desde a segurança e vigilância até ao retalho, cuidados de saúde e veículos autónomos.
- Fácil de usar: Como o YOLOE é suportado pelo pacote Python do Ultralytics, é fácil integrá-lo aos seus projetos de visão computacional existentes.
No entanto, existem algumas limitações a serem lembradas ao usar o YOLOE. Aqui estão alguns fatores a considerar:
- Requer dados de treinamento suficientes: Embora o YOLOE suporte detecção zero-shot, seu desempenho em objetos não vistos depende de quão bem ele generaliza a partir de seus dados de treinamento. Em alguns casos, pode ser necessário dados adicionais ou ajuste fino para ter um bom desempenho em tarefas altamente especializadas.
- Sensível à qualidade da entrada: A precisão do modelo pode ser afetada por imagens ou vídeos de baixa qualidade. Entradas borradas ou com pouca iluminação podem reduzir a capacidade do modelo de detectar objetos com precisão, portanto, uma entrada de alta qualidade é importante para um desempenho ideal.
Principais pontos#
O YOLOE traz mais flexibilidade para a visão computacional, permitindo que os usuários guiem a detecção com prompts de texto ou imagem. Ele funciona bem em situações do mundo real onde as cenas mudam rapidamente e o retreinamento não é uma opção.
Do manuseio de bagagem ao monitoramento de espaços públicos, o YOLOE se adapta a novas tarefas com facilidade. À medida que a IA se torna mais acessível, modelos como o YOLOE estão ajudando mais indústrias a usar a tecnologia de visão de maneiras práticas e eficientes.
Junte-te à nossa community e explora o nosso GitHub repository para saberes mais sobre inovações em IA. Descobre os avanços mais recentes em áreas como AI in retail e computer vision in healthcare nas nossas páginas de soluções. Vê as nossas licensing options e começa a usar a visão computacional hoje mesmo!






