YOLO12 explicado: aplicações e casos de uso no mundo real
Descobre o YOLO12, o mais recente modelo de visão computacional! Aprende como a sua arquitetura centrada na atenção e a tecnologia FlashAttention melhoram as tarefas de deteção de objetos em vários setores.

A visão computacional é um ramo da inteligência artificial (AI) que ajuda as máquinas a compreender imagens e vídeos. É uma área que avança a um ritmo incrível porque investigadores e programadores de AI estão constantemente a ultrapassar limites. A comunidade de AI procura sempre tornar os modelos mais rápidos, inteligentes e eficientes. Uma das mais recentes inovações é o YOLO12, a mais recente adição à série de modelos YOLO, lançada em 18 de fevereiro de 2025.
O YOLO12 foi desenvolvido por investigadores da University at Buffalo, SUNY (Universidade Estadual de Nova Iorque) e da University of Chinese Academy of Sciences. Numa nova abordagem única, o YOLO12 introduz mecanismos de atenção, permitindo que o modelo se concentre nas partes mais importantes de uma imagem, em vez de processar tudo de forma igual.
Também inclui o FlashAttention, uma técnica que acelera o processamento enquanto utiliza menos memória, e um mecanismo de atenção por área, concebido para imitar a forma como os seres humanos se concentram naturalmente nos objetos centrais.
Estas melhorias tornam o YOLO12n 2,1% mais preciso do que o YOLOv10n e o YOLO12m 1,0% mais preciso do que o YOLO11m. No entanto, isto implica uma desvantagem: o YOLO12n é 9% mais lento do que o YOLOv10n, e o YOLO12m é 3% mais lento do que o YOLO11m.

Fig. 1. Um exemplo da utilização do YOLO12 para detetar objetos.
Neste artigo, vamos explorar o que diferencia o YOLO12, como se compara com versões anteriores e onde pode ser aplicado.
O caminho até ao lançamento do YOLO12#
A série de modelos YOLO é uma coleção de modelos de visão computacional concebidos para a deteção de objetos em tempo real, o que significa que conseguem identificar e localizar rapidamente objetos em imagens e vídeos. Ao longo do tempo, cada versão melhorou em termos de velocidade, precisão e eficiência.
Por exemplo, o Ultralytics YOLOv5, lançado em 2020, tornou-se amplamente utilizado por ser rápido e fácil de treinar e implementar de forma personalizada. Mais tarde, o Ultralytics YOLOv8 melhorou este aspeto ao oferecer suporte adicional para tarefas de visão computacional, como a segmentação de instâncias e o rastreamento de objetos.
Mais recentemente, o Ultralytics YOLO11 concentrou-se em melhorar o processamento em tempo real, mantendo um equilíbrio entre velocidade e precisão. Por exemplo, o YOLO11m tinha 22% menos parâmetros do que o YOLOv8m, mas ainda assim apresentou um desempenho de deteção superior no conjunto de dados COCO, uma referência amplamente utilizada para avaliar modelos de deteção de objetos.
Com base nestes avanços, o YOLO12 introduz uma mudança na forma como processa informações visuais. Em vez de tratar todas as partes de uma imagem de forma igual, dá prioridade às áreas mais relevantes, melhorando a precisão da deteção. Em termos simples, o YOLO12 baseia-se em melhorias anteriores, procurando ser mais preciso.
Principais funcionalidades do YOLO12#
O YOLO12 introduz várias melhorias que aperfeiçoam as tarefas de visão computacional, mantendo as velocidades de processamento em tempo real. Eis uma visão geral das principais funcionalidades do YOLO12:
- Arquitetura centrada na atenção: Em vez de tratar cada parte de uma imagem de forma igual, o YOLO12 concentra-se nas áreas mais importantes. Isto melhora a precisão e reduz o processamento desnecessário, tornando a deteção mais nítida e eficiente, mesmo em imagens com muitos elementos.
- FlashAttention: O YOLO12 acelera a análise de imagens utilizando menos memória. Com o FlashAttention (um algoritmo eficiente em termos de memória), otimiza o tratamento de dados, reduzindo a carga sobre o hardware e tornando as tarefas em tempo real mais fluidas e fiáveis.
- Redes de agregação eficiente de camadas residuais (R-ELAN): O YOLO12 organiza as suas camadas de forma mais eficiente utilizando R-ELAN, o que melhora a forma como o modelo processa e aprende com os dados. Isto torna o treino mais estável, o reconhecimento de objetos mais preciso e os requisitos computacionais mais baixos, permitindo que seja executado de forma eficiente em diferentes ambientes.
Para compreender como estas funcionalidades funcionam na vida real, considera um centro comercial. O YOLO12 pode ajudar a rastrear clientes, identificar elementos decorativos das lojas, como plantas em vasos ou cartazes promocionais, e detetar objetos deslocados ou abandonados.
A sua arquitetura centrada na atenção ajuda-o a concentrar-se nos detalhes mais importantes, enquanto o FlashAttention garante que processa tudo rapidamente sem sobrecarregar o sistema. Isto facilita o trabalho dos operadores do centro comercial na melhoria da segurança, na organização dos espaços das lojas e no aperfeiçoamento da experiência geral de compras.

Fig. 2. Deteção de objetos num centro comercial utilizando o YOLO12.
No entanto, o YOLO12 também apresenta algumas limitações a considerar:
- Tempos de treino mais longos: Devido à sua arquitetura, o YOLO12 requer mais tempo de treino do que o Ultralytics YOLO11.
- Desafios na exportação: Alguns utilizadores podem encontrar dificuldades ao exportar modelos YOLO12, especialmente ao integrá-los em ambientes de implementação específicos.
Compreender os benchmarks de desempenho do YOLO12#
O YOLO12 está disponível em várias variantes, cada uma otimizada para necessidades diferentes. As versões mais pequenas (nano e small) dão prioridade à velocidade e à eficiência, sendo ideais para dispositivos móveis e computação de periferia. As versões medium e large equilibram velocidade e precisão, enquanto o YOLO12x (extra large) foi concebido para aplicações de alta precisão, como automação industrial, imagiologia médica e sistemas avançados de vigilância.
Com estas variações, o YOLO12 oferece diferentes níveis de desempenho consoante o tamanho do modelo. Os testes de benchmark mostram que determinadas variantes do YOLO12 superam o YOLOv10 e o Ultralytics YOLO11 em precisão, alcançando uma precisão média média (mAP) superior.
No entanto, alguns modelos, como o YOLO12m, o YOLO12l e o YOLO12x, processam imagens mais lentamente do que o YOLO11, evidenciando um compromisso entre a precisão da deteção e a velocidade. Apesar disso, o YOLO12 continua eficiente, exigindo menos parâmetros do que muitos outros modelos, embora ainda utilize mais do que o YOLO11. Isto torna-o uma excelente escolha para aplicações em que a precisão é mais importante do que a velocidade bruta.

Fig. 3. Comparação entre o Ultralytics YOLO11 e o YOLO12.
Utilizar o YOLO12 através do pacote Python da Ultralytics#
O YOLO12 é compatível com o pacote Python da Ultralytics e é fácil de utilizar, sendo acessível tanto para iniciantes como para profissionais. Com apenas algumas linhas de código, os utilizadores podem carregar modelos pré-treinados, executar várias tarefas de visão computacional em imagens e vídeos e também treinar o YOLO12 em conjuntos de dados personalizados. O pacote Python da Ultralytics simplifica o processo, eliminando a necessidade de etapas de configuração complexas.
Por exemplo, eis as etapas que seguirias para utilizar o YOLO12 na deteção de objetos:
- Instalar o pacote Ultralytics: Primeiro, instala o pacote Python da Ultralytics, que fornece as ferramentas necessárias para executar o YOLO12 de forma eficiente. Isto garante que todas as dependências são configuradas corretamente.
- Carregar um modelo YOLO12 pré-treinado: Escolhe a variante YOLO12 adequada (nano, small, medium, large ou extra large) com base no nível de precisão e velocidade exigido pela tua tarefa.
- Fornecer uma imagem ou vídeo: Introduz um ficheiro de imagem ou vídeo que pretendas analisar. O YOLO12 também pode processar transmissões de vídeo em direto para deteção em tempo real.
- Executar o processo de deteção: O modelo analisa os dados visuais, identifica objetos e coloca caixas delimitadoras à sua volta. Atribui a cada objeto detetado a classe prevista e a respetiva pontuação de confiança.
- Ajustar as definições de deteção: Também podes modificar parâmetros como os limiares de confiança para ajustar a precisão e o desempenho da deteção.
- Guardar ou utilizar o resultado: A imagem ou o vídeo processado, agora com os objetos detetados, pode ser guardado ou integrado numa aplicação para análise, automatização ou tomada de decisões adicionais.
Estas etapas tornam o YOLO12 fácil de utilizar numa variedade de aplicações, desde a vigilância e o rastreamento no retalho até à imagiologia médica e aos veículos autónomos.
Aplicações práticas do YOLO12#
O YOLO12 pode ser utilizado numa variedade de aplicações do mundo real graças ao seu suporte para deteção de objetos, segmentação de instâncias, classificação de imagens, estimativa de pose e deteção de objetos orientados (OBB).

Fig. 4. O YOLO12 suporta tarefas como deteção de objetos e segmentação de instâncias.
No entanto, como discutimos anteriormente, os modelos YOLO12 dão prioridade à precisão em detrimento da velocidade, o que significa que demoram um pouco mais a processar imagens do que as versões anteriores. Este compromisso torna o YOLO12 ideal para aplicações em que a precisão é mais importante do que a velocidade em tempo real, como:
- Imagiologia médica: O YOLO12 pode ser treinado de forma personalizada para detetar tumores ou anomalias em radiografias e ressonâncias magnéticas com elevada precisão, tornando-o uma ferramenta útil para médicos e radiologistas que necessitam de uma análise precisa das imagens para o diagnóstico.
- Controlo de qualidade na indústria: Pode ajudar a identificar defeitos nos produtos durante o processo de produção, garantindo que apenas artigos de alta qualidade chegam ao mercado, ao mesmo tempo que reduz o desperdício e melhora a eficiência.
- Análise forense: As autoridades policiais podem ajustar o YOLO12 para analisar imagens de vigilância e recolher provas. Em investigações criminais, a precisão é fundamental para identificar detalhes importantes.
- Agricultura de precisão: Os agricultores podem utilizar o YOLO12 para analisar a saúde das culturas, detetar doenças ou infestações de pragas e monitorizar as condições do solo. Avaliações precisas ajudam a otimizar as estratégias agrícolas, conduzindo a melhores rendimentos e a uma gestão mais eficiente dos recursos.
Começar a utilizar o YOLO12#
Antes de executar o YOLO12, é importante garantir que o teu sistema cumpre os requisitos necessários.
Tecnicamente, o YOLO12 pode ser executado em qualquer GPU (unidade de processamento gráfico) dedicada. Por predefinição, não requer o FlashAttention, pelo que pode funcionar na maioria dos sistemas GPU sem esta funcionalidade. No entanto, ativar o FlashAttention pode ser especialmente útil ao trabalhar com grandes conjuntos de dados ou imagens de alta resolução, pois ajuda a evitar lentidão, reduzir a utilização de memória e melhorar a eficiência do processamento.
Para utilizar o FlashAttention, precisarás de uma GPU NVIDIA de uma destas séries: Turing (T4, Quadro RTX), Ampere (série RTX 30, A30, A40, A100), Ada Lovelace (série RTX 40) ou Hopper (H100, H200).
Tendo em conta a facilidade de utilização e a acessibilidade, o pacote Python da Ultralytics ainda não suporta a inferência com FlashAttention, pois a sua instalação pode ser tecnicamente bastante complexa. Para saberes mais sobre como começar a utilizar o YOLO12 e otimizar o seu desempenho, consulta a documentação oficial da Ultralytics.
Principais conclusões#
À medida que a visão computacional avança, os modelos tornam-se mais precisos e eficientes. O YOLO12 melhora tarefas de visão computacional, como deteção de objetos, segmentação de instâncias e classificação de imagens, através do processamento centrado na atenção e do FlashAttention, aumentando a precisão e otimizando a utilização da memória.
Ao mesmo tempo, a visão computacional está mais acessível do que nunca. O YOLO12 é fácil de utilizar através do pacote Python da Ultralytics e, com o seu foco na precisão em detrimento da velocidade, é adequado para imagiologia médica, inspeções industriais e robótica — aplicações em que a precisão é fundamental.
Tens curiosidade sobre AI? Visita o nosso repositório no GitHub e participa na nossa comunidade. Explora inovações em setores como AI em carros autónomos e visão computacional na agricultura nas nossas páginas de soluções. Consulta as nossas opções de licenciamento e dá vida aos teus projetos de AI para visão computacional. 🚀









