Por que razão o Ultralytics YOLO26 remove o NMS e como isso altera a implementação
Descobre como o Ultralytics YOLO26 permite inferência verdadeiramente de ponta a ponta e sem NMS, e por que razão a remoção do pós-processamento simplifica a exportação e a implementação na periferia.

Em 14 de janeiro, lançámos o Ultralytics YOLO26, a geração mais recente dos nossos modelos de visão computacional. Com o YOLO26, o nosso objetivo não era apenas melhorar a precisão ou a velocidade, mas repensar a forma como os modelos de deteção de objetos são construídos e implementados em sistemas do mundo real.
À medida que a visão computacional passa da investigação para a produção, espera-se cada vez mais que os modelos funcionem em CPUs, dispositivos de edge, câmaras, robôs e hardware incorporado. Nestes ambientes, a fiabilidade, a baixa latência e a facilidade de implementação são tão importantes como o desempenho.
O Ultralytics YOLO26 foi concebido tendo esta realidade em mente, utilizando uma arquitetura simplificada de ponta a ponta que elimina a complexidade desnecessária do pipeline de inferência. Uma das inovações mais importantes introduzidas no YOLO26 é a remoção da Supressão não máxima, normalmente conhecida como NMS.
Durante anos, o NMS foi uma parte padrão dos sistemas de deteção de objetos, utilizado como etapa de pós-processamento para eliminar deteções duplicadas. Embora seja eficaz, também introduzia computação adicional e desafios de implementação, especialmente em hardware de edge.
Com o YOLO26, adotámos uma abordagem diferente. Ao repensar a forma como as previsões são geradas e treinadas, permitimos uma inferência verdadeiramente de ponta a ponta e sem NMS. O modelo produz diretamente as deteções finais, sem depender de etapas externas de limpeza ou de regras definidas manualmente. Isto torna o YOLO26 mais rápido, mais fácil de exportar e mais fiável de implementar numa vasta gama de plataformas de hardware.

Fig. 1. Deteção de objetos numa imagem utilizando o Ultralytics YOLO26.
Neste artigo, vamos analisar mais de perto por que razão a deteção de objetos tradicional dependia do NMS, como este se tornou um obstáculo à implementação e como o Ultralytics YOLO26 elimina a necessidade de soluções alternativas. Vamos começar!
A deteção de objetos tradicional produz deteções duplicadas#
Antes de analisarmos o que é o NMS e por que razão o removemos no Ultralytics YOLO26, vamos recuar um pouco e observar como os modelos tradicionais de deteção de objetos geram as suas previsões.
Os modelos tradicionais de deteção de objetos produzem frequentemente várias caixas delimitadoras sobrepostas para o mesmo objeto. Cada uma destas caixas tem a sua própria pontuação de confiança, embora todas se refiram ao mesmo objeto na imagem.
Isto acontece por alguns motivos. Primeiro, o modelo faz previsões em muitas localizações espaciais e em diferentes escalas ao mesmo tempo. Isto ajuda o modelo a detetar objetos de diferentes tamanhos, mas também significa que localizações próximas podem identificar independentemente o mesmo objeto.
Segundo, muitos sistemas de deteção de objetos utilizam abordagens baseadas em âncoras, que geram um grande número de caixas candidatas em torno de cada localização. Embora isto aumente a probabilidade de encontrar objetos com precisão, também aumenta o número de previsões sobrepostas.
Por fim, a própria deteção baseada em grelha conduz naturalmente à redundância. Quando um objeto está próximo do limite de várias células da grelha, várias células podem prever uma caixa para esse objeto, resultando em várias deteções sobrepostas.
Por causa disso, a saída bruta do modelo contém frequentemente várias caixas para um único objeto. Para tornar os resultados utilizáveis, estas previsões redundantes têm de ser filtradas para que reste apenas uma deteção final.
Compreender a Supressão não máxima#
Depois de um modelo de deteção de objetos produzir várias caixas delimitadoras sobrepostas para o mesmo objeto, é necessário limpar esses resultados antes de os utilizar. É aqui que se aplica a Supressão não máxima.
A Supressão não máxima é uma etapa de pós-processamento executada depois de o modelo terminar de fazer as suas previsões. O seu objetivo é reduzir as deteções duplicadas para que cada objeto seja representado por uma única caixa delimitadora final.

Fig. 2. Uma visão geral do NMS. Imagem do autor.
O processo funciona comparando caixas delimitadoras com base nas suas pontuações de confiança e no grau de sobreposição entre elas. As previsões com confiança muito baixa são removidas primeiro.
As caixas restantes são então ordenadas por confiança, e a caixa com a pontuação mais elevada é selecionada como a melhor deteção. Essa caixa selecionada é comparada com as restantes.
Se outra caixa se sobrepuser demasiado a ela, essa caixa é suprimida e removida. A sobreposição é normalmente medida utilizando a Interseção sobre União, uma métrica que calcula a proporção entre a área partilhada por duas caixas e a área total coberta por ambas. Este processo repete-se até restarem apenas as deteções mais confiantes e não sobrepostas.
Por que razão o NMS complica a implementação#
Embora a Supressão não máxima ajude a filtrar deteções duplicadas, também introduz desafios que se tornam mais visíveis quando os modelos passam da investigação para a implementação no mundo real.
Um dos maiores problemas é o desempenho. O NMS é executado depois da inferência e requer a comparação das caixas delimitadoras entre si para decidir quais manter.
Este processo é computacionalmente dispendioso e difícil de paralelizar de forma eficiente. Em dispositivos de edge e sistemas baseados em CPU, este trabalho adicional pode acrescentar uma latência percetível, dificultando o cumprimento dos requisitos de tempo real.
O NMS também aumenta a complexidade da implementação. Como não faz parte do próprio modelo, tem de ser implementado separadamente como código de pós-processamento.
Diferentes runtimes e plataformas lidam com o NMS de formas diferentes, o que muitas vezes implica manter implementações personalizadas para cada ambiente de destino. O que funciona numa configuração pode comportar-se de forma ligeiramente diferente noutra, tornando a implementação mais frágil e difícil de escalar.
A otimização de hardware é outro desafio. O NMS não se adapta facilmente a aceleradores de IA especializados, concebidos para executar operações de redes neuronais de forma eficiente. Como resultado, mesmo quando o modelo funciona rapidamente em hardware otimizado, o NMS pode tornar-se um gargalo que limita o desempenho geral.
Além destes fatores, o NMS depende de parâmetros escolhidos manualmente, como limiares de confiança e de sobreposição. Estas definições podem afetar significativamente os resultados e muitas vezes precisam de ser ajustadas para diferentes conjuntos de dados, aplicações ou hardware. Isto torna o comportamento menos previsível nos sistemas de produção e acrescenta sobrecarga de configuração.
Explicação da inferência de deteção de objetos de ponta a ponta#
As limitações da Supressão não máxima levaram-nos a repensar a forma como os modelos de deteção de objetos deveriam comportar-se durante a inferência. Em vez de gerar muitas previsões sobrepostas e limpá-las posteriormente, colocámos uma questão mais fundamental.
E se o modelo pudesse produzir diretamente as deteções finais? Esta questão está no centro da inferência de deteção de objetos de ponta a ponta. Num sistema de ponta a ponta, o modelo é treinado para lidar com todo o processo de deteção, do início ao fim, sem depender de etapas externas de limpeza.
Em vez de produzir muitas caixas candidatas e filtrá-las depois da inferência, o modelo aprende a gerar autonomamente um pequeno conjunto de previsões confiantes e não sobrepostas. As deteções duplicadas são resolvidas dentro da rede, em vez de serem removidas pelo pós-processamento.
Arquiteturas de modelos mais recentes demonstraram que esta abordagem era possível e prática. Com a estratégia de treino adequada, os modelos podiam aprender a associar cada objeto a uma única previsão, em vez de a várias previsões concorrentes, reduzindo a redundância na sua origem.

Fig. 3. Um exemplo de deteção de objetos utilizando o Ultralytics YOLO26.
Para que isto funcione, o treino também tem de mudar. Em vez de permitir que muitas previsões concorram pelo mesmo objeto, o modelo aprende a tomar uma decisão clara, produzindo menos deteções e com maior confiança.
O resultado geral é um pipeline de inferência mais simples. Como as duplicações já são resolvidas internamente, não é necessária a Supressão não máxima durante a inferência. A saída do modelo já é o conjunto final de deteções.
Este design de ponta a ponta também facilita a implementação. Sem etapas de pós-processamento ou implementações de NMS específicas de cada plataforma, o modelo exportado é totalmente autónomo e comporta-se de forma consistente em diferentes frameworks de inferência e destinos de hardware.
Como explica o nosso Engenheiro Líder de Parcerias, Francesco Mattioli, “A aprendizagem verdadeiramente de ponta a ponta significa que o modelo deve lidar com tudo, desde os píxeis até às previsões, sem etapas de pós-processamento definidas manualmente que quebrem a diferenciabilidade e compliquem a implementação.”
Como o Ultralytics YOLO26 remove o NMS#
O Ultralytics YOLO26 remove a Supressão não máxima alterando a forma como as deteções são aprendidas e produzidas, em vez de depender do pós-processamento para as limpar. Em vez de permitir que muitas previsões concorram pelo mesmo objeto, o YOLO26 é treinado para aprender uma relação clara de correspondência um para um entre os objetos e as saídas.
Isto é possível em parte graças à deteção baseada em consultas aprendíveis, que ajuda o modelo a concentrar-se em produzir uma única previsão confiante para cada objeto, em vez de muitas candidatas sobrepostas. Cada objeto é associado a uma previsão, reduzindo naturalmente as deteções duplicadas.
Este comportamento é reforçado através de estratégias de correspondência consistentes durante o treino, incentivando o modelo a tomar uma decisão confiante por objeto, em vez de gerar previsões sobrepostas. Em última análise, o modelo produz menos previsões, mas cada uma representa uma deteção final.
Por que razão a remoção do DFL tornou possível a deteção sem NMS#
Outra inovação importante que permite a inferência sem NMS no Ultralytics YOLO26 é a remoção da Perda Focal de Distribuição, ou DFL. Nos modelos YOLO anteriores, o DFL era utilizado para melhorar a regressão das caixas delimitadoras, prevendo uma distribuição de possíveis localizações da caixa em vez de um único valor.
Embora esta abordagem tenha melhorado a precisão da localização, também acrescentou complexidade ao pipeline de deteção. Essa complexidade tornou-se uma limitação ao avançar para uma inferência verdadeiramente de ponta a ponta.
O DFL introduzia computação adicional e intervalos de regressão fixos, o que dificultava a aprendizagem, por parte do modelo, de atribuições de objetos simples e um para um, além de aumentar a dependência de etapas de pós-processamento como a Supressão não máxima. Com o Ultralytics YOLO26, removemos o DFL e reformulámos a regressão das caixas delimitadoras para a tornar mais simples e direta.
Em vez de depender de saídas baseadas em distribuições, o modelo aprende a prever coordenadas precisas das caixas de uma forma que permite obter menos deteções e com maior confiança. Esta alteração ajuda a reduzir as previsões sobrepostas na sua origem e alinha a regressão das caixas delimitadoras com o design de ponta a ponta e sem NMS do Ultralytics YOLO26.
O Ultralytics YOLO26 não utiliza NMS e é fácil de implementar#
Um design sem NMS torna o Ultralytics YOLO26 num modelo verdadeiramente de ponta a ponta. Isto tem um impacto importante na exportação de modelos.
Exportar significa converter um modelo treinado num formato que possa ser executado fora do ambiente de treino, como ONNX, TensorRT, CoreML ou OpenVINO. Nos pipelines tradicionais, este processo falha frequentemente porque a Supressão não máxima não faz parte do próprio modelo.
Ao remover o NMS, o Ultralytics YOLO26 evita completamente este problema. O modelo exportado já inclui tudo o que é necessário para produzir as deteções finais.
Isto torna o modelo exportado totalmente autónomo e mais portátil entre frameworks de inferência e destinos de hardware. O mesmo modelo comporta-se de forma consistente, quer seja implementado em servidores, sistemas apenas com CPU, dispositivos incorporados ou aceleradores de edge. A implementação torna-se mais simples porque aquilo que exportas é exatamente o que executas.
Esta simplicidade é especialmente importante para aplicações de edge. Por exemplo, o YOLO26 pode ser facilmente implementado em dispositivos como drones para casos de utilização como monitorização de culturas, inspeção de campos e análise da saúde das plantas, nos quais os orçamentos limitados de computação e energia tornam impraticáveis pipelines complexos de pós-processamento. Como o modelo produz diretamente as deteções finais, funciona de forma fiável em hardware leve, sem etapas adicionais de processamento.

Fig. 4. O Ultralytics YOLO26 é fácil de implementar em dispositivos de edge, como drones.
Em resumo, a inferência sem NMS elimina obstáculos à exportação e à implementação e permite criar sistemas de visão mais limpos e fiáveis. O NMS era uma solução alternativa. O Ultralytics YOLO26 já não precisa de soluções alternativas.
Principais conclusões#
O Ultralytics YOLO26 remove a Supressão não máxima ao resolver o problema subjacente das deteções duplicadas, em vez de as limpar posteriormente. O seu design de ponta a ponta permite que o modelo produza diretamente as deteções finais, tornando a exportação e a implementação mais simples e consistentes em diferentes hardwares. O NMS era uma solução alternativa útil para sistemas anteriores, mas o YOLO26 já não precisa dele.
Junta-te à nossa comunidade e consulta o nosso repositório no GitHub para saberes mais sobre IA. Explora as nossas páginas de soluções sobre IA na agricultura e visão computacional no retalho. Descobre as nossas opções de licenciamento e começa hoje a utilizar IA para visão!









