Ultralytics YOLO27:
Ultralytics YOLO

Como o Ultralytics YOLO26 treina de forma mais inteligente com ProgLoss, STAL e MuSGD

Saiba como o Ultralytics YOLO26 treina de forma mais fiável utilizando Progressive Loss Balancing, Small-Target-Aware Label Assignment e o otimizador MuSGD.

ABAbirami Vina11 min read
Inovações no treino do Ultralytics YOLO26: ProgLoss, STAL e MuSGD

Na semana passada, lançámos o Ultralytics YOLO26, estabelecendo um novo padrão para modelos de visão computacional em tempo real e orientados para a periferia. Tal como os anteriores modelos Ultralytics YOLO, como o Ultralytics YOLO11, o YOLO26 suporta as principais tarefas de visão computacional com que os utilizadores estão familiarizados, incluindo deteção de objetos, segmentação de instâncias e estimativa de pose.

Um exemplo do Ultralytics YOLO26 a segmentar objetos numa imagem

Fig. 1. Um exemplo da utilização do Ultralytics YOLO26 para segmentar objetos numa imagem.

No entanto, o Ultralytics YOLO26 não é apenas uma atualização incremental. Embora as tarefas suportadas possam parecer familiares, este novo modelo representa um passo inovador na forma como os modelos de visão computacional são treinados. Com o YOLO26, o foco vai além da eficiência da inferência e estende-se a tornar o treino mais estável.

O Ultralytics YOLO26 foi concebido tendo em conta todo o ciclo de vida do treino. Isto significa uma convergência mais rápida, execuções de treino mais fiáveis e um comportamento consistente do modelo. Estas melhorias são especialmente importantes em fluxos de trabalho do mundo real, onde a fiabilidade do treino afeta diretamente a rapidez com que os modelos podem ser iterados e implementados.

Para permitir isto, o Ultralytics YOLO26 introduz várias inovações direcionadas no treino, como o Balanceamento Progressivo da Perda (ProgLoss), a Atribuição de Rótulos Consciente de Alvos Pequenos (STAL) e o otimizador MuSGD. Em conjunto, estas alterações melhoram a forma como a perda de aprendizagem é equilibrada, como os rótulos são atribuídos e como a otimização evolui ao longo do tempo.

Neste artigo, vamos explorar como funciona cada um destes mecanismos e por que motivo tornam o Ultralytics YOLO26 mais fácil de treinar e mais fiável em escala. Vamos começar!

Ultralytics YOLO26: criado para treinar de forma mais inteligente, não apenas para ser mais rápido#

O Ultralytics YOLO26 simplifica nativamente todo o pipeline de inferência ao eliminar a dependência de etapas de pós-processamento, como a Supressão não máxima. Em vez de gerar muitas previsões sobrepostas e filtrá-las posteriormente, o YOLO26 produz as deteções finais diretamente a partir da rede.

Isto torna o YOLO26 um modelo de ponta a ponta, no qual a previsão, a resolução de duplicados e as saídas finais são todas aprendidas na própria rede. Isto simplifica a implementação e melhora a eficiência da inferência, ao mesmo tempo que influencia a forma como o modelo aprende durante o treino.

Inferência de ponta a ponta, sem NMS e de última geração do Ultralytics YOLO26

Fig. 2. O YOLO26 oferece inferência de ponta a ponta, sem NMS e de última geração (Fonte)

Num sistema de ponta a ponta como este, o treino e a inferência estão estreitamente ligados. Como não existe uma etapa externa de pós-processamento para corrigir as previsões posteriormente, o modelo tem de aprender a tomar decisões claras e confiantes durante o próprio treino.

Isto torna especialmente importante o alinhamento entre os objetivos de treino e o comportamento na inferência. Qualquer divergência entre a forma como o modelo é treinado e como é utilizado no momento da inferência pode levar a uma aprendizagem instável ou a uma convergência mais lenta.

O Ultralytics YOLO26 resolve esta questão concebendo o seu processo de treino em torno da utilização no mundo real desde o início. Em vez de se concentrar apenas na velocidade da inferência, o sistema de treino é desenvolvido para suportar uma aprendizagem estável durante execuções longas, uma convergência consistente entre tamanhos de modelo, do Nano ao Extra Large, e um desempenho robusto em conjuntos de dados diversificados.

Como duas cabeças de treino melhoram a aprendizagem no Ultralytics YOLO26#

Uma das principais inovações de treino do Ultralytics YOLO26 baseia-se numa abordagem de treino com duas cabeças, utilizada em modelos YOLO anteriores. Nos modelos de deteção de objetos, uma cabeça refere-se à parte da rede responsável por fazer previsões.

Por outras palavras, as cabeças de deteção aprendem a prever onde os objetos estão localizados numa imagem e o que são esses objetos. Fazem-no através da regressão das coordenadas das caixas delimitadoras, ou seja, aprendem a estimar a posição e o tamanho de cada objeto na imagem de entrada.

Durante o treino, o modelo aprende minimizando uma perda, que é uma medida numérica da distância entre as suas previsões e as respostas corretas, ou verdade fundamental. Uma perda menor significa que as previsões do modelo estão mais próximas da verdade fundamental, enquanto uma perda maior indica erros maiores. O cálculo da perda orienta a forma como o modelo atualiza os seus parâmetros durante o treino.

O Ultralytics YOLO26 utiliza duas cabeças de deteção durante o treino, que partilham o mesmo modelo subjacente, mas têm finalidades diferentes. A cabeça um-para-um é a cabeça utilizada no momento da inferência. Aprende a associar cada objeto a uma única previsão confiante, o que é essencial para o design de ponta a ponta e sem NMS do YOLO26.

Entretanto, a cabeça um-para-muitos é utilizada apenas durante o treino. Permite associar várias previsões ao mesmo objeto, proporcionando uma supervisão mais densa. Este sinal de aprendizagem mais rico ajuda a estabilizar o treino e a melhorar a precisão, especialmente nas fases iniciais.

No Ultralytics YOLO26, ambas as cabeças utilizam o mesmo cálculo de perda para a regressão das caixas e a classificação. As implementações anteriores aplicavam um equilíbrio fixo entre estes dois sinais de perda durante todo o treino.

Na prática, porém, a importância de cada cabeça muda ao longo do tempo. A supervisão densa é mais útil no início, enquanto o alinhamento com o comportamento na inferência se torna mais importante posteriormente no treino. O Ultralytics YOLO26 foi concebido com base nesta ideia, que conduz diretamente à forma como reequilibra os sinais de aprendizagem à medida que o treino avança.

O Ultralytics YOLO26 utiliza o Balanceamento Progressivo da Perda#

Então, como é que o Ultralytics YOLO26 lida com estas necessidades de aprendizagem variáveis durante o treino? Utiliza o Balanceamento Progressivo da Perda para ajustar a ponderação dos sinais de aprendizagem ao longo do tempo.

O ProgLoss funciona alterando dinamicamente a contribuição de cada cabeça para a perda total à medida que o treino avança. No início, é atribuído mais peso à cabeça um-para-muitos para estabilizar a aprendizagem e melhorar a revocação. À medida que o treino prossegue, o equilíbrio desloca-se gradualmente para a cabeça um-para-um, alinhando o treino mais estreitamente com o comportamento na inferência.

Esta transição gradual permite que o Ultralytics YOLO26 aprenda pela ordem correta. Em vez de obrigar o modelo a otimizar objetivos concorrentes todos ao mesmo tempo, o Balanceamento Progressivo da Perda dá prioridade ao sinal de aprendizagem mais útil em cada fase do treino. O resultado é uma convergência mais suave, menos execuções de treino instáveis e um desempenho final mais consistente.

Como o STAL ajuda o Ultralytics YOLO26 a aprender com objetos minúsculos#

Outra melhoria interessante no treino do Ultralytics YOLO26 resulta da forma como o modelo atribui alvos de treino às previsões, um processo conhecido como atribuição de rótulos. Este processo é responsável por associar objetos da verdade fundamental a previsões candidatas, frequentemente designadas por âncoras.

Estas correspondências determinam quais as previsões que recebem supervisão e contribuem para a perda. O Ultralytics YOLO26 baseia-se num método de atribuição de rótulos existente chamado Aprendizagem de Alinhamento de Tarefas (TAL), concebido para alinhar melhor a classificação e a localização durante o treino.

Embora o TAL funcione bem para a maioria dos objetos, o treino revelou uma limitação importante. Durante o processo de correspondência, os objetos muito pequenos podiam ser totalmente descartados. Na prática, os objetos com menos de cerca de 8 píxeis numa imagem de entrada de 640 píxeis frequentemente não recebiam qualquer atribuição de âncora. Quando isto acontece, o modelo recebe pouca ou nenhuma supervisão para esses objetos, o que dificulta a aprendizagem da sua deteção fiável.

Para resolver este problema, o Ultralytics YOLO26 introduz a Atribuição de Rótulos Consciente de Alvos Pequenos (STAL). O STAL modifica o processo de atribuição para garantir que os objetos pequenos não sejam ignorados durante o treino. Especificamente, impõe um mínimo de quatro atribuições de âncora para objetos com menos de 8 píxeis. Isto garante que até os objetos minúsculos contribuem consistentemente para a perda de treino.

Ao reforçar a supervisão de alvos pequenos, o STAL melhora a estabilidade da aprendizagem e o desempenho da deteção em cenários onde são comuns objetos pequenos ou distantes. Esta melhoria é especialmente importante para aplicações YOLO26 orientadas para a periferia, como imagens aéreas, robótica e sistemas da Internet das Coisas (IoT), onde os objetos são frequentemente pequenos, distantes ou parcialmente visíveis e uma deteção fiável é crítica.

O Ultralytics YOLO26 introduz o otimizador MuSGD#

Para suportar um treino mais estável e previsível, o Ultralytics YOLO26 também introduz um novo otimizador chamado MuSGD. Este otimizador foi concebido para melhorar a convergência e a fiabilidade do treino em modelos de deteção de ponta a ponta, especialmente à medida que aumentam o tamanho do modelo e a complexidade do treino.

Para que uma rede neural aprenda e, consequentemente, altere os pesos de forma adequada durante o treino, calculamos um erro, também chamado de "perda". Assim, o modelo mede o grau de incorreção das suas previsões através de um valor de perda, calcula gradientes que indicam como os seus parâmetros devem mudar e, em seguida, atualiza esses parâmetros para reduzir o erro. A Descida do Gradiente Estocástica (SGD) é um otimizador amplamente utilizado que executa estas atualizações, tornando o treino eficiente e escalável.

Descida do gradiente estocástica versus descida do gradiente

Fig. 3. Descida do gradiente estocástica vs. descida do gradiente (Fonte)

O MuSGD baseia-se nesta fundação conhecida ao incorporar ideias de otimização inspiradas no Muon, um método utilizado no treino de modelos de linguagem de grande dimensão. Estas ideias foram influenciadas por avanços recentes, como o Kimi K2 da Moonshot AI, que demonstrou um comportamento de treino melhorado através de atualizações de parâmetros mais estruturadas.

O Ultralytics YOLO26 utiliza uma estratégia de atualização híbrida. Alguns parâmetros são atualizados através de uma combinação de atualizações inspiradas no Muon e SGD, enquanto outros utilizam apenas SGD. Isto permite ao YOLO26 introduzir estrutura adicional no processo de otimização, mantendo simultaneamente a robustez e as propriedades de generalização que tornaram o SGD eficaz.

O resultado é uma otimização mais suave, uma convergência mais rápida e um comportamento de treino mais previsível entre tamanhos de modelo, tornando o MuSGD uma parte essencial da razão pela qual o Ultralytics YOLO26 é mais fácil de treinar e mais fiável em escala.

A importância das inovações de treino do Ultralytics YOLO26#

As inovações de treino do Ultralytics YOLO26, combinadas com funcionalidades essenciais como o seu design de ponta a ponta, sem NMS e orientado para a periferia, tornam o modelo mais fácil de treinar e mais fiável em escala. Talvez te perguntes o que isto significa realmente para as aplicações de visão computacional.

Uma análise das principais funcionalidades do Ultralytics YOLO26

Fig. 4. Uma análise das principais funcionalidades do YOLO26 (Fonte)

Na prática, isto torna muito mais fácil levar a visão computacional para o local onde é efetivamente executada. Os modelos treinam de forma mais previsível, escalam de maneira mais consistente entre tamanhos e são mais simples de adaptar a novos conjuntos de dados. Isto reduz o atrito entre a experimentação e a implementação, especialmente em ambientes onde a fiabilidade e a eficiência são tão importantes como o desempenho bruto.

Por exemplo, em aplicações de robótica e visão industrial, os modelos precisam frequentemente de ser retreinados à medida que os ambientes, sensores ou tarefas mudam. Com o Ultralytics YOLO26, as equipas podem iterar mais rapidamente sem se preocuparem com execuções de treino instáveis ou comportamentos inconsistentes entre tamanhos de modelo.

Principais conclusões#

Os sistemas fiáveis de visão computacional dependem tanto da forma como os modelos são treinados como do seu desempenho no momento da inferência. Ao melhorar a forma como os sinais de aprendizagem são equilibrados, como os objetos pequenos são tratados e como a otimização avança, o Ultralytics YOLO26 torna o treino mais estável e mais fácil de escalar. Este foco num treino fiável ajuda as equipas a passar mais facilmente da experimentação para a implementação no mundo real, especialmente em aplicações orientadas para a periferia.

Queres aprender sobre IA? Visita o nosso repositório no GitHub para saberes mais. Junta-te à nossa comunidade ativa e descobre inovações em setores como a IA na logística e a IA de visão no setor automóvel. Para começares hoje com visão computacional, consulta as nossas opções de licenciamento.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática