Cómo Ultralytics YOLO26 entrena de forma más inteligente con ProgLoss, STAL y MuSGD
Descubre cómo Ultralytics YOLO26 entrena de forma más fiable mediante el equilibrio progresivo de pérdidas, la asignación de etiquetas consciente de objetivos pequeños y el optimizador MuSGD.

La semana pasada lanzamos Ultralytics YOLO26, estableciendo un nuevo estándar para modelos de visión por ordenador en tiempo real y diseñados primero para el edge. Al igual que los anteriores modelos YOLO de Ultralytics, como Ultralytics YOLO11, YOLO26 admite las principales tareas de visión por ordenador con las que los usuarios están familiarizados, como la detección de objetos, la segmentación de instancias y la estimación de la pose.

Fig. 1. Un ejemplo del uso de Ultralytics YOLO26 para segmentar objetos en una imagen.
Sin embargo, Ultralytics YOLO26 no es simplemente una actualización incremental. Aunque las tareas compatibles puedan resultar familiares, este nuevo modelo representa un paso innovador en la forma de entrenar los modelos de visión por ordenador. Con YOLO26, el enfoque va más allá de la eficiencia de la inferencia para conseguir que el entrenamiento sea más estable.
Ultralytics YOLO26 se ha diseñado teniendo en cuenta todo el ciclo de vida del entrenamiento. Esto se traduce en una convergencia más rápida, ejecuciones de entrenamiento más fiables y un comportamiento coherente del modelo. Estas mejoras son especialmente importantes en los flujos de trabajo del mundo real, donde la fiabilidad del entrenamiento afecta directamente a la rapidez con la que los modelos se pueden iterar y desplegar.
Para hacerlo posible, Ultralytics YOLO26 introduce varias innovaciones específicas de entrenamiento, como el equilibrado progresivo de la pérdida (ProgLoss), la asignación de etiquetas consciente de objetivos pequeños (STAL) y el optimizador MuSGD. En conjunto, estos cambios mejoran el equilibrio de la pérdida de aprendizaje, la asignación de etiquetas y el comportamiento de la optimización a lo largo del tiempo.
En este artículo, veremos cómo funciona cada uno de estos mecanismos y por qué hacen que Ultralytics YOLO26 sea más fácil de entrenar y más fiable a escala. ¡Empecemos!
Ultralytics YOLO26: diseñado para entrenar de forma más inteligente, no solo para ejecutarse más rápido#
Ultralytics YOLO26 optimiza de forma nativa todo el flujo de inferencia al eliminar la dependencia de pasos de posprocesamiento como la supresión no máxima. En lugar de generar muchas predicciones superpuestas y filtrarlas después, YOLO26 produce las detecciones finales directamente desde la red.
Esto convierte a YOLO26 en un modelo de extremo a extremo, en el que la predicción, la resolución de duplicados y las salidas finales se aprenden dentro de la propia red. Esto simplifica el despliegue y mejora la eficiencia de la inferencia, al tiempo que también influye en la forma en que el modelo aprende durante el entrenamiento.

Fig. 2. YOLO26 ofrece inferencia de última generación de extremo a extremo y sin NMS (Fuente)
En un sistema de extremo a extremo como este, el entrenamiento y la inferencia están estrechamente conectados. Como no existe una fase externa de posprocesamiento que corrija las predicciones posteriormente, el modelo tiene que aprender a tomar decisiones claras y seguras durante el propio entrenamiento.
Esto hace que la alineación entre los objetivos de entrenamiento y el comportamiento durante la inferencia sea especialmente importante. Cualquier desajuste entre la forma en que se entrena el modelo y cómo se utiliza en el momento de la inferencia puede provocar un aprendizaje inestable o una convergencia más lenta.
Ultralytics YOLO26 aborda esta cuestión diseñando su proceso de entrenamiento en torno al uso en el mundo real desde el principio. En lugar de centrarse únicamente en la velocidad de inferencia, el sistema de entrenamiento está diseñado para favorecer un aprendizaje estable durante ejecuciones prolongadas, una convergencia coherente entre tamaños de modelo, desde Nano hasta Extra Large, y un rendimiento sólido en conjuntos de datos diversos.
Cómo mejoran el aprendizaje dos cabezales de entrenamiento en Ultralytics YOLO26#
Una de las principales innovaciones de entrenamiento de Ultralytics YOLO26 se basa en un enfoque de entrenamiento con dos cabezales utilizado en modelos YOLO anteriores. En los modelos de detección de objetos, un cabezal es la parte de la red responsable de realizar las predicciones.
En otras palabras, los cabezales de detección aprenden a predecir dónde están ubicados los objetos en una imagen y qué son. Para ello, realizan la regresión de las coordenadas de las cajas delimitadoras; es decir, aprenden a estimar la posición y el tamaño de cada objeto en la imagen de entrada.
Durante el entrenamiento, el modelo aprende minimizando una pérdida, que es una medida numérica de la distancia entre sus predicciones y las respuestas correctas o la verdad fundamental. Una pérdida menor significa que las predicciones del modelo están más cerca de la verdad fundamental, mientras que una pérdida mayor indica errores más grandes. El cálculo de la pérdida guía la actualización de los parámetros del modelo durante el entrenamiento.
Ultralytics YOLO26 utiliza dos cabezales de detección durante el entrenamiento que comparten el mismo modelo subyacente, pero cumplen funciones diferentes. El cabezal uno a uno es el que se utiliza durante la inferencia. Aprende a asociar cada objeto con una única predicción segura, algo esencial para el diseño de extremo a extremo y sin NMS de YOLO26.
Por su parte, el cabezal uno a muchos solo se utiliza durante el entrenamiento. Permite asociar varias predicciones al mismo objeto, proporcionando una supervisión más densa. Esta señal de aprendizaje más rica ayuda a estabilizar el entrenamiento y a mejorar la precisión, especialmente en las primeras etapas.
En Ultralytics YOLO26, ambos cabezales utilizan el mismo cálculo de pérdida para la regresión de cajas y la clasificación. Las implementaciones anteriores aplicaban un equilibrio fijo entre estas dos señales de pérdida durante todo el entrenamiento.
Sin embargo, en la práctica, la importancia de cada cabezal cambia con el tiempo. La supervisión densa resulta más útil al principio, mientras que la alineación con el comportamiento durante la inferencia adquiere mayor importancia más adelante en el entrenamiento. Ultralytics YOLO26 se ha diseñado basándose en esta idea, que conduce directamente a la forma en que reajusta las señales de aprendizaje a medida que avanza el entrenamiento.
Ultralytics YOLO26 utiliza el equilibrado progresivo de la pérdida#
Entonces, ¿cómo gestiona Ultralytics YOLO26 estas necesidades de aprendizaje cambiantes durante el entrenamiento? Utiliza el equilibrado progresivo de la pérdida para ajustar el peso de las señales de aprendizaje a lo largo del tiempo.
ProgLoss funciona modificando dinámicamente cuánto contribuye cada cabezal a la pérdida total a medida que avanza el entrenamiento. Al principio, se da más peso al cabezal uno a muchos para estabilizar el aprendizaje y mejorar la exhaustividad. A medida que continúa el entrenamiento, el equilibrio se desplaza gradualmente hacia el cabezal uno a uno, alineando el entrenamiento más estrechamente con el comportamiento durante la inferencia.
Esta transición gradual permite que Ultralytics YOLO26 aprenda en el orden adecuado. En lugar de obligar al modelo a optimizar objetivos contrapuestos a la vez, el equilibrado progresivo de la pérdida prioriza la señal de aprendizaje más útil en cada etapa del entrenamiento. El resultado es una convergencia más fluida, menos ejecuciones de entrenamiento inestables y un rendimiento final más coherente.
Cómo STAL ayuda a Ultralytics YOLO26 a aprender de objetos diminutos#
Otra mejora interesante del entrenamiento de Ultralytics YOLO26 procede de la forma en que el modelo asigna los objetivos de entrenamiento a las predicciones, un proceso conocido como asignación de etiquetas. Este proceso se encarga de emparejar los objetos de la verdad fundamental con las predicciones candidatas, a menudo denominadas anclas.
Estas coincidencias determinan qué predicciones reciben supervisión y contribuyen a la pérdida. Ultralytics YOLO26 se basa en un método de asignación de etiquetas existente llamado aprendizaje de alineación de tareas (TAL), diseñado para alinear mejor la clasificación y la localización durante el entrenamiento.
Aunque TAL funciona bien con la mayoría de los objetos, el entrenamiento reveló una limitación importante. Durante el proceso de emparejamiento, los objetos muy pequeños podían descartarse por completo. En la práctica, los objetos de menos de unos 8 píxeles en una imagen de entrada de 640 píxeles a menudo no recibían ninguna asignación de ancla. Cuando esto ocurre, el modelo recibe poca o ninguna supervisión para esos objetos, lo que dificulta aprender a detectarlos de forma fiable.
Para solucionar este problema, Ultralytics YOLO26 introduce la asignación de etiquetas consciente de objetivos pequeños (STAL). STAL modifica el proceso de asignación para garantizar que los objetos pequeños no se ignoren durante el entrenamiento. En concreto, impone un mínimo de cuatro asignaciones de ancla para los objetos de menos de 8 píxeles. Esto garantiza que incluso los objetos diminutos contribuyan de forma constante a la pérdida de entrenamiento.
Al reforzar la supervisión de los objetivos pequeños, STAL mejora la estabilidad del aprendizaje y el rendimiento de detección en escenarios donde son habituales los objetos pequeños o lejanos. Esta mejora es especialmente importante para las aplicaciones de YOLO26 diseñadas primero para el edge, como la imagen aérea, la robótica y los sistemas del Internet de las cosas (IoT), donde los objetos suelen ser pequeños, estar lejos o ser parcialmente visibles, y la detección fiable es fundamental.
Ultralytics YOLO26 introduce el optimizador MuSGD#
Para favorecer un entrenamiento más estable y predecible, Ultralytics YOLO26 también introduce un nuevo optimizador llamado MuSGD. Este optimizador está diseñado para mejorar la convergencia y la fiabilidad del entrenamiento en modelos de detección de extremo a extremo, especialmente a medida que aumentan el tamaño del modelo y la complejidad del entrenamiento.
Para que una red neuronal aprenda y, en consecuencia, modifique los pesos adecuadamente durante el entrenamiento, calculamos un error, también llamado «pérdida». Por tanto, el modelo mide mediante un valor de pérdida el grado de error de sus predicciones, calcula gradientes que indican cómo deben cambiar sus parámetros y, a continuación, actualiza dichos parámetros para reducir el error. El descenso de gradiente estocástico (SGD) es un optimizador muy utilizado que realiza estas actualizaciones, haciendo que el entrenamiento sea eficiente y escalable.

Fig. 3. Descenso de gradiente estocástico frente a descenso de gradiente (Fuente)
MuSGD se basa en estos fundamentos conocidos al incorporar ideas de optimización inspiradas en Muon, un método utilizado en el entrenamiento de modelos de lenguaje de gran tamaño. Estas ideas recibieron la influencia de avances recientes como Kimi K2 de Moonshot AI, que demostró un comportamiento de entrenamiento mejorado mediante actualizaciones de parámetros más estructuradas.
Ultralytics YOLO26 utiliza una estrategia de actualización híbrida. Algunos parámetros se actualizan mediante una combinación de actualizaciones inspiradas en Muon y SGD, mientras que otros utilizan únicamente SGD. Esto permite que YOLO26 introduzca una estructura adicional en el proceso de optimización, manteniendo al mismo tiempo las propiedades de robustez y generalización que han hecho eficaz a SGD.
El resultado es una optimización más fluida, una convergencia más rápida y un comportamiento de entrenamiento más predecible en distintos tamaños de modelo, lo que convierte a MuSGD en una parte fundamental de la facilidad de entrenamiento y la fiabilidad a escala de Ultralytics YOLO26.
La importancia de las innovaciones de entrenamiento de Ultralytics YOLO26#
Las innovaciones de entrenamiento de Ultralytics YOLO26, combinadas con características clave como su diseño de extremo a extremo, sin NMS y diseñado primero para el edge, hacen que el modelo sea más fácil de entrenar y más fiable a escala. Quizá te preguntes qué significa esto realmente para las aplicaciones de visión por ordenador.

Fig. 4. Un vistazo a las características clave de YOLO26 (Fuente)
En la práctica, facilita mucho llevar la visión por ordenador al lugar donde realmente se ejecuta. Los modelos se entrenan de forma más predecible, escalan de manera más coherente entre tamaños y son más sencillos de adaptar a nuevos conjuntos de datos. Esto reduce la fricción entre la experimentación y el despliegue, especialmente en entornos donde la fiabilidad y la eficiencia importan tanto como el rendimiento bruto.
Por ejemplo, en aplicaciones de robótica y visión industrial, a menudo es necesario volver a entrenar los modelos cuando cambian los entornos, los sensores o las tareas. Con Ultralytics YOLO26, los equipos pueden iterar más rápido sin preocuparse por ejecuciones de entrenamiento inestables o un comportamiento incoherente entre tamaños de modelo.
Conclusiones clave#
Los sistemas fiables de visión por ordenador dependen tanto de cómo se entrenan los modelos como de su rendimiento durante la inferencia. Al mejorar el equilibrio de las señales de aprendizaje, la gestión de los objetos pequeños y la evolución de la optimización, Ultralytics YOLO26 hace que el entrenamiento sea más estable y fácil de escalar. Este enfoque centrado en la fiabilidad del entrenamiento ayuda a los equipos a pasar con mayor fluidez de la experimentación al despliegue en el mundo real, especialmente en aplicaciones diseñadas primero para el edge.
¿Quieres aprender sobre IA? Visita nuestro repositorio de GitHub para descubrir más. Únete a nuestra comunidad activa y descubre innovaciones en sectores como la IA en la logística y la IA de visión en la industria automovilística. Para empezar hoy mismo con la visión por ordenador, consulta nuestras opciones de licencia.









