El impacto del diseño más rápido y centrado en el Edge de Ultralytics YOLO26
Descubre cómo Ultralytics YOLO26 es más rápido en el Edge y por qué eso es importante para las aplicaciones de visión artificial de próxima generación que exigen baja latencia y eficiencia.

A principios de esta semana, Ultralytics lanzó oficialmente Ultralytics YOLO26, un modelo YOLO más rápido, ligero y pequeño que busca redefinir cómo funcionan los sistemas de visión artificial en el edge. YOLO26 es compatible con las mismas tareas principales de visión que los modelos YOLO anteriores, incluyendo la detección de objetos y la segmentación de instancias.

Fig 1. Un ejemplo de uso de Ultralytics YOLO26 para segmentar un objeto.
La diferencia fundamental entre Ultralytics YOLO26 y los modelos anteriores es el entorno en el que se diseñó para funcionar. En lugar de optimizar principalmente para unidades de procesamiento gráfico (GPUs) en la nube o para un rendimiento basado en pruebas de rendimiento, YOLO26 se diseñó desde cero para su implementación en el mundo real en dispositivos de borde y hardware integrado.
A medida que la computer vision pasa de la investigación a la producción, la realidad de las restricciones de rendimiento se vuelve más evidente. Los entornos edge están definidos por presupuestos de latencia estrictos, memoria limitada, restricciones térmicas y de energía, y la necesidad de un comportamiento predecible en diversas plataformas.
En estos entornos, el rendimiento general del sistema no depende solo de la velocidad de inferencia bruta, sino también de la eficiencia con la que opera todo el pipeline. La sobrecarga del post-procesamiento, la presión sobre la memoria y las rutas de ejecución específicas de la plataforma suelen ser cuellos de botella.
Ultralytics YOLO26 aborda estos desafíos adoptando un enfoque más rápido y centrado en el borde que analiza todo el proceso de inferencia en lugar de las métricas de modelos individuales. Al centrarse en la optimización del borde, simplificar el proceso de inferencia y eliminar pasos de posprocesamiento innecesarios, YOLO26 ofrece mejoras de velocidad que se traducen en una menor latencia y un comportamiento más fiable en producción.
En este artículo, exploraremos cómo las decisiones arquitectónicas de Ultralytics YOLO26 se traducen en mejoras de rendimiento en el mundo real, y por qué ser más rápido en el edge cambia fundamentalmente lo que es posible para las aplicaciones de visión artificial de próxima generación.
La realidad de la implementación en el Edge#
Ejecutar computer vision models en el edge es muy diferente a ejecutarlos en la nube. En los entornos de nube, los sistemas suelen tener acceso a potentes GPUs, grandes cantidades de memoria y hardware estable. En el edge, esas mismas suposiciones no se aplican.
La mayoría de las implementaciones en el Edge se ejecutan en arquitecturas de hardware diversas, no en GPUs. Los dispositivos suelen utilizar múltiples procesadores especializados para diferentes tareas, que están optimizados para la eficiencia y el bajo consumo de energía, en lugar de para la capacidad de cálculo bruto de las GPUs en la nube.
La latencia es otra limitación importante. Los sistemas Edge a menudo operan bajo límites estrictos en tiempo real, donde incluso pequeños retrasos pueden afectar la capacidad de respuesta o la seguridad. En estos casos, la latencia de extremo a extremo importa más que la velocidad de inferencia bruta. Un modelo puede ser rápido sobre el papel, pero quedarse corto una vez que se añaden el post-procesamiento y el movimiento de datos.
La memoria también desempeña un papel importante. Muchos dispositivos Edge tienen memoria limitada y cachés compartidas. Los tensores intermedios grandes y el uso ineficiente de la memoria pueden ralentizar los sistemas, incluso cuando el modelo en sí es eficiente.
Los límites de potencia y térmicos añaden más restricciones. Los dispositivos Edge a menudo funcionan sin refrigeración activa y dentro de presupuestos de energía fijos. El rendimiento debe ser eficiente y sostenible, no solo rápido en ráfagas cortas.
Además de todo esto, las implementaciones en el Edge requieren coherencia. Los modelos deben comportarse de la misma manera en todos los dispositivos y entornos de ejecución. El código específico de la plataforma o los pasos complejos de post-procesamiento pueden introducir diferencias sutiles que dificultan la implementación y el mantenimiento de los sistemas.

Fig 2. Un vistazo a las limitaciones de la implementación en el Edge. Imagen del autor.
Estas limitaciones definen lo que realmente significa el rendimiento en el Edge. En otras palabras, el rendimiento está definido por todo el pipeline, no por una única métrica.
Por qué la visión en el Edge exige un modelo de rendimiento diferente#
Entonces, ¿cómo se relacionan las limitaciones de la implementación en el Edge con los requisitos de un modelo de visión artificial creado para el Edge? La conexión queda clara una vez que los modelos pasan de entornos de investigación a sistemas del mundo real.
En entornos de nube, el rendimiento a menudo se mide mediante benchmarks como la velocidad de inferencia y la precisión. En el Edge, esas métricas solo cuentan una parte de la historia. Los sistemas de visión suelen ejecutarse en hardware heterogéneo, donde la inferencia de la red neuronal se descarga en aceleradores especializados mientras que otras partes del pipeline se ejecutan en procesadores de propósito general.
En este contexto, la velocidad del modelo no es suficiente. Es clave cómo funciona todo el sistema una vez que el modelo está implementado. Un modelo puede parecer rápido por sí solo, pero quedarse corto si el post-procesamiento, el movimiento de datos o los pasos específicos de la plataforma añaden sobrecarga.
Por eso la visión en el edge requiere un modelo de rendimiento que se centre en la eficiencia a nivel de sistema en lugar de en pruebas de rendimiento aisladas. Ultralytics YOLO26 refleja este cambio al centrarse en la optimización orientada al edge, la inferencia optimizada y la ejecución de extremo a extremo creada para el despliegue en el mundo real.
La base para la velocidad: un diseño centrado en el Edge#
En el Edge, el rendimiento se define por lo bien que un modelo se adapta a la arquitectura de hardware real del dispositivo. Diseñar primero para el Edge garantiza que los sistemas de visión funcionen de manera fiable en todas las plataformas del mundo real, independientemente de la combinación específica de unidades de procesamiento disponibles.
Un enfoque centrado en el Edge prioriza una ejecución predecible y eficiente en hardware heterogéneo, en lugar de adaptar modelos que fueron optimizados para GPUs de nube después del hecho. En pocas palabras, esto significa favorecer operaciones que se traduzcan bien a los aceleradores de redes neuronales, minimizar el trabajo no neuronal fuera del modelo y reducir la complejidad innecesaria que puede ralentizar la ejecución de extremo a extremo.
Ultralytics YOLO26 se diseñó teniendo en cuenta estas limitaciones. Su arquitectura se centra en un rendimiento constante en lugar de en el rendimiento máximo en condiciones ideales. Al simplificar las rutas de ejecución y eliminar los cálculos innecesarios, YOLO26 reduce la sobrecarga en todo el proceso de inferencia y aprovecha mejor la aceleración y la jerarquía de memoria disponibles en el dispositivo.
Este enfoque también mejora la fiabilidad. La optimización orientada al edge conduce a tiempos más predecibles y a menos picos de rendimiento, lo cual es fundamental para los sistemas en tiempo real. En lugar de depender de hardware especializado o de un procesamiento posterior pesado para lograr velocidad, Ultralytics YOLO26 enfatiza la eficiencia en toda la tubería de inferencia.
Inferencia de extremo a extremo y el coste del post-procesamiento#
Quizás te preguntes qué significa eliminar pasos innecesarios de post-procesamiento. Para entenderlo, demos un paso atrás y veamos cómo funcionan los sistemas de detección de objetos tradicionales.
En muchos pipelines de detección de objetos, la inferencia no termina cuando el modelo produce sus predicciones. En su lugar, el modelo genera un gran número de cuadros delimitadores superpuestos, que luego deben ser filtrados y refinados antes de poder ser utilizados. Esta limpieza se realiza mediante pasos de post-procesamiento que se ejecutan fuera del propio modelo.
Uno de los pasos de postprocesamiento más comunes es la Non-Maximum Suppression, o NMS. NMS compara cuadros delimitadores superpuestos y conserva únicamente las detecciones con mayor confianza, eliminando los duplicados que hacen referencia al mismo objeto. Aunque este enfoque es eficaz, introduce un cálculo adicional una vez finalizada la inferencia.

Fig 3. Entendiendo NMS. Imagen del autor.
En el Edge, este trabajo extra tiene un coste. Los pasos de post-procesamiento como NMS no se adaptan bien a los aceleradores especializados utilizados para la inferencia de redes neuronales, que están optimizados para el cálculo neuronal denso en lugar de para operaciones intensivas en control o memoria.
Como resultado, NMS introduce latencia y sobrecarga de memoria adicionales, y su coste aumenta a medida que aumenta el número de detecciones. Incluso cuando el modelo en sí es rápido, NMS puede consumir una parte significativa del tiempo total de ejecución.
El post-procesamiento también aumenta la complejidad del sistema. Debido a que reside fuera del modelo, debe implementarse por separado para diferentes entornos de ejecución y objetivos de hardware. Esto a menudo conduce a rutas de código específicas de la plataforma, un comportamiento inconsistente en los dispositivos y pipelines de implementación más frágiles.
Lo más importante es que el post-procesamiento rompe la idea de un rendimiento real de extremo a extremo. Medir la velocidad de inferencia del modelo no refleja cómo se comporta el sistema en producción. Lo que importa al final es el tiempo total desde la entrada hasta la salida final, incluyendo cada paso en el pipeline.
En estas situaciones, el post-procesamiento se convierte en un cuello de botella oculto en el Edge. Añade latencia, consume recursos de CPU y complica la implementación, todo mientras se mantiene fuera del modelo en sí.
Cómo Ultralytics YOLO26 elimina NMS y por qué eso lo hace más rápido#
YOLO26 removes NMS abordando la causa raíz de las detecciones duplicadas en lugar de depurarlas después de la inferencia. En lugar de producir muchas predicciones superpuestas que deban filtrarse, el modelo se entrena para generar directamente un conjunto más reducido de detecciones finales y con mayor confianza.
Esto es posible gracias a un cambio en la forma en que se aprenden las detecciones durante el entrenamiento. Ultralytics YOLO26 fomenta una relación uno a uno más clara entre objetos y predicciones, reduciendo la redundancia desde su origen. Como resultado, las detecciones duplicadas se resuelven dentro de la propia red en lugar de mediante un procesamiento posterior externo.
Eliminar NMS tiene un impacto inmediato en el rendimiento en el Edge. Dado que NMS no se adapta bien a los aceleradores de redes neuronales, eliminarlo reduce el movimiento de memoria y evita costosos pasos de procesamiento no neuronal. Esto reduce la latencia de extremo a extremo y hace que el rendimiento sea más predecible, especialmente en dispositivos Edge donde el post-procesamiento podría consumir una parte considerable del tiempo total de ejecución.
También simplifica el pipeline de inferencia. Con menos pasos fuera del modelo, hay menos movimiento de datos y menos traspasos entre componentes. La salida del modelo es ya el resultado final, lo que hace que la ejecución sea más predecible.
Eliminar DFL para permitir un rendimiento real de extremo a extremo#
Otra innovación en Ultralytics YOLO26 es la eliminación de Distribution Focal Loss, o DFL, que se utilizaba en modelos YOLO anteriores para la regresión de bboxes. En lugar de predecir una única coordenada directamente, los modelos que utilizaban DFL aprendían una distribución de valores posibles y luego derivaban un bbox final de esa distribución. Este enfoque ayudó a mejorar la precisión de la localización y fue un paso adelante importante en generaciones anteriores.
Sin embargo, con el tiempo, DFL también introdujo compromisos. Predecir distribuciones incrementa el cálculo y añade complejidad a la arquitectura del modelo, lo que puede ralentizar la inferencia en CPUs y dificultar la exportación de los modelos a través de deployment formats. Asimismo, DFL imponía rangos de regresión fijos, lo que podía limitar la flexibilidad al detectar objetos muy grandes.
Ultralytics YOLO26 elimina DFL como parte de su transición hacia un diseño más simple y de extremo a extremo. La regresión BBox se ha rediseñado para que sea más directa, lo que reduce los cálculos innecesarios sin perder precisión. Este cambio se alinea con el enfoque sin NMS de YOLO26.
De dónde proviene la inferencia en CPU un 43% más rápida#
En las pruebas de rendimiento basadas en CPU, YOLO26 muestra una clara mejora en comparación con los modelos YOLO anteriores. En comparación con Ultralytics YOLO11, el modelo nano de YOLO26 ofrece una inferencia en CPU hasta un 43% más rápida, una diferencia que tiene un impacto significativo en los despliegues edge del mundo real.

Fig 4. Evaluación comparativa de la velocidad de CPU de Ultralytics YOLO26.
Esta ganancia proviene de simplificar todo el pipeline de inferencia en lugar de optimizar un solo componente. La ejecución de extremo a extremo elimina la sobrecarga del post-procesamiento, un método de regresión de cuadros delimitadores más directo reduce los cálculos y las decisiones de diseño centradas en la CPU mejoran la eficiencia de ejecución en procesadores de propósito general.
Juntos, estos cambios reducen la latencia, disminuyen la carga de trabajo de la CPU y conducen a un rendimiento más rápido y coherente en hardware Edge del mundo real.
El impacto de Ultralytics YOLO26 en el despliegue en el borde y las exportaciones#
Las mejoras de rendimiento de Ultralytics YOLO26 van más allá de una inferencia más rápida. Al simplificar el modelo y reducir la sobrecarga de memoria, su despliegue resulta más sencillo y su ejecución en entornos edge es más fiable.
El diseño de extremo a extremo de Ultralytics YOLO26 también simplifica el export. Con menos componentes auxiliares y sin pasos de procesamiento posterior externos, los modelos exportados son completamente autónomos. Esto reduce las dependencias específicas de la plataforma y ayuda a garantizar un comportamiento coherente en diferentes entornos de ejecución y objetivos de hardware.
En la práctica, esto significa que Ultralytics YOLO26 se puede desplegar más fácilmente en dispositivos edge como cámaras, robots y sistemas embebidos, utilizando varios formatos de exportación. Lo que exportas es lo que ejecutas, con menos pasos de integración y menor riesgo de desviación en el despliegue.
La inferencia más rápida en el Edge permite la robótica y la visión artificial industrial#
Hasta ahora, hemos analizado cómo el diseño orientado al edge de Ultralytics YOLO26 mejora el rendimiento a nivel de sistema. El impacto real, sin embargo, radica en cómo facilita la integración de la IA de visión en aplicaciones del mundo real.
Por ejemplo, en robotics y entornos industriales, los sistemas de visión operan a menudo bajo estrictas restricciones de tiempo real. Las decisiones deben tomarse de forma rápida y coherente, utilizando recursos de cómputo limitados y sin depender de la conectividad con la nube. Con Ultralytics YOLO26, cumplir con estos requisitos se vuelve práctico.
Aplicaciones como la navegación de robots y la manipulación de objetos se benefician de una menor latencia y una inferencia más predecible, lo que permite a los robots responder con fluidez a los cambios en su entorno. Del mismo modo, en entornos industriales, los modelos de visión pueden ejecutarse directamente en las líneas de producción para detectar defectos, rastrear componentes y supervisar procesos sin introducir retrasos ni complejidad adicional.
Al permitir una inferencia rápida y fiable en hardware edge, Ultralytics YOLO26 ayuda a que la IA de visión sea una parte natural de la robótica y los sistemas industriales, en lugar de un reto a la hora de desplegar y mantener.
Conclusiones clave#
Ultralytics YOLO26 se creó para el borde, donde las limitaciones del mundo real como la latencia, la memoria y la fiabilidad definen lo que es posible. Al diseñar el modelo en torno a la ejecución centrada en CPU, la inferencia de extremo a extremo y una implementación más sencilla, YOLO26 hace que la IA de visión sea práctica de integrar en sistemas reales. Este enfoque centrado en el borde permite una amplia gama de aplicaciones, desde la robótica y la visión industrial hasta la IA integrada y en el dispositivo, donde el rendimiento y la previsibilidad son lo más importante.
Únete a nuestra creciente community y explora nuestro GitHub repository para acceder a recursos prácticos de IA. Para construir con IA visual hoy mismo, explora nuestras licensing options. Descubre cómo AI in agriculture está transformando la agricultura y cómo vision AI in healthcare está dando forma al futuro visitando nuestras páginas de soluciones.






