YOLO Vision 2026:
Volver al glosario de Ultralytics

Inference Latency

Explora la importancia de la latencia de inferencia en la IA. Aprende a optimizar el rendimiento en tiempo real con Ultralytics YOLO26 para obtener aplicaciones más rápidas y con mayor capacidad de respuesta.

La latencia de inferencia representa el retraso temporal entre la recepción de una entrada por parte de un modelo de aprendizaje automático (ML), como una imagen o un texto de entrada, y la producción de una salida o predicción correspondiente. En el contexto de la inteligencia artificial (IA), esta métrica se mide normalmente en milisegundos (ms) y sirve como un indicador fundamental de la capacidad de respuesta del sistema. Para los desarrolladores que crean aplicaciones de visión por ordenador, comprender y minimizar la latencia es esencial para lograr experiencias de usuario fluidas e interactivas, especialmente al desplegar modelos en entornos con recursos limitados como teléfonos móviles o dispositivos integrados.

Por qué es importante la latencia de inferencia#

La importancia de la latencia de inferencia depende en gran medida del caso de uso específico. Aunque un retraso de unos pocos segundos pueda ser aceptable para una tarea de procesamiento por lotes como el análisis de un informe de servidor nocturno, a menudo resulta inaceptable para aplicaciones interactivas. Una baja latencia es el pilar de la inferencia en tiempo real, donde los sistemas deben procesar los datos y reaccionar de forma instantánea.

Reducir la latencia garantiza que los agentes de IA puedan interactuar de forma natural con los humanos y que los sistemas automatizados operen con seguridad. Una alta latencia puede provocar interfaces lentas, una mala retención de los usuarios o, en escenarios críticos para la seguridad, fallos operativos peligrosos. Los ingenieros a menudo deben equilibrar el compromiso entre la complejidad del modelo —que puede mejorar la precisión— y la velocidad de ejecución.

Factores que influyen en la latencia#

Varios componentes técnicos contribuyen al tiempo total necesario para una única pasada de inferencia:

  • Arquitectura del modelo: El diseño de la red neuronal (NN) es un factor principal. Los modelos profundos con muchas capas suelen requerir más capacidad de cálculo que los más superficiales. Las arquitecturas modernas como YOLO26 están optimizadas específicamente para ofrecer una gran precisión con un coste computacional mínimo.
  • Capacidades de hardware: La elección de la unidad de procesamiento afecta profundamente a la velocidad. Aunque una CPU es versátil, el hardware especializado como una GPU (Unidad de Procesamiento Gráfico) o una TPU (Unidad de Procesamiento Tensorial) está diseñado para paralelizar las operaciones matriciales centrales del aprendizaje profundo, reduciendo significativamente la latencia.
  • Tamaño de la entrada: Procesar fotogramas de vídeo 4K de alta resolución lleva más tiempo que procesar imágenes estándar de 640p. Los desarrolladores a menudo redimensionan las entradas durante el preprocesamiento de datos para encontrar el equilibrio ideal entre la velocidad y la capacidad de detectar pequeños detalles.
  • Técnicas de optimización: Métodos como la cuantización de modelos (convertir los pesos a menor precisión) y la poda de modelos (eliminar conexiones innecesarias) son formas eficaces de acelerar la ejecución. Herramientas como NVIDIA TensorRT pueden optimizar aún más los modelos para un hardware específico.

Aplicaciones en el mundo real#

El impacto de la latencia de inferencia se ilustra mejor mediante ejemplos prácticos en los que la velocidad no es negociable.

  1. Conducción autónoma: En el campo de la IA en automoción, un coche autónomo debe escanear continuamente su entorno en busca de peatones, otros vehículos y señales de tráfico. Si el sistema de detección de objetos presenta una alta latencia, es posible que el coche no frene a tiempo cuando aparezca un obstáculo. Un retraso de tan solo 100 milisegundos a velocidad de autopista puede traducirse en varios metros de distancia recorrida, lo que convierte la baja latencia en un requisito de seguridad crítico.

  2. Trading de alta frecuencia: Las instituciones financieras utilizan el modelado predictivo para analizar las tendencias del mercado y ejecutar operaciones. Estos algoritmos deben procesar grandes volúmenes de datos y tomar decisiones en microsegundos. En este ámbito, una menor latencia se traduce directamente en una ventaja competitiva, permitiendo a las empresas capitalizar oportunidades fugaces del mercado antes de que los competidores puedan reaccionar.

Medición de la latencia con Python#

Puedes medir fácilmente la velocidad de inferencia de los modelos Ultralytics utilizando el modo benchmark. Esto ayuda a seleccionar el tamaño de modelo adecuado para tus limitaciones de hardware específicas.

from ultralytics import YOLO

# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")

# Benchmark the model on CPU to measure latency
# This provides a breakdown of preprocess, inference, and postprocess time
model.benchmark(data="coco8.yaml", imgsz=640, device="cpu")

Latencia de inferencia frente a rendimiento (throughput)#

Es importante distinguir la latencia del rendimiento, ya que son conceptos relacionados pero distintos en el despliegue de modelos.

  • La latencia de inferencia mide el tiempo de una única predicción (p. ej., "Tardó 20ms en procesar esta imagen"). Esta es la métrica clave para aplicaciones de usuario único en tiempo real.
  • El rendimiento mide el volumen de predicciones a lo largo del tiempo (por ejemplo, "El sistema procesó 500 imágenes por segundo"). A menudo se logra un alto rendimiento aumentando el tamaño del lote, lo que procesa muchas entradas simultáneamente. Sin embargo, el procesamiento por lotes puede en realidad aumentar la latencia de los elementos individuales que esperan en la cola.

Optimizar uno suele hacerse a costa del otro. Por ejemplo, las aplicaciones de Edge AI suelen priorizar la latencia para garantizar una respuesta inmediata, mientras que las tareas de minería de datos basadas en la nube pueden priorizar el rendimiento para gestionar conjuntos de datos masivos de manera eficiente.

Estrategias de optimización#

Los desarrolladores emplean diversas estrategias para minimizar la latencia. Exportar modelos a formatos optimizados como ONNX o OpenVINO puede proporcionar mejoras significativas de velocidad en CPU estándar. Para despliegues móviles, convertir los modelos a TFLite o CoreML garantiza que se ejecuten eficientemente en dispositivos iOS y Android. Además, el uso de arquitecturas ligeras como MobileNet o el último Ultralytics YOLO26 garantiza que el modelo base sea eficiente por diseño. Los usuarios también pueden aprovechar la Ultralytics Platform para desplegar modelos sin problemas en estos formatos optimizados sin una configuración manual compleja.

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático