Optimización de modelos Ultralytics YOLO con la integración de TensorRT
Descubre cómo exportar modelos Ultralytics YOLO mediante la integración de TensorRT para lograr un rendimiento de IA más rápido y eficiente en GPU NVIDIA para aplicaciones en tiempo real.

Imagina un coche autónomo circulando por una calle concurrida con solo unos milisegundos para detectar a un peatón que baja de la acera. Al mismo tiempo, puede que tenga que reconocer una señal de stop parcialmente oculta por un árbol o reaccionar rápidamente ante un vehículo cercano que se desvía hacia su carril. En estas situaciones, la velocidad y las respuestas en tiempo real son fundamentales.
Aquí es donde la inteligencia artificial (AI), concretamente la visión artificial, una rama de la AI que ayuda a las máquinas a interpretar datos visuales, desempeña un papel clave. Para que las soluciones de visión artificial funcionen de forma fiable en entornos reales, a menudo necesitan procesar la información rápidamente, gestionar varias tareas a la vez y utilizar la memoria de forma eficiente.
Una forma de conseguirlo es mediante la aceleración por hardware, utilizando dispositivos especializados como las unidades de procesamiento gráfico (GPUs) para ejecutar los modelos más rápidamente. Las GPUs de NVIDIA son especialmente conocidas para estas tareas, gracias a su capacidad para ofrecer una latencia baja y un alto rendimiento.
Sin embargo, ejecutar un modelo en una GPU tal cual no siempre garantiza un rendimiento óptimo. Normalmente, los modelos de AI para visión necesitan optimizarse para aprovechar al máximo las capacidades de los dispositivos de hardware. Para obtener el máximo rendimiento con un hardware específico, tenemos que compilar el modelo para que utilice el conjunto concreto de instrucciones de ese hardware.
Por ejemplo, TensorRT es un formato de exportación y una biblioteca de optimización desarrollados por NVIDIA para mejorar el rendimiento en máquinas de alta gama. Utiliza técnicas avanzadas para reducir considerablemente el tiempo de inferencia sin perder precisión.

Fig 1. NVIDIA TensorRT permite que los modelos se ejecuten de forma óptima en varios dispositivos NVIDIA.
En este artículo, exploraremos la integración de TensorRT compatible con Ultralytics y veremos paso a paso cómo puedes exportar tu modelo YOLO11 para lograr una implementación más rápida y eficiente en hardware NVIDIA. ¡Empecemos!
Descripción general de TensorRT#
TensorRT es un conjunto de herramientas desarrollado por NVIDIA para ayudar a que los modelos de AI se ejecuten de forma más rápida y eficiente en las GPUs de NVIDIA. Está diseñado para aplicaciones del mundo real en las que la velocidad y el rendimiento son realmente importantes, como los coches autónomos y el control de calidad en la fabricación y la industria farmacéutica.
TensorRT incluye herramientas como compiladores y optimizadores de modelos que trabajan en segundo plano para garantizar que tus modelos se ejecuten con una latencia baja y puedan gestionar un mayor rendimiento.
La integración de TensorRT compatible con Ultralytics funciona optimizando tu modelo YOLO para que se ejecute de forma más eficiente en las GPUs mediante métodos como la reducción de la precisión. Esto consiste en utilizar formatos con menos bits, como el de coma flotante de 16 bits (FP16) o el entero de 8 bits (INT8), para representar los datos del modelo, lo que reduce el uso de memoria y acelera el cálculo con un impacto mínimo en la precisión.
Además, las capas de redes neuronales compatibles se fusionan en los modelos TensorRT optimizados para reducir el uso de memoria, lo que da lugar a una inferencia más rápida y eficiente.

Fig 2. Un vistazo a la técnica de fusión de capas de TensorRT.
Características principales del formato de exportación de TensorRT#
Antes de explicar cómo puedes exportar Ultralytics YOLO11 mediante la integración de TensorRT, veamos algunas características principales del formato de modelo TensorRT:
-
Fácil integración con frameworks: TensorRT admite la integración directa con frameworks de AI populares como PyTorch, Hugging Face y ONNX, y ofrece un rendimiento hasta 6 veces más rápido. También es compatible con MATLAB, lo que permite desarrollar motores de AI de alta velocidad en plataformas como Jetson, NVIDIA DRIVE y centros de datos.
-
Implementación escalable con Triton: Los modelos optimizados en formato TensorRT pueden implementarse a escala mediante NVIDIA Triton Inference Server, que mejora la eficiencia con funciones como el procesamiento por lotes de entradas, la ejecución simultánea de modelos, la compatibilidad con conjuntos de modelos y la transmisión de audio/vídeo en tiempo real.
-
Flexibilidad entre dispositivos: Desde pequeños dispositivos periféricos hasta servidores potentes, TensorRT funciona en todo el ecosistema de NVIDIA y es compatible con herramientas como DeepStream para vídeo, Riva para AI de voz y otras destinadas a la ciberseguridad, las recomendaciones y mucho más.
¿Cómo funciona la integración de TensorRT?#
Exportar modelos Ultralytics YOLO, como Ultralytics YOLO11, al formato de modelo TensorRT es fácil. Veamos paso a paso cómo hacerlo.
Para empezar, puedes instalar el paquete de Python de Ultralytics utilizando un gestor de paquetes como «pip». Para ello, ejecuta el comando “pip install ultralytics” en el símbolo del sistema o el terminal.
Después de instalar correctamente el paquete de Python de Ultralytics, puedes entrenar, probar, ajustar, exportar e implementar modelos para varias tareas de visión artificial, como la detección de objetos, la clasificación y la segmentación de instancias. Si encuentras alguna dificultad durante la instalación del paquete, consulta la guía de problemas comunes para encontrar soluciones y consejos.
Para el siguiente paso, necesitarás un dispositivo NVIDIA. Utiliza el fragmento de código siguiente para cargar y exportar YOLO11 al formato de modelo TensorRT. Carga una variante nano preentrenada del modelo YOLO11 (yolo11n.pt) y la exporta como un archivo de motor TensorRT (yolo11n.engine), preparado para implementarse en dispositivos NVIDIA.
from ultralytics import YOLO
model = YOLO("yolo11n.pt")
model.export(format="engine")Después de convertir tu modelo al formato TensorRT, puedes implementarlo para diversas aplicaciones.
El ejemplo siguiente muestra cómo cargar el modelo YOLO11 exportado (yolo11n.engine) y ejecutar una inferencia con él. La inferencia consiste en utilizar el modelo entrenado para realizar predicciones sobre datos nuevos. En este caso, utilizaremos una imagen de entrada de un perro para probar el modelo.
tensorrt_model = YOLO("yolo11n.engine")
results = tensorrt_model("https://images.pexels.com/photos/1254140/pexels-photo-1254140.jpeg?auto=compress&cs=tinysrgb&w=1260&h=750&dpr=2.jpg", save=True)Cuando ejecutes este código, la imagen de salida siguiente se guardará en la carpeta runs/detect/predict.

Fig 3. Resultado de ejecutar una inferencia con el modelo Ultralytics YOLO11 exportado en formato TensorRT.
Cuándo aprovechar la integración de TensorRT#
El paquete de Python de Ultralytics admite varias integraciones que permiten exportar modelos YOLO a distintos formatos, como TorchScript, CoreML, ONNX y TensorRT. Entonces, ¿cuándo deberías elegir la integración de TensorRT?
Estos son algunos factores que distinguen el formato de modelo TensorRT de otras opciones de integración de exportación:
-
Menor tamaño del modelo: Exportar un modelo YOLO al formato TensorRT con precisión INT8 puede reducir considerablemente el tamaño del modelo. La cuantización de FP32 a INT8 puede reducir el tamaño del modelo 4 veces, lo que permite descargas más rápidas, menores necesidades de almacenamiento y una huella de memoria reducida durante la implementación.
-
Menor consumo energético: La cuantización INT8 no solo reduce el tamaño del modelo, sino también el consumo de energía. Las operaciones de precisión reducida de los modelos YOLO exportados a INT8 pueden consumir menos energía que los modelos FP32, lo que resulta especialmente beneficioso para dispositivos alimentados por batería, como drones, smartphones o dispositivos periféricos.
-
Mayor velocidad: Combinar la arquitectura eficiente de YOLO con la optimización INT8 de TensorRT puede mejorar la velocidad de inferencia.
Aplicaciones de Ultralytics YOLO11 y el formato de modelo TensorRT#
Los modelos Ultralytics YOLO exportados al formato TensorRT pueden implementarse en una amplia variedad de escenarios reales. Estos modelos optimizados son especialmente útiles cuando el rendimiento rápido y eficiente de la AI es fundamental. Exploremos algunos ejemplos interesantes de cómo pueden utilizarse.
Cajas de autopago inteligentes en tiendas minoristas#
Muchas tareas en las tiendas minoristas, como escanear códigos de barras, pesar productos o empaquetar artículos, todavía las realiza manualmente el personal. Sin embargo, depender únicamente de los empleados puede ralentizar las operaciones y frustrar a los clientes, especialmente en las cajas. Las colas largas resultan incómodas tanto para los compradores como para los propietarios de las tiendas. Las cajas de autopago inteligentes son una excelente solución a este problema.
Estas cajas utilizan visión artificial y GPUs para acelerar el proceso y ayudar a reducir los tiempos de espera. La visión artificial permite que estos sistemas vean y comprendan su entorno mediante tareas como la detección de objetos. Los modelos avanzados como Ultralytics YOLO11, cuando se optimizan con herramientas como TensorRT, pueden ejecutarse mucho más rápido en dispositivos con GPU.
Estos modelos exportados son adecuados para configuraciones minoristas inteligentes que utilizan dispositivos de hardware compactos pero potentes, como el NVIDIA Jetson Nano, diseñado específicamente para aplicaciones de AI periférica.

Fig 4. Ejemplo de una caja de autopago inteligente.
Detección automatizada de defectos en la fabricación#
Un modelo de visión artificial como Ultralytics YOLO11 puede entrenarse de forma personalizada para detectar productos defectuosos en la industria manufacturera. Una vez entrenado, el modelo puede exportarse al formato TensorRT para implementarlo en instalaciones equipadas con sistemas de AI de alto rendimiento.
A medida que los productos avanzan por las cintas transportadoras, las cámaras capturan imágenes y el modelo Ultralytics YOLO11, ejecutándose en formato TensorRT, las analiza en tiempo real para detectar defectos. Esta configuración permite a las empresas identificar los problemas de forma rápida y precisa, reduciendo los errores y mejorando la eficiencia.
Del mismo modo, sectores como el farmacéutico utilizan este tipo de sistemas para identificar defectos en los envases médicos. De hecho, está previsto que el mercado mundial de sistemas inteligentes de detección de defectos alcance los 5.000 millones de dólares en 2026.

Fig 5. Uso de YOLO para detectar defectos en la industria farmacéutica.
Aspectos que debes tener en cuenta al utilizar TensorRT#
Aunque la integración de TensorRT ofrece muchas ventajas, como velocidades de inferencia más altas y una latencia reducida, estas son algunas limitaciones que debes tener en cuenta:
-
Ligera pérdida de precisión: Cuando exportas tu modelo en formato TensorRT, es posible que el modelo exportado no sea tan preciso como el original. Las métricas de rendimiento, como la precisión, la exhaustividad y la capacidad del modelo para detectar objetos (puntuaciones mAP), podrían disminuir ligeramente. Esto puede mitigarse utilizando un conjunto de datos representativo durante la cuantización.
-
Mayor complejidad de depuración: Las optimizaciones realizadas por TensorRT pueden dificultar el rastreo de errores o la comprensión de comportamientos inesperados, especialmente al comparar los resultados con los del modelo original.
-
Sensibilidad al tamaño del lote: Las mejoras de rendimiento de TensorRT son más pronunciadas con tamaños de lote grandes. En aplicaciones que procesan imágenes individuales o lotes pequeños, las mejoras de rendimiento podrían ser menos significativas.
Conclusiones clave#
Exportar modelos Ultralytics YOLO al formato TensorRT hace que se ejecuten de forma considerablemente más rápida y eficiente, lo que los convierte en una opción ideal para tareas en tiempo real, como detectar defectos en fábricas, impulsar sistemas de autopago inteligentes o supervisar zonas urbanas concurridas.
Esta optimización ayuda a que los modelos rindan mejor en las GPUs de NVIDIA al acelerar las predicciones y reducir el uso de memoria y energía. Aunque presenta algunas limitaciones, la mejora del rendimiento convierte la integración de TensorRT en una excelente opción para quienes desarrollan sistemas de visión artificial de alta velocidad en hardware NVIDIA.
¿Quieres obtener más información sobre AI? Explora nuestro repositorio de GitHub, conecta con nuestra comunidad y consulta nuestras opciones de licencia para poner en marcha tu proyecto de visión artificial. Descubre más sobre innovaciones como la AI en la fabricación y la visión artificial en el sector logístico en nuestras páginas de soluciones.









