Model Deployment
Aprende a desplegar modelos de aprendizaje automático en entornos cloud o edge. Descubre cómo Ultralytics Platform agiliza la exportación y la puesta en producción de YOLO26.
La implementación de modelos es la fase crítica en la que un modelo de machine learning entrenado se integra en un entorno de producción para tomar decisiones prácticas o realizar predicciones basadas en datos nuevos. Representa la transición desde un entorno de investigación o experimental —a menudo llevado a cabo en notebooks aislados— hasta una aplicación activa en la que el modelo interactúa con usuarios y sistemas del mundo real. Este proceso transforma un archivo estático de pesos y arquitectura en un agente de IA activo capaz de generar valor, como identificar objetos en una transmisión de vídeo o recomendar productos en un sitio web.
Una implementación eficaz requiere abordar desafíos distintos de los del entrenamiento de modelos, como la latencia, la escalabilidad y la compatibilidad con el hardware. Las organizaciones suelen utilizar la Ultralytics Platform para simplificar este ciclo de vida y garantizar que los modelos entrenados en la nube puedan distribuirse sin problemas a diversos entornos, desde servidores potentes hasta dispositivos edge con recursos limitados.
El panorama de la implementación#
Las estrategias de implementación suelen dividirse en dos categorías: implementación en la nube e implementación edge. La elección depende en gran medida de los requisitos específicos de velocidad, privacidad y conectividad.
- Implementación en la nube: El modelo reside en servidores centralizados, a menudo gestionados por servicios como AWS SageMaker o Google Vertex AI. Las aplicaciones envían datos por Internet al modelo mediante una REST API, que procesa la solicitud y devuelve el resultado. Este método ofrece una capacidad de cálculo prácticamente ilimitada, por lo que es ideal para modelos grandes y complejos, pero depende de una conexión a Internet estable.
- Implementación edge: El modelo se ejecuta localmente en el dispositivo donde se generan los datos, como un smartphone, un dron o una cámara de fábrica. Este enfoque, conocido como computación edge, minimiza la latencia y mejora la privacidad de los datos, ya que la información no sale del dispositivo. Herramientas como TensorRT se utilizan con frecuencia para optimizar modelos para estos entornos.
Preparación de modelos para producción#
Antes de poder implementar un modelo, normalmente se somete a un proceso de optimización para garantizar que se ejecute de forma eficiente en el hardware de destino. Este proceso incluye la exportación de modelos, en la que el formato de entrenamiento, como PyTorch, se convierte a un formato adecuado para la implementación, como ONNX (Intercambio de redes neuronales abiertas) o OpenVINO.
Las técnicas de optimización, como la cuantización, reducen el tamaño y la huella de memoria del modelo sin sacrificar significativamente la precisión. Para garantizar la coherencia entre distintos entornos de computación, los desarrolladores suelen utilizar herramientas de containerización como Docker, que empaquetan el modelo junto con todas sus dependencias de software necesarias.
A continuación se muestra un ejemplo de cómo exportar un modelo YOLO26 al formato ONNX, un paso habitual en la preparación para la implementación:
from ultralytics import YOLO
# Load the YOLO26 nano model
model = YOLO("yolo26n.pt")
# Export the model to ONNX format for broad compatibility
# This creates a file suitable for various inference engines
path = model.export(format="onnx")
print(f"Model successfully exported to: {path}")Aplicaciones en el mundo real#
La implementación de modelos impulsa sistemas de visión por ordenador ampliamente utilizados en diversos sectores.
- Control de calidad en la fabricación: En la fabricación inteligente, los modelos implementados supervisan las cintas transportadoras en tiempo real. Un sistema de cámaras que ejecuta un modelo optimizado para dispositivos NVIDIA Jetson puede detectar al instante defectos en los productos y activar un brazo robótico para retirar los artículos defectuosos. Esto requiere una latencia ultrabaja que solo puede proporcionar la implementación de IA edge.
- Analítica minorista: Las tiendas utilizan modelos implementados para analizar el flujo de clientes y su comportamiento. Al integrar modelos de seguimiento de objetos en las transmisiones de las cámaras de seguridad, los minoristas pueden generar mapas de calor de los pasillos más frecuentados. Estos datos ayudan a optimizar la distribución de las tiendas y mejorar la gestión del inventario, a menudo mediante una implementación basada en la nube que permite agregar datos de múltiples ubicaciones.
Implementación frente a inferencia y entrenamiento#
Es importante distinguir la implementación de modelos de otros términos relacionados del ciclo de vida del machine learning:
- El entrenamiento de modelos es la fase educativa en la que el algoritmo aprende patrones a partir de un conjunto de datos.
- La implementación de modelos es la fase de integración en la que el modelo entrenado se instala en una infraestructura de producción, como servidores, aplicaciones o dispositivos.
- La inferencia es la fase operativa: el acto propiamente dicho de que el modelo implementado procese datos en directo para producir una predicción. Por ejemplo, el motor de inferencia ejecuta los cálculos definidos por el modelo implementado.
Supervisión y mantenimiento#
La implementación no es el final del proceso. Una vez activos, los modelos requieren una supervisión continua de modelos para detectar problemas como la deriva de datos, que se produce cuando los datos del mundo real empiezan a desviarse de los datos de entrenamiento. A menudo se integran herramientas como Prometheus o Grafana para realizar un seguimiento de las métricas de rendimiento y garantizar que el sistema siga siendo fiable con el tiempo. Cuando el rendimiento disminuye, puede ser necesario volver a entrenar e implementar el modelo, completando el ciclo de MLOps.









