Model Serving
Descubre cómo el servicio de modelos conecta los modelos entrenados con producción. Explora estrategias de despliegue para Ultralytics YOLO26 en Ultralytics Platform.
El servicio de modelos es el proceso de alojar un modelo de aprendizaje automático entrenado y poner sus funciones a disposición de las aplicaciones de software mediante una interfaz de red. Actúa como puente entre un archivo estático del modelo guardado en disco y un sistema activo que procesa datos del mundo real. Una vez que un modelo ha completado la fase de entrenamiento de aprendizaje automático (ML), debe integrarse en un entorno de producción donde pueda recibir entradas —como imágenes, texto o datos tabulares— y devolver predicciones. Esto suele lograrse envolviendo el modelo en una interfaz de programación de aplicaciones (API), lo que le permite comunicarse con servidores web, aplicaciones móviles o dispositivos IoT.
El papel del servicio de modelos en la IA#
El objetivo principal del servicio de modelos es poner en funcionamiento de forma eficaz las capacidades del modelado predictivo. Mientras que el entrenamiento se centra en la precisión y la minimización de la pérdida, el servicio se centra en métricas de rendimiento como la latencia (la rapidez con la que se devuelve una predicción) y el rendimiento (cuántas solicitudes se pueden gestionar por segundo). Una infraestructura de servicio sólida garantiza que los sistemas de visión por ordenador (CV) sigan siendo fiables con cargas elevadas. A menudo implica tecnologías como la contenerización mediante herramientas como Docker, que empaqueta el modelo con sus dependencias para garantizar un comportamiento coherente en distintos entornos informáticos.
Aplicaciones en el mundo real#
El servicio de modelos impulsa funciones de IA omnipresentes en diversos sectores al permitir tomar decisiones inmediatas basadas en datos.
- Fabricación inteligente: En entornos industriales, los sistemas de IA en la fabricación utilizan modelos servidos para inspeccionar las líneas de montaje. Se envían imágenes de alta resolución de los componentes a un servidor local, donde un modelo YOLO26 detecta defectos como arañazos o desalineaciones y activa alertas inmediatas para retirar los artículos defectuosos.
- Automatización del comercio minorista: Los comercios utilizan la IA en el comercio minorista para mejorar la experiencia de los clientes. Las cámaras procesadas por modelos de detección de objetos identifican los productos en la zona de pago y calculan automáticamente el coste total sin necesidad de escanear códigos de barras manualmente.
Implementación práctica#
Para servir un modelo de forma eficaz, suele ser beneficioso exportar modelos a un formato estandarizado como ONNX, que fomenta la interoperabilidad entre distintos frameworks de entrenamiento y motores de servicio. El siguiente ejemplo muestra cómo cargar un modelo y ejecutar una inferencia, simulando la lógica que existiría dentro de un endpoint de servicio mediante Python.
from ultralytics import YOLO
# Load the YOLO26 model (this typically happens once when the server starts)
model = YOLO("yolo26n.pt")
# Simulate an incoming API request with an image source URL
image_source = "https://ultralytics.com/images/bus.jpg"
# Run inference to generate predictions for the user
results = model.predict(source=image_source)
# Process results (e.g., simulating a JSON response to a client)
print(f"Detected {len(results[0].boxes)} objects in the image.")Cómo elegir la estrategia adecuada#
La elección de la estrategia de servicio depende en gran medida del caso de uso específico. El servicio en línea proporciona respuestas inmediatas mediante protocolos como REST o gRPC, lo que resulta esencial para las aplicaciones web orientadas al usuario. En cambio, el servicio por lotes procesa grandes volúmenes de datos sin conexión, por lo que es adecuado para tareas como la generación nocturna de informes. En las aplicaciones que requieren privacidad o baja latencia sin depender de Internet, la IA en el edge traslada el proceso de servicio directamente al dispositivo y utiliza formatos optimizados como TensorRT para maximizar el rendimiento en hardware con recursos limitados. Muchas organizaciones aprovechan la Plataforma Ultralytics para simplificar el despliegue de estos modelos en diversos endpoints, incluidas las API en la nube y los dispositivos edge.
Diferencias con términos relacionados#
Aunque están estrechamente relacionados, el «servicio de modelos» se distingue del despliegue de modelos y la inferencia.
- Despliegue de modelos: Se refiere a la etapa más amplia del ciclo de vida en la que se libera un modelo en un entorno de producción. El servicio es el mecanismo específico o el software (como NVIDIA Triton Inference Server o TorchServe) que se utiliza para ejecutar el modelo desplegado.
- Inferencia: Es el acto matemático de calcular una predicción a partir de una entrada. El servicio de modelos proporciona la infraestructura (redes, escalabilidad y seguridad) que permite que la inferencia se realice de forma fiable para los usuarios finales.
- Microservicios: El servicio suele estructurarse como un conjunto de microservicios, donde el modelo se ejecuta como un servicio independiente que otras partes de una aplicación pueden consultar, intercambiando a menudo datos en formatos ligeros como JSON.









