YOLO Vision 2026:
Plataforma Ultralytics

Puntos finales de inferencia dedicados vs inferencia compartida para despliegue

Explora cuándo elegir puntos finales de inferencia dedicados en la Ultralytics Platform para un despliegue de IA de visión escalable y de baja latencia frente a la inferencia compartida.

ABAbirami Vina6 min read
Puntos finales de inferencia dedicados vs inferencia compartida para despliegue

Recientemente, presentamos la Ultralytics Platform, una solución integral que reúne todo el flujo de trabajo de computer vision en un solo lugar, desde la preparación de datasets y el entrenamiento de modelos hasta la inferencia, el despliegue y la monitorización.

Construida basándonos en los comentarios de la comunidad de visión artificial, la plataforma está diseñada para simplificar cada etapa del desarrollo proporcionando funciones integradas que respaldan el ciclo de vida completo de las aplicaciones de IA visual.

Por ejemplo, una vez que un model is trained, el siguiente paso es desplegarlo para poder utilizarlo en la ejecución de inferencias y la realización de predicciones en aplicaciones del mundo real. La plataforma facilita este proceso al ofrecer múltiples deployment options.

Puedes exportar modelos para ejecutarlos en tu propio entorno, utilizar la inferencia compartida para pruebas rápidas o desplegar endpoints dedicados para aplicaciones escalables listas para producción. Cada una de estas opciones de despliegue te permite ejecutar inferencia de IA, pero están diseñadas para diferentes etapas y casos de uso.

Ultralytics Platform enabling scalable global vision AI model deployment

Fig 1. Ultralytics Platform enables scalable global vision AI model deployment (Source)

La exportación de modelos te da control total para ejecutarlos en tu propia infraestructura, la inferencia compartida hace que sea sencillo probar y experimentar sin configuraciones, y los endpoints dedicados están diseñados para cargas de trabajo de producción fiables y a gran escala.

A primera vista, la inferencia compartida y los endpoints dedicados pueden parecer bastante similares. Ambos te permiten enviar solicitudes API a tu modelo y recibir predicciones estructuradas, facilitando la integración de la IA visual en las aplicaciones.

Sin embargo, a medida que tus cargas de trabajo crecen y tus aplicaciones de visión artificial comienzan a manejar solicitudes de inferencia en tiempo real, las diferencias entre estas opciones cobran mayor importancia. En este artículo, analizaremos más de cerca la inferencia compartida y los endpoints dedicados, cómo se comparan, cuándo usar cada uno y por qué los endpoints dedicados se convierten en la mejor opción a medida que tus aplicaciones escalan.

Una visión general del despliegue usando inferencias compartidas#

Shared inference es una forma sencilla de ejecutar inferencias de IA en tus modelos sin configurar ninguna infraestructura ni preocuparte por tipos de GPU, integración de frameworks o configuración de runtime. Una vez que tu modelo esté entrenado o fine-tuned, puedes usarlo para realizar predicciones directamente a través de la plataforma.

En esta configuración, tu modelo se ejecuta en recursos de computación compartidos y multiusuario en algunas regiones principales, como EE. UU., Europa y Asia-Pacífico. Las solicitudes se enrutan automáticamente a los servicios disponibles, por lo que no necesitas configurar instancias de GPU o entornos de ejecución. Todo se gestiona por ti, facilitando el inicio.

Cuando usas la inferencia compartida, envías solicitudes a tu modelo a través de una REST API utilizando herramientas como Python o CLI, y recibes salidas JSON estructuradas, como objetos detectados, puntuaciones de confianza y otros detalles de predicción. Esto hace que sea fluido probar modelos e integrarlos en aplicaciones.

Dado que el sistema es compartido, está diseñado para desarrollo, pruebas y uso ligero. Funciona bien para validar predicciones y construir integraciones iniciales. Al mismo tiempo, el rendimiento puede variar según la carga del sistema y el uso está limitado a 20 solicitudes por minuto por clave API, lo que lo hace menos adecuado para cargas de trabajo de producción de alto rendimiento.

En general, la inferencia compartida es la más adecuada para el desarrollo en etapas iniciales, donde el enfoque está en comprender y mejorar tu modelo antes de pasar a aplicaciones a mayor escala.

Despliega modelos globalmente usando endpoints dedicados#

Dedicated endpoints son servicios de inferencia de inquilino único (single-tenant) donde tus modelos de visión de IA se ejecutan en recursos de cómputo aislados. En lugar de compartir infraestructura, cada endpoint cuenta con su propio runtime con recursos configurables como CPU y memoria, lo que te otorga un mayor control sobre el rendimiento.

Cuando despliegas un modelo como un endpoint dedicado, se le asigna una URL de API única y utiliza tu clave de API para la autenticación, lo que facilita su integración en aplicaciones. Estos endpoints se pueden desplegar en 43 global regions, lo que te permite ejecutar inferencias más cerca de tus usuarios y reducir la latencia.

Deploying dedicated endpoints in 43 global regions

Fig 2. You can deploy dedicated endpoints in 43 global regions (Source)

Una de las ventajas clave es el escalado automático. Los endpoints se ajustan automáticamente según las solicitudes entrantes, escalando hacia arriba para manejar mayor tráfico y hacia abajo cuando la demanda disminuye. Con el escalado a cero habilitado por defecto, los endpoints pueden apagarse cuando están inactivos y reiniciarse cuando es necesario, ayudando a optimizar el uso de recursos.

En otras palabras, los endpoints dedicados están diseñados para cargas de trabajo de producción. Proporcionan una baja latencia consistente, mayor rendimiento y mayor fiabilidad en comparación con la inferencia compartida.

Además, los endpoints dedicados no tienen límites de tasa. Las solicitudes van directamente a tu endpoint, por lo que cuánto tráfico puedes manejar depende de tu configuración y escalado en lugar de límites fijos.

Además de esto, la monitorización incorporada, los registros, las comprobaciones de estado y el comportamiento predecible de tiempo de ejecución y arranque hacen que sea sencillo realizar un seguimiento del rendimiento y mantener despliegues estables en todos los planes. En el plan gratuito, los arranques en frío suelen tardar entre 5 y 45 segundos, mientras que los endpoints del plan Pro permanecen calientes, lo que resulta en un rendimiento de inferencia más rápido y predecible.

En pocas palabras, los endpoints dedicados son ideales para aplicaciones de IA visual en tiempo real que requieren una inferencia fiable, escalable y de alto rendimiento.

Inferencia compartida vs. endpoints dedicados: diferencias principales#

Aquí tienes un vistazo más de cerca a cómo se comparan la inferencia compartida y los endpoints dedicados:

  • Latencia: La latencia puede variar en entornos compartidos debido a la compartición de recursos, mientras que los endpoints dedicados proporcionan respuestas más consistentes y de baja latencia.
  • Regiones: La inferencia compartida está disponible en algunas regiones (EE. UU., UE, AP), mientras que los endpoints dedicados admiten el despliegue en 43 regiones globales.
  • Escalabilidad: El escalado no es configurable en la inferencia compartida, mientras que los endpoints dedicados escalan automáticamente según el tráfico entrante.
  • Límites de tasa: La inferencia compartida tiene límites de tasa (20 solicitudes o llamadas API por minuto por clave API), mientras que los endpoints dedicados no tienen límites de tasa de plataforma.
  • Precios: La inferencia compartida está incluida sin coste adicional para pruebas y desarrollo, mientras que los endpoints dedicados ofrecen más control y escalabilidad, con un uso que depende de la configuración de recursos y las necesidades de despliegue.

Por qué los endpoints dedicados son mejores para cargas de trabajo de producción#

A medida que las aplicaciones de IA y aprendizaje automático pasan de las pruebas al uso en el mundo real, el rendimiento, la escalabilidad y la fiabilidad se vuelven esenciales. Por eso los endpoints dedicados ofrecen claras ventajas sobre la inferencia compartida.

Con endpoints dedicados, tu modelo preentrenado o personalizado se ejecuta en sus propios recursos de computación, por lo que el rendimiento no se ve afectado por otros usuarios. Esto ayuda a mantener la latencia baja y consistente, lo cual es importante para aplicaciones en tiempo real como análisis de vídeo y sistemas de monitorización.

A look at deploying using a dedicated inference endpoint

Fig 3. A look at deploying using a dedicated inference endpoint (Source)

Por ejemplo, piensa en un sistema de análisis minorista que procesa transmisiones de cámara en vivo en varias tiendas. Al desplegar endpoints en 43 regiones globales, la inferencia puede ejecutarse más cerca de cada tienda, reduciendo la latencia y mejorando los tiempos de respuesta.

Con la inferencia compartida, donde los recursos se comparten y las regiones son limitadas, el rendimiento puede variar durante los períodos de mayor actividad.

Los endpoints dedicados también pueden manejar un mayor tráfico y escalar automáticamente según la demanda. Con monitorización incorporada, registros y comprobaciones de estado, proporcionan un rendimiento más predecible, lo que los convierte en una buena opción para cargas de trabajo de IA a gran escala y continuas.

Dónde encaja la inferencia compartida en el flujo de trabajo de la IA visual#

Mientras exploras las diferencias entre la inferencia compartida y los endpoints dedicados, es posible que te preguntes dónde encaja la inferencia compartida en el flujo de trabajo general de visión artificial.

Tomemos el ejemplo del análisis minorista de nuevo. Antes de desplegar una solución de visión en varias tiendas, los equipos generalmente necesitan probar cómo funciona con datos reales y refinarla en función de esos resultados.

La inferencia compartida hace que este proceso sea sencillo al permitirte enviar imágenes de muestra o fotogramas de vídeo desde las cámaras de la tienda y revisar rápidamente las predicciones sin configurar infraestructura. Esto es especialmente útil para probar el comportamiento del modelo, depurar predicciones incorrectas y validar resultados en diferentes condiciones, como cambios en la iluminación o en la disposición de la tienda.

Al iterar de esta manera, los equipos pueden mejorar la precisión y fiabilidad del modelo antes de pasar a producción. Una vez que el modelo funciona bien en estos escenarios de prueba, puede desplegarse en endpoints dedicados para su uso en tiempo real en múltiples ubicaciones.

La inferencia compartida también puede funcionar bien para aplicaciones con un uso bajo o poco frecuente. Por ejemplo, una pequeña tienda minorista podría usarla para analizar ocasionalmente el flujo de personas o revisar la actividad del cliente en momentos específicos, sin necesidad de un despliegue a gran escala. En estos casos, proporciona una forma sencilla y rentable de ejecutar inferencia bajo demanda.

Casos de uso en el mundo real de los endpoints dedicados#

A medida que las aplicaciones de IA van más allá de las pruebas, la elección del despliegue comienza a afectar directamente al rendimiento, la escalabilidad y la experiencia del usuario. Los endpoints dedicados pueden utilizarse ampliamente en todos los sectores porque proporcionan un rendimiento estable, baja latencia y la capacidad de manejar cargas de trabajo a gran escala.

Aquí tienes algunos casos de uso comunes que muestran cómo los endpoints dedicados se pueden utilizar en aplicaciones del mundo real:

  • Retail y analítica de vídeo: una cadena de retail puede utilizar computer vision para rastrear el movimiento de los clientes, identificar productos populares y monitorizar la actividad de la tienda en tiempo real. Los endpoints dedicados mantienen la inferencia rápida y constante en múltiples ubicaciones de tiendas, incluso durante las horas punta.
  • Manufacturing e inspección de calidad: en una línea de producción, los modelos pueden detectar defectos o anomalías a medida que los productos se desplazan por el sistema. Los endpoints dedicados admiten inferencia continua en tiempo real, lo que ayuda a los equipos a detectar problemas de forma temprana y a mantener la calidad del producto sin ralentizar las operaciones.
  • Healthcare e imagen médica: los proveedores sanitarios y los laboratorios de diagnóstico pueden confiar en los modelos de visión para analizar imágenes médicas como radiografías o escáneres. Los endpoints dedicados proporcionan un rendimiento fiable y constante, algo fundamental al manipular datos sensibles y diagnósticos críticos para el tiempo.
  • Automatización de almacenes y logística: Los grandes almacenes a menudo operan múltiples sistemas idénticos, como cintas transportadoras y líneas de clasificación, actuando efectivamente como réplicas de la misma configuración. Los modelos de visión artificial pueden monitorizar cada réplica para detectar problemas como atascos o paquetes mal enrutados. Los endpoints dedicados garantizan una inferencia consistente en todas las réplicas en tiempo real.

Transición de la inferencia compartida a endpoints dedicados#

Uno de los beneficios clave de la Ultralytics Platform es lo sencillo que es pasar de la inferencia compartida a endpoints dedicados a medida que crece tu aplicación. En lugar de cambiar de herramienta o reconstruir tu configuración, puedes hacer la transición a un despliegue listo para producción dentro del mismo entorno.

Después de probar tu modelo con inferencia compartida, pasar a un endpoint dedicado es un paso siguiente sencillo. Puedes desplegar el mismo modelo en un endpoint, elegir tu región y recursos de computación preferidos, y actualizar la URL del endpoint en tu aplicación. La integración general sigue siendo similar, por lo que hay poco o ningún cambio en cómo envías solicitudes o manejas las respuestas.

Viewing a dedicated endpoint URL on Ultralytics Platform

Fig 4. Viewing a dedicated endpoint URL on Ultralytics Platform (Source)

Esto significa que puedes escalar de las pruebas a la producción con unos pocos clics. A medida que tu carga de trabajo aumenta o tu aplicación requiere un rendimiento más consistente, puedes pasar a endpoints dedicados sin interrumpir tu flujo de trabajo existente.

Para obtener más información sobre el despliegue de modelos mediante endpoints dedicados en la Ultralytics Platform, consulta la documentación oficial Ultralytics Platform docs.

Conclusiones clave#

La inferencia compartida es un gran punto de partida para pruebas y experimentación, pero las cargas de trabajo de producción exigen más consistencia y escala. A medida que crecen las aplicaciones, los endpoints dedicados proporcionan el rendimiento y la fiabilidad necesarios para respaldar el uso en el mundo real. Esto los convierte en la mejor opción para la mayoría de los despliegues de producción.

Únete a nuestra community y explora nuestro GitHub repository para obtener más información sobre los modelos de computer vision. Lee sobre aplicaciones como AI in agriculture y computer vision in robotics en nuestras páginas de soluciones. Consulta nuestras licensing options y empieza a trabajar con vision AI.

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático