Presentación de Ultralytics Agents: construye flujos de trabajo de IA visual más rápido
Construye flujos de trabajo de IA visual con Ultralytics Agents. Conecta YOLO, modelos de visión-lenguaje, condiciones, conjuntos de datos y acciones.

Entrenar un modelo de visión artificial sólido es solo una parte del recorrido. El siguiente desafío es decidir qué debe suceder cuando ese modelo realiza una predicción: guardar una imagen, solicitar más contexto, alertar a un equipo o recopilar un ejemplo incivilizado para su revisión.
Históricamente, los equipos construían esta orquestación utilizando scripts e integraciones independientes. Ultralytics Agents la lleva a un lienzo visual, ayudando a los equipos a convertir predicciones en acciones prácticas con menos desarrollo personalizado.
Disponible en Ultralytics Platform, Agents conecta imágenes, modelos de Ultralytics YOLO, implementaciones, condiciones, modelos de lenguaje, conjuntos de datos y acciones en flujos de trabajo visuales reutilizables.
¿Qué son Ultralytics Agents?#
Agents proporciona una forma visual de diseñar y ejecutar flujos de trabajo de visión artificial. Añade bloques al lienzo, conecta cada paso y define qué debe suceder cuando una imagen cumple una condición específica.
Un flujo de trabajo puede utilizar un modelo YOLO26 oficial, un modelo entrenado en tu espacio de trabajo o una implementación de Platform existente. A continuación, puede filtrar las predicciones por recuento de clases o confianza, enviar imágenes seleccionadas a un modelo de visión y lenguaje, recopilarlas en un conjunto de datos, notificar a un canal de Slack o mostrar el resultado.
Con Agents, puedes:
- Construir visualmente: Conecta modelos, condiciones y acciones sin crear manualmente el flujo de trabajo completo desde cero.
- Centrar la atención: Procesa únicamente las imágenes que cumplan los criterios que definas.
- Combinar inteligencia visual y de lenguaje: Utiliza YOLO para identificar lo que importa antes de pedir a un modelo de visión y lenguaje un contexto adicional.
- Convertir predicciones en acciones: Guarda imágenes relevantes, envía alertas de Slack condicionales o pasa los resultados al siguiente paso del flujo de trabajo.
- Conectar información de producción con los datos: Recopila imágenes inciertas o importantes para su revisión y el futuro desarrollo del modelo.
- Inspeccionar la implementación: Visualiza el código Python generado a partir de tu flujo de trabajo visual.
En lugar de detenerse en «¿Qué ha detectado el modelo?», los equipos pueden responder a la pregunta más valiosa: «¿Qué debería suceder a continuación?»
Pasa de la detección a la decisión#
Muchos sistemas de IA visual requieren múltiples herramientas y conexiones personalizadas. Un modelo genera predicciones, la lógica de la aplicación las evalúa, otro sistema almacena las entradas relevantes y una integración independiente envía notificaciones.
Agents reúne estos pasos en un único flujo de trabajo visual.
Por ejemplo, un equipo de fabricación podría ejecutar un modelo de inspección entrenado, comprobar si un defecto cumple un umbral elegido, guardar la imagen para su revisión y alertar a un canal de operaciones. Un equipo de logística podría recopilar detecciones de baja confianza para identificar lagunas en sus datos de entrenamiento. Un equipo de seguridad podría usar YOLO para detectar a una persona en una zona restringida antes de pedir a un modelo de visión y lenguaje que describa la escena más amplia.
El flujo de trabajo sigue las condiciones establecidas por el usuario, lo que aclara por qué se ejecuta cada paso posterior o por qué no se ejecuta.
Utiliza Ultralytics YOLO y modelos de visión y lenguaje juntos#
Los modelos YOLO son eficaces para localizar, clasificar y contar objetos dentro de las imágenes. Los modelos de visión y lenguaje pueden añadir una interpretación en lenguaje natural del contexto visual más amplio.
Agents permite combinar estas capacidades de manera eficiente. YOLO puede actuar como el primer filtro, permitiendo que el flujo de trabajo llame a un modelo de visión y lenguaje únicamente cuando una imagen cumple la condición requerida.
Por ejemplo, un flujo de trabajo podría:
- Ejecutar YOLO26 en una imagen.
- Comprobar si se ha detectado al menos una persona.
- Enviar las imágenes coincidentes a un modelo de visión y lenguaje seleccionado.
- Pedirle que describa la escena.
- Mostrar la descripción resultante.
Si no se cumple la condición, el paso de descripción no se ejecuta. Esto ofrece a los equipos un mayor control sobre qué imágenes avanzan a través del flujo de trabajo y cuándo se utilizan llamadas a modelos externos.
Empieza con una plantilla de flujo de trabajo editable#
Agents incluye plantillas que ayudan a los equipos a pasar rápidamente de una idea a un flujo de trabajo de IA visual operativo.
- YOLO → VLM Monitor: Utiliza YOLO para identificar imágenes relevantes antes de pedir a un modelo de visión y lenguaje que las describa.
- Recopilar detecciones inciertas: Filtra las predicciones por confianza y recopila imágenes inciertas en un conjunto de datos para su revisión.
- Capturar y alertar: Guarda una imagen y envía una notificación de Slack cuando se cumpla una condición de detección.
Las plantillas proporcionan un punto de partida práctico en lugar de una solución fija. Los equipos pueden seleccionar sus propias imágenes, modelos, implementaciones, condiciones, prompts, conjuntos de datos de destino e integraciones.
Los usuarios también pueden inspeccionar el código Python generado por un flujo de trabajo, combinando la velocidad del desarrollo visual con la transparencia que los equipos técnicos necesitan para comprender la implementación.
Cierra el ciclo entre la implementación y la mejora del modelo#
Las imágenes del mundo real pueden revelar condiciones que faltaban o estaban infrarrepresentadas durante el entrenamiento. Los nuevos entornos, la apariencia cambiante de los objetos y las detecciones inciertas pueden indicar oportunidades para mejorar un modelo.
Agents ayuda a los equipos a convertir esas observaciones en un bucle de datos procesable:
- Ejecutar imágenes a través de un modelo de Ultralytics YOLO o de una implementación de Platform.
- Filtrar los resultados utilizando condiciones de clase o confianza.
- Recopilar las imágenes originales seleccionadas en un conjunto de datos de destino.
- Revisar y etiquetar las imágenes en Ultralytics Platform.
- Reentrenar y volver a implementar utilizando datos informados por entradas del mundo real.
Las imágenes recopiladas a través de Agents llegan sin etiquetar en la división de entrenamiento del conjunto de datos de destino, listas para su revisión en el editor de anotaciones. Los equipos pueden etiquetar estos ejemplos específicos y utilizarlos para guiar la siguiente iteración del modelo.
Esto crea un camino más directo desde la identificación de un ejemplo difícil hasta la preparación de mejores datos de entrenamiento.
Construye flujos de trabajo en torno a resultados del mundo real#
Agents puede admitir flujos de trabajo en diversas industrias y casos de uso:
- Fabricación: Captura posibles defectos para su revisión y avisa a los equipos de calidad cuando se cumplan las condiciones definidas.
- Logística: Recopila detecciones inciertas relacionadas con contenedores, vehículos o equipos para mejorar la cobertura del conjunto de datos.
- Retail: Filtra imágenes en función de las clases o recuentos detectados y envía los resultados relevantes a las acciones posteriores.
- Seguridad y vigilancia: Detecta personas u objetos en escenarios especificados antes de solicitar contexto adicional de la escena.
- Desarrollo de conjuntos de datos: Encuentra ejemplos de baja confianza y agrúpalos en un conjunto de revisión enfocado.
Cada flujo de trabajo puede ramificarse desde una condición en múltiples acciones. Por ejemplo, la misma imagen coincidente se puede guardar en un conjunto de datos y activar un mensaje de Slack, ayudando a los equipos a preservar evidencias mientras notifican a las personas responsables de revisarlas.
Del prototipo visual al código Python transparente#
Los creadores de flujos de trabajo visuales pueden acelerar la experimentación, pero los equipos técnicos también necesitan visibilidad sobre lo que se está ejecutando.
Agents permite a los usuarios inspeccionar el código Python generado a partir de un flujo de trabajo. Esto conecta la accesibilidad de un lienzo visual con la transparencia que los desarrolladores necesitan para comprender la implementación subyacente.
Los equipos pueden probar un flujo de trabajo pequeño con la prueba compartida o seleccionar recursos de implementación de Platform dedicados para conjuntos de datos más grandes, ejecuciones más largas y modelos de espacio de trabajo entrenados.
Empieza a construir con Agents#
Ultralytics Agents ayuda a los equipos a ir más allá de las predicciones aisladas y a construir flujos de trabajo de IA visual conectados. Al reunir YOLO, modelos de visión y lenguaje, condiciones configurables, conjuntos de datos y acciones en un solo lienzo, Agents crea un camino más rápido desde la predicción hasta el resultado práctico.
Agents se encuentra actualmente disponible mediante Early access. Cambia a tu espacio de trabajo personal y habilita Early access en Settings > Profile. Esta es una preferencia personal, incluso cuando trabajas en un espacio de trabajo de equipo.
A continuación, abre Agents desde la barra lateral, empieza con una plantilla o construye tu propio flujo de trabajo en el Agents canvas. Explora los bloques compatibles, las condiciones, las opciones de ejecución y la guía de configuración en la documentación de Ultralytics Agents.









