¿Qué es YOLOE? Lleva los modelos de visión artificial más lejos
Descubre cómo YOLOE permite encontrar objetos mediante una instrucción o una foto sencillas. Permite una visión artificial más inteligente y rápida sin volver a entrenar ni ajustar los modelos.

La detección de objetos es una tarea clave de la visión por ordenador cuyo objetivo es identificar y localizar objetos en imágenes o vídeos. Es una parte fundamental de la visión por ordenador, un campo de la inteligencia artificial (AI) que permite a las máquinas comprender e interpretar datos visuales. Por ejemplo, la detección de objetos puede ayudar a identificar un coche en una imagen o localizar a una persona en una transmisión de vídeo.
Una de las series de modelos más conocidas que admite tareas de visión por ordenador, como la detección de objetos, es la serie de modelos YOLO (Solo miras una vez). Diseñados para ofrecer velocidad y precisión, los modelos YOLO han mejorado continuamente con el tiempo. Por ejemplo, una de las versiones más recientes, Ultralytics YOLO11, funciona bien en situaciones reales y proporciona resultados precisos incluso en entornos más complejos.
Para impulsar aún más este progreso, un nuevo modelo llamado YOLOE pretende ampliar las capacidades de los modelos YOLO. A diferencia de los modelos tradicionales, que requieren un reentrenamiento para reconocer objetos nuevos, YOLOE puede seguir sencillas indicaciones de texto o imagen para detectar objetos que no ha visto antes, lo que lo hace mucho más adaptable a entornos cambiantes.
En este artículo, analizaremos más de cerca qué hace único a YOLOE, cómo se compara con modelos YOLO anteriores y cómo puedes empezar a usarlo hoy mismo. ¡Empecemos!
Descripción general de YOLOE#
YOLOE es un modelo de visión por ordenador que lleva la detección de objetos un paso más allá. Fue presentado en marzo de 2025 por investigadores de la Universidad de Tsinghua. Lo que diferencia a YOLOE de los modelos tradicionales es el uso de la detección con vocabulario abierto.
Mientras que la mayoría de los modelos se entrenan para reconocer una lista fija de objetos, YOLOE te permite especificar qué buscar mediante una breve descripción o una imagen de ejemplo. Por ejemplo, si buscas una «mochila verde», puedes escribir esa descripción o mostrarle una foto al modelo, y YOLOE la localizará en la escena.
Además, incluso sin ninguna indicación, YOLOE puede detectar por sí solo muchos objetos cotidianos. Esta capacidad de reconocer objetos que nunca ha visto se denomina detección zero-shot. Es especialmente útil en entornos dinámicos en los que la tarea o los objetos de interés pueden cambiar inesperadamente.

Fig. 1. Una muestra de las capacidades de YOLOE.
Características principales de YOLOE#
YOLOE admite una amplia variedad de características diseñadas para mejorar su rendimiento en aplicaciones reales. Gracias a su capacidad para gestionar entradas estructuradas y no estructuradas, YOLOE abre nuevas posibilidades para la detección y segmentación de objetos.
Estas son algunas de las características principales que ofrece el modelo:
- Detección basada en indicaciones: YOLOE puede buscar objetos basándose en una breve indicación de texto o en una imagen de ejemplo. Esto significa que no necesitas volver a entrenar el modelo cada vez que cambia tu tarea; solo tienes que describirle al modelo lo que buscas o mostrarle una imagen.
- Segmentación de instancias: además de dibujar cuadros delimitadores alrededor de los objetos, YOLOE puede delinear su forma exacta mediante la segmentación de instancias. Esto resulta especialmente útil cuando los objetos se solapan o cuando necesitas conocer los límites precisos de un objeto.
- Reconocimiento de objetos sin indicaciones: YOLOE puede reconocer objetos incluso sin instrucciones específicas. Utiliza un conjunto de descripciones aprendidas previamente para identificar objetos rápidamente, lo que hace que el proceso sea más rápido y eficiente.
Comparación de YOLOE con otros modelos YOLO#
Ahora que entendemos mejor qué es YOLOE, veamos algunos modelos similares de la familia YOLO.
A medida que ha avanzado la visión por ordenador, también lo han hecho los modelos YOLO. Por ejemplo, Ultralytics YOLOv8 incorporó compatibilidad con nuevas tareas, como la segmentación y la clasificación, mientras que las versiones posteriores, como Ultralytics YOLO11, se han centrado en mejorar la precisión y el rendimiento para una gama más amplia de tareas.
Además, YOLO-World se lanzó en enero de 2024 e introdujo la posibilidad de utilizar indicaciones escritas, permitiendo a los usuarios describir los objetos que querían encontrar. Aunque YOLO-World era una excelente opción para la detección zero-shot, carecía de características como la segmentación de instancias y la compatibilidad con indicaciones visuales.
YOLOE se basa en YOLO-World al añadir estas capacidades, mejorar la flexibilidad y el rendimiento, y ofrecer una herramienta más útil para aplicaciones reales de visión por ordenador.

Fig. 2. Tanto YOLO-World como YOLOE admiten la detección zero-shot.
Uso de YOLOE con el paquete Python de Ultralytics#
Tanto si quieres detectar objetos específicos como explorar todo lo que aparece en una imagen, empezar a utilizar YOLOE es sencillo. El paquete Python de Ultralytics admite este modelo, por lo que es fácil integrarlo en tus proyectos. A continuación, veremos cómo utilizarlo.
Instalación del paquete Ultralytics#
El primer paso es instalar el paquete Python de Ultralytics mediante un gestor de paquetes como «pip». Puedes hacerlo ejecutando el comando “pip install ultralytics” en tu terminal o símbolo del sistema.
Una vez instalado el paquete, tendrás todo lo necesario para cargar el modelo, realizar predicciones y experimentar con distintos modos de detección. Si encuentras algún problema durante la instalación, la documentación oficial de Ultralytics ofrece una útil sección de solución de problemas.
Hay varias formas de utilizar YOLOE para realizar predicciones. Realizar predicciones significa utilizar el modelo entrenado para identificar y localizar objetos en imágenes o vídeos. Estos distintos métodos te permiten personalizar la forma de interactuar con el modelo según tus necesidades específicas.
Veamos cada uno de estos métodos por separado.
Detección de objetos específicos con indicaciones de texto o imagen#
YOLOE puede detectar objetos basándose en una breve descripción de texto. Por ejemplo, si buscas un caballo en movimiento, puedes utilizar una indicación como «horse walking».
Para empezar, carga primero el modelo YOLOE preentrenado y establece tu indicación (la descripción de lo que quieres que busque el modelo), tal como se muestra en el siguiente fragmento de código.
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg.pt")
prompt = ["horse walking"]
model.set_classes(prompt, model.get_text_pe(prompt))Una vez configurados el modelo y la indicación, puedes ejecutar el modelo sobre una imagen o un vídeo. Sustituye la ruta del archivo en el código por la ruta de tu archivo de imagen o vídeo:
results = model.predict("path/to/your/image.jpg")
results[0].show()Esto mostrará la imagen con el objeto detectado claramente señalado según tu indicación. Puedes cambiar la indicación para buscar distintos objetos, como «red suitcase», «bicycle» o «zebra», según lo que estés buscando.

Fig. 3. Un ejemplo del uso de YOLOE para detectar objetos específicos mediante una indicación de texto.
Del mismo modo, puedes utilizar una imagen para indicar a YOLOE qué buscar con el paquete Python de Ultralytics. En el modo de indicación visual, el modelo utiliza la imagen para encontrar elementos de aspecto similar en otra escena. Esto resulta especialmente útil para objetos difíciles de describir o que carecen de etiquetas claras.
Para consultar el código con más detalle, puedes visitar la documentación de Ultralytics.
Detección general de objetos con YOLOE#
En algunos casos, es posible que no sepas exactamente qué buscar o que no estés buscando un objeto concreto. Ahí es donde resulta útil el modo sin indicaciones.
Con esta opción, no necesitas escribir una descripción ni proporcionar una imagen de ejemplo. YOLOE simplemente analiza las imágenes por su cuenta y detecta todo lo que puede reconocer, como personas, animales, muebles u objetos cotidianos.
Es una forma útil de explorar una escena sin dar instrucciones específicas al modelo. Tanto si estás escaneando una sala abarrotada como revisando imágenes con mucha actividad, el modo sin indicaciones te ofrece una visión rápida de lo que hay en una imagen.
Puedes utilizar el siguiente código para ejecutar YOLOE en el modo sin indicaciones. Primero se carga el modelo; después, procesa la imagen y detecta automáticamente los objetos que contiene. Por último, se muestran los resultados y se resaltan los objetos detectados.
Asegúrate de sustituir la ruta del archivo por la ruta real de tu imagen.
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg-pf.pt")
results = model.predict("path/to/image.jpg")
results[0].show()La imagen que aparece a continuación es un ejemplo de lo que YOLOE puede detectar en el modo sin indicaciones.

Fig. 4. Uso de YOLOE en el modo sin indicaciones.
Aplicaciones de YOLOE en tiempo real#
La capacidad de YOLOE para responder tanto a indicaciones de texto como de imagen lo convierte en una herramienta fiable para aplicaciones en tiempo real. Su flexibilidad resulta especialmente útil en entornos dinámicos en los que el tiempo y la precisión son esenciales.
Veamos algunos ejemplos reales de cómo se puede utilizar YOLOE.
Mejora de la gestión de equipajes: detección de maletas en tiempo real#
En los aeropuertos con mucha actividad, localizar un equipaje concreto puede ser complicado, especialmente cuando hay maletas extraviadas. YOLOE puede agilizar este proceso ayudando a analizar vídeos en directo e identificar rápidamente objetos basándose en indicaciones sencillas como «red bag».
Si falta una bolsa o se ha colocado en el lugar equivocado, el personal puede cambiar fácilmente la indicación para buscar otro objeto, como una «black suitcase». Esta capacidad de adaptación instantánea puede ayudar al personal del aeropuerto a localizar rápidamente el equipaje correcto sin revisar muchas horas de grabación ni volver a entrenar el modelo, haciendo que la gestión de equipajes y la resolución de problemas relacionados con maletas extraviadas sean mucho más rápidas y eficientes.
Supervisión de espacios públicos con YOLOE#
Las grabaciones de vigilancia de espacios públicos, como mercados y cafeterías concurridos, suelen incluir una combinación de personas, objetos y actividades que cambia a lo largo del día. YOLOE puede analizar estas grabaciones en tiempo real mediante el modo sin indicaciones y detectar automáticamente elementos como bolsas, mesas o bicicletas sin necesidad de instrucciones específicas.

Fig. 5. YOLOE puede detectar diversos objetos en un espacio público concurrido.
Esto resulta especialmente útil para que los equipos de seguridad detecten objetos desatendidos o sigan el movimiento de la multitud. La capacidad de YOLOE para detectar varios objetos a la vez facilita la gestión de espacios públicos durante eventos o periodos de mucha actividad, ayudando a los equipos a mantenerse informados y responder con rapidez.
Ventajas y desventajas de YOLOE#
Estas son algunas de las principales ventajas de utilizar YOLOE en aplicaciones de visión por ordenador:
- Rendimiento en tiempo real: YOLOE está optimizado para procesar datos de forma rápida y eficiente, lo que permite realizar detecciones en tiempo real, incluso en entornos dinámicos como transmisiones de vídeo en directo o espacios públicos concurridos.
- Escalabilidad: YOLOE es escalable y funciona bien en una amplia variedad de aplicaciones, desde la seguridad y la vigilancia hasta el comercio minorista, la sanidad y los vehículos autónomos.
- Fácil de usar: como el paquete Python de Ultralytics admite YOLOE, es fácil integrarlo en tus proyectos de visión por ordenador existentes.
Sin embargo, hay algunas limitaciones que debes tener en cuenta al utilizar YOLOE. Estos son un par de factores que conviene considerar:
- Requiere suficientes datos de entrenamiento: aunque YOLOE admite la detección zero-shot, su rendimiento con objetos no vistos depende de lo bien que generalice a partir de sus datos de entrenamiento. En algunos casos, puede necesitar datos adicionales o un ajuste fino para funcionar bien en tareas muy especializadas.
- Es sensible a la calidad de entrada: la precisión del modelo puede verse afectada por imágenes o vídeos de baja calidad. Una entrada borrosa o con poca iluminación puede reducir la capacidad del modelo para detectar objetos con precisión, por lo que una entrada de alta calidad es importante para obtener un rendimiento óptimo.
Conclusiones clave#
YOLOE aporta más flexibilidad a la visión por ordenador al permitir a los usuarios guiar la detección mediante indicaciones de texto o imagen. Funciona bien en situaciones reales en las que las escenas cambian rápidamente y no es posible volver a entrenar el modelo.
Desde la gestión de equipajes hasta la supervisión de espacios públicos, YOLOE se adapta fácilmente a nuevas tareas. A medida que la AI se vuelve más accesible, modelos como YOLOE ayudan a más sectores a utilizar la tecnología de visión de forma práctica y eficiente.
Únete a nuestra comunidad y explora nuestro repositorio de GitHub para obtener más información sobre las innovaciones en AI. Descubre los últimos avances en áreas como la AI en el comercio minorista y la visión por ordenador en la sanidad en nuestras páginas de soluciones. Consulta nuestras opciones de licencia y empieza hoy mismo a utilizar la visión por ordenador.









