Zero-Shot Learning
Explora el aprendizaje de cero disparos (ZSL) para detectar y clasificar objetos sin datos de entrenamiento. Aprende cómo Ultralytics YOLO-World permite la detección en tiempo real con vocabulario abierto.
El aprendizaje de cero disparos (ZSL) es un paradigma del aprendizaje automático que permite a los modelos de inteligencia artificial reconocer, clasificar o detectar objetos que nunca han encontrado durante su fase de entrenamiento. En el aprendizaje supervisado tradicional, un modelo necesita miles de ejemplos etiquetados para cada categoría específica que debe identificar. El ZSL elimina esta estricta dependencia aprovechando información auxiliar —normalmente descripciones de texto, atributos semánticos o embeddings— para conectar las clases conocidas con las desconocidas. Esta capacidad permite que los sistemas de inteligencia artificial (AI) sean mucho más flexibles y escalables, y puedan desenvolverse en entornos dinámicos donde recopilar datos exhaustivos para cada objeto posible resulta poco práctico.
Cómo funciona el aprendizaje de cero disparos#
El mecanismo central del ZSL consiste en transferir conocimientos de conceptos conocidos a otros desconocidos mediante un espacio semántico compartido. En lugar de aprender a reconocer una «cebra» únicamente memorizando patrones de píxeles de rayas blancas y negras, el modelo aprende la relación entre las características visuales y los atributos semánticos (por ejemplo, «forma parecida a la de un caballo», «patrón de rayas» y «cuatro patas») obtenidos del procesamiento del lenguaje natural (NLP).
Este proceso suele basarse en modelos multimodales que alinean las representaciones de imágenes y texto. Por ejemplo, investigaciones fundamentales como CLIP de OpenAI demuestran cómo los modelos pueden aprender conceptos visuales a partir de la supervisión mediante lenguaje natural. Cuando un modelo ZSL encuentra un objeto desconocido, extrae sus características visuales y las compara con un diccionario de vectores semánticos. Si las características visuales coinciden con la descripción semántica de la nueva clase, el modelo puede clasificarla correctamente y realizar de forma efectiva una predicción «de cero disparos». Este enfoque es fundamental para los modelos fundacionales modernos, que generalizan en una gran variedad de tareas.
Aplicaciones en el mundo real#
El aprendizaje de cero disparos impulsa la innovación en diversos sectores al permitir que los sistemas generalicen más allá de sus datos de entrenamiento iniciales.
-
Detección de objetos con vocabulario abierto: Las arquitecturas modernas, como YOLO-World, utilizan ZSL para detectar objetos a partir de indicaciones de texto definidas por el usuario. Esto permite realizar detección de objetos en situaciones en las que es imposible definir de antemano una lista fija de clases, como buscar elementos específicos en grandes archivos de vídeo. Los investigadores de Google Research siguen ampliando los límites de estas capacidades de vocabulario abierto.
-
Diagnóstico médico: En la inteligencia artificial en sanidad, obtener datos etiquetados sobre enfermedades raras suele ser difícil y caro. Los modelos ZSL pueden entrenarse con afecciones comunes y descripciones de síntomas raros extraídas de la literatura médica disponible en bases de datos como PubMed, lo que permite al sistema señalar posibles anomalías raras en imágenes médicas sin necesitar un conjunto de datos masivo de casos positivos.
-
Conservación de la fauna: En la inteligencia artificial en agricultura y la ecología, identificar especies en peligro de extinción que rara vez son fotografiadas es fundamental. El ZSL permite a los conservacionistas detectar estos animales mediante descripciones basadas en atributos definidas en bases de datos biológicas como la Encyclopedia of Life.
Detección de cero disparos con Ultralytics#
El modelo Ultralytics YOLO-World ejemplifica el aprendizaje de cero disparos en la práctica. Permite a los usuarios definir clases personalizadas dinámicamente durante la ejecución sin volver a entrenar el modelo. Esto se consigue conectando una sólida red troncal de detección con un codificador de texto que entiende el lenguaje natural.
El siguiente ejemplo en Python muestra cómo utilizar YOLO-World para detectar objetos que no formaban parte explícita de un conjunto de entrenamiento estándar mediante el paquete ultralytics.
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model capable of Zero-Shot Learning
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes via text prompts (e.g., specific accessories)
# The model adjusts to detect these new classes without retraining
model.set_classes(["blue backpack", "red apple", "sunglasses"])
# Run inference on an image to detect the new zero-shot classes
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()Diferencias con conceptos relacionados#
Para comprender plenamente el ZSL, resulta útil diferenciarlo de estrategias de aprendizaje similares utilizadas en la visión por ordenador (CV):
- Aprendizaje con pocos ejemplos (FSL): Mientras que el ZSL no requiere ningún ejemplo de la clase objetivo, el FSL proporciona al modelo un conjunto de apoyo muy reducido (normalmente, de 1 a 5 ejemplos) para adaptarse. Por lo general, el ZSL se considera más difícil, ya que depende completamente de la inferencia semántica y no de ejemplos visuales.
- Aprendizaje de un solo ejemplo: Subconjunto del FSL en el que el modelo aprende a partir de exactamente un ejemplo etiquetado. El ZSL se diferencia fundamentalmente porque funciona sin siquiera una imagen de la nueva categoría.
- Aprendizaje por transferencia: Este término amplio hace referencia a la transferencia de conocimientos de una tarea a otra. El ZSL es un tipo específico de aprendizaje por transferencia que utiliza atributos semánticos para transferir conocimientos a clases desconocidas sin necesidad de realizar un ajuste fino tradicional con datos nuevos.
Retos y perspectivas de futuro#
Aunque el ZSL ofrece un enorme potencial, se enfrenta a retos como el problema del desplazamiento de dominio, por el que los atributos semánticos aprendidos durante el entrenamiento no se corresponden perfectamente con la apariencia visual de las clases desconocidas. Además, los modelos ZSL pueden sufrir sesgos: la precisión de las predicciones es significativamente mayor para las clases conocidas que para las desconocidas.
Las investigaciones de organizaciones como el laboratorio de inteligencia artificial de la Universidad de Stanford y la IEEE Computer Society siguen abordando estas limitaciones. A medida que las herramientas de visión por ordenador se vuelvan más robustas, se espera que el ZSL se convierta en una función estándar y reduzca la dependencia de esfuerzos masivos de etiquetado de datos. Para los equipos que buscan gestionar conjuntos de datos de forma eficiente antes de implementar modelos avanzados, la Ultralytics Platform ofrece herramientas completas para la anotación y la gestión de conjuntos de datos.









