One-Shot Learning
Explora el aprendizaje de un solo disparo (One-Shot Learning) en IA. Aprende a clasificar objetos a partir de una sola imagen utilizando Ultralytics YOLO26 y redes siamesas para una visión artificial eficiente.
El aprendizaje de una sola toma (One-Shot Learning) es una técnica de clasificación especializada en aprendizaje automático (ML) diseñada para aprender información sobre categorías de objetos a partir de un solo ejemplo de entrenamiento. A diferencia de los algoritmos tradicionales de aprendizaje profundo (DL), que requieren conjuntos de datos masivos que contienen miles de imágenes anotadas para generalizar de manera efectiva, el aprendizaje de una sola toma imita la capacidad cognitiva humana de captar un nuevo concepto al instante. Por ejemplo, una persona normalmente puede reconocer un ave exótica específica después de verla una sola vez; esta metodología intenta replicar esa eficiencia en sistemas de inteligencia artificial (AI). Es especialmente valiosa en escenarios donde la etiquetado de datos es costosa, los datos son escasos o se deben agregar nuevas categorías de forma dinámica sin reentrenar todo el modelo.
Mecanismos detrás del concepto#
El principio fundamental del aprendizaje de una sola toma consiste en cambiar el objetivo de la clasificación estándar a la evaluación de similitud. En lugar de entrenar una red neuronal (NN) para que produzca una etiqueta de clase específica (p. ej., "perro" o "gato"), el modelo aprende una función de distancia. Una arquitectura común empleada para esto es la red neuronal siamesa, que consta de dos subredes idénticas que comparten los mismos pesos del modelo.
Durante la operación, la red realiza la extracción de características para convertir las imágenes de entrada en vectores numéricos compactos conocidos como incrustaciones. A continuación, el sistema compara la incrustación de una nueva imagen de consulta con la incrustación de la única «toma» de referencia. Si la distancia matemática —calculada a menudo mediante la distancia euclidiana o la similitud de coseno— está por debajo de cierto umbral, se determina que las imágenes pertenecen a la misma clase. Esto permite que el modelo verifique la identidad o clasifique objetos basándose en su proximidad en el espacio de características aprendido.
El siguiente código en Python demuestra cómo extraer incrustaciones y calcular la similitud utilizando un modelo de clasificación YOLO26 del paquete ultralytics.
import numpy as np
from ultralytics import YOLO
# Load a pre-trained YOLO26 classification model for feature extraction
model = YOLO("yolo26n-cls.pt")
# Extract embeddings for a reference 'shot' and a query image
# The embed() method returns the feature vector directly
shot_vec = model.embed("reference_img.jpg")[0]
query_vec = model.embed("query_img.jpg")[0]
# Calculate similarity (higher dot product implies greater similarity)
similarity = np.dot(shot_vec, query_vec) / (np.linalg.norm(shot_vec) * np.linalg.norm(query_vec))
print(f"Similarity Score: {similarity:.4f}")Distinguir paradigmas relacionados#
Es importante diferenciar el One-Shot Learning de otras técnicas de aprendizaje eficientes en cuanto a datos, ya que resuelven problemas similares mediante restricciones diferentes:
- Aprendizaje de pocas muestras (FSL): Esta es la categoría más amplia que abarca el aprendizaje de una sola toma. En el FSL, al modelo se le proporciona un pequeño "conjunto de soporte" de ejemplos, que normalmente oscila entre dos y cinco imágenes por clase. El aprendizaje de una sola toma es simplemente el caso extremo en el que el tamaño del conjunto de soporte es exactamente uno.
- Aprendizaje de disparo cero (ZSL): El ZSL se ocupa de reconocer categorías que el modelo nunca ha visto visualmente. En lugar de una imagen de referencia, el ZSL se basa en atributos semánticos o descripciones de texto (p. ej., identificar una "cebra" asociando características visuales con la descripción de texto "caballo con rayas") a través del procesamiento del lenguaje natural (NLP).
- Aprendizaje por transferencia: Esto implica tomar un modelo preentrenado en una base de datos grande como ImageNet y ajustarlo en una nueva tarea. Si bien el aprendizaje por transferencia impulsa los extractores de características utilizados en el aprendizaje de una sola toma, el aprendizaje por transferencia estándar suele requerir más de un ejemplo para actualizar los pesos de manera efectiva sin sobreajuste.
Aplicaciones en el mundo real#
El aprendizaje de una sola toma ha desbloqueado capacidades en sectores donde la recopilación de grandes cantidades de datos de entrenamiento es poco práctica.
Reconocimiento facial y seguridad#
La aplicación más ubicua del aprendizaje de una sola toma se encuentra en la seguridad biométrica. Al configurar Face ID en un teléfono inteligente o registrarse en un sistema de acceso para empleados, el dispositivo captura una única representación matemática del rostro del usuario. Durante el uso diario, el sistema de reconocimiento facial compara la transmisión de la cámara en vivo con esta "única toma" almacenada para verificar la identidad. Esto se basa en técnicas de incrustación robustas, como las analizadas en la investigación fundamental de FaceNet, para garantizar que los cambios en la iluminación o el ángulo no rompan la coincidencia de similitud.
Control de calidad industrial#
En la IA en la fabricación, crear un conjunto de datos equilibrado de piezas "defectuosas" es difícil porque los defectos son raros e inconsistentes. El aprendizaje de una sola toma permite que los sistemas de visión artificial (CV) aprendan la representación de una sola pieza de referencia "perfecta". Cualquier artículo en la línea de montaje que produzca una incrustación significativamente distante de esta referencia se marca para la detección de anomalías. Esto permite un control de calidad inmediato sin necesidad de miles de imágenes de piezas rotas, las cuales se pueden gestionar e implementar a través de la Ultralytics Platform.
Desafíos y perspectivas de futuro#
Aunque es potente, el aprendizaje de una sola toma es susceptible al ruido; si la única imagen de referencia es borrosa, está obstruida o no es representativa, la capacidad del modelo para reconocer esa clase se degrada significativamente. Los investigadores suelen emplear el metaaprendizaje, o "aprender a aprender", para mejorar la estabilidad y la generalización del modelo. A medida que evolucionan las arquitecturas, los modelos más nuevos como YOLO26 incorporan extractores de características más robustos que hacen que la inferencia de una sola toma sea más rápida y precisa, sentando las bases para dispositivos de Edge AI más adaptativos e inteligentes.






