One-Shot Learning
Explora el aprendizaje one-shot en IA. Descubre cómo clasificar objetos a partir de una sola imagen usando Ultralytics YOLO26 y redes siamesas para una visión por ordenador eficiente.
El aprendizaje con una sola muestra es una técnica de clasificación especializada dentro del aprendizaje automático (ML), diseñada para aprender información sobre categorías de objetos a partir de un único ejemplo de entrenamiento. A diferencia de los algoritmos tradicionales de aprendizaje profundo (DL), que requieren conjuntos de datos masivos con miles de imágenes anotadas para generalizar de forma eficaz, el aprendizaje con una sola muestra imita la capacidad cognitiva humana de asimilar un concepto nuevo al instante. Por ejemplo, una persona normalmente puede reconocer un ave exótica concreta después de verla una sola vez; esta metodología intenta replicar esa eficiencia en sistemas de inteligencia artificial (AI). Es especialmente valiosa en situaciones en las que el etiquetado de datos es caro, los datos son escasos o hay que añadir nuevas categorías dinámicamente sin volver a entrenar todo el modelo.
Mecanismos en los que se basa el concepto#
El principio fundamental del aprendizaje con una sola muestra consiste en cambiar el objetivo de la clasificación estándar a la evaluación de similitud. En lugar de entrenar una red neuronal (NN) para que produzca una etiqueta de clase específica (por ejemplo, «perro» o «gato»), el modelo aprende una función de distancia. Una arquitectura habitual para ello es la red neuronal siamesa, que consta de dos subredes idénticas que comparten los mismos pesos del modelo.
Durante su funcionamiento, la red realiza una extracción de características para convertir las imágenes de entrada en vectores numéricos compactos conocidos como embeddings. A continuación, el sistema compara el embedding de una nueva imagen de consulta con el embedding de la única «muestra» de referencia. Si la distancia matemática —calculada a menudo mediante la distancia euclídea o la similitud del coseno— está por debajo de un umbral determinado, se considera que las imágenes pertenecen a la misma clase. Esto permite al modelo verificar identidades o clasificar objetos basándose en su proximidad dentro del espacio de características aprendido.
El siguiente código de Python muestra cómo extraer embeddings y calcular la similitud mediante un modelo de clasificación YOLO26 del paquete ultralytics.
import numpy as np
from ultralytics import YOLO
# Load a pre-trained YOLO26 classification model for feature extraction
model = YOLO("yolo26n-cls.pt")
# Extract embeddings for a reference 'shot' and a query image
# The embed() method returns the feature vector directly
shot_vec = model.embed("reference_img.jpg")[0]
query_vec = model.embed("query_img.jpg")[0]
# Calculate similarity (higher dot product implies greater similarity)
similarity = np.dot(shot_vec, query_vec) / (np.linalg.norm(shot_vec) * np.linalg.norm(query_vec))
print(f"Similarity Score: {similarity:.4f}")Diferencias entre paradigmas relacionados#
Es importante diferenciar el aprendizaje con una sola muestra de otras técnicas de aprendizaje eficientes en cuanto a datos, ya que resuelven problemas similares con distintas limitaciones:
- Aprendizaje con pocos ejemplos (FSL): Esta es la categoría más amplia que engloba el aprendizaje con una sola muestra. En el aprendizaje con pocos ejemplos, el modelo recibe un pequeño «conjunto de soporte» de ejemplos, normalmente entre dos y cinco imágenes por clase. El aprendizaje con una sola muestra es simplemente el caso extremo en el que el tamaño del conjunto de soporte es exactamente uno.
- Aprendizaje sin ejemplos (ZSL): El aprendizaje sin ejemplos se ocupa de reconocer categorías que el modelo nunca ha visto visualmente. En lugar de una imagen de referencia, se basa en atributos semánticos o descripciones textuales (por ejemplo, identificar una «cebra» asociando características visuales con la descripción textual «caballo rayado») mediante el procesamiento del lenguaje natural (NLP).
- Aprendizaje por transferencia: Consiste en tomar un modelo preentrenado con una base de datos grande como ImageNet y ajustarlo para una tarea nueva. Aunque el aprendizaje por transferencia proporciona los extractores de características utilizados en el aprendizaje con una sola muestra, el aprendizaje por transferencia estándar normalmente requiere más de un ejemplo para actualizar los pesos de forma eficaz sin sobreajuste.
Aplicaciones en el mundo real#
El aprendizaje con una sola muestra ha desbloqueado capacidades en sectores en los que resulta poco práctico recopilar grandes cantidades de datos de entrenamiento.
Reconocimiento facial y seguridad#
La aplicación más extendida del aprendizaje con una sola muestra se encuentra en la seguridad biométrica. Al configurar Face ID en un smartphone o registrarse en un sistema de acceso para empleados, el dispositivo captura una única representación matemática del rostro del usuario. Durante el uso diario, el sistema de reconocimiento facial compara la señal de vídeo de la cámara en directo con esta «muestra única» almacenada para verificar la identidad. Esto depende de técnicas robustas de embeddings, como las descritas en la investigación fundamental de FaceNet, para garantizar que los cambios de iluminación o de ángulo no impidan encontrar una coincidencia de similitud.
Control de calidad industrial#
En la IA en la fabricación, resulta difícil crear un conjunto de datos equilibrado de piezas «defectuosas» porque los defectos son poco frecuentes e incoherentes. El aprendizaje con una sola muestra permite a los sistemas de visión artificial (CV) aprender la representación de una única pieza de referencia «perfecta». Cualquier elemento de la cadena de montaje cuyo embedding se encuentre significativamente alejado de esta referencia se marca para la detección de anomalías. Esto permite realizar un control de calidad inmediato sin necesitar miles de imágenes de piezas rotas, y se puede gestionar y desplegar mediante la Ultralytics Platform.
Retos y perspectivas de futuro#
Aunque es potente, el aprendizaje con una sola muestra es susceptible al ruido: si la única imagen de referencia está borrosa, obstruida o no es representativa, la capacidad del modelo para reconocer esa clase se degrada considerablemente. Los investigadores suelen emplear el metaaprendizaje, o «aprender a aprender», para mejorar la estabilidad y la generalización del modelo. A medida que evolucionan las arquitecturas, los modelos más recientes, como YOLO26, incorporan extractores de características más robustos que hacen que la inferencia con una sola muestra sea más rápida y precisa, allanando el camino hacia dispositivos de IA en el borde más adaptables e inteligentes.









