Learning Rate
Aprende cómo la tasa de aprendizaje afecta el entrenamiento del modelo. Descubre cómo optimizar el tamaño del paso para Ultralytics YOLO26 a fin de lograr un rendimiento SOTA en detección de objetos y más.
La tasa de aprendizaje es una configuración crítica de hyperparameter tuning que determina el tamaño de paso que da un modelo durante el proceso de optimización. En el contexto del entrenamiento de una red neuronal, controla cuánto se actualizan los pesos internos del modelo en respuesta al error estimado cada vez que el modelo procesa un lote de datos. Piénsalo como una persona que baja caminando por una montaña hacia un valle (el punto más bajo de error); la tasa de aprendizaje dicta la longitud de su zancada. Si la zancada es demasiado grande, podría pasar por alto el valle por completo y perder el fondo. Si la zancada es demasiado pequeña, llegar al destino podría llevar un tiempo impracticable.
El dilema de "Ricitos de Oro" en la optimización#
Encontrar la tasa de aprendizaje óptima se describe a menudo como un acto de equilibrio dentro de los flujos de trabajo de machine learning. El objetivo es minimizar la loss function, que mide la diferencia entre las predicciones del modelo y la verdad de terreno real. Este proceso depende en gran medida de un optimization algorithm como stochastic gradient descent (SGD) o el Adam optimizer para navegar por el panorama de pérdidas.
- Tasa de aprendizaje demasiado alta: Si el valor se establece demasiado alto, las actualizaciones de los pesos del modelo serán drásticas. Esto puede llevar al fenómeno de "sobrerrecorrido" (overshooting), donde el modelo no converge en una solución y en su lugar oscila violentamente o diverge. Esta inestabilidad a veces puede desencadenar un problema de exploding gradient, haciendo que el proceso de entrenamiento sea inútil.
- Tasa de aprendizaje demasiado baja: Por el contrario, un tamaño de paso extremadamente pequeño asegura que el modelo se mueva con cuidado hacia el mínimo, pero puede resultar en underfitting porque el proceso de entrenamiento se vuelve dolorosamente lento. El modelo podría quedarse atascado en un mínimo local o requerir miles de epochs adicionales para aprender patrones simples, desperdiciando recursos computacionales. Los investigadores suelen consultar la PyTorch documentation on optimization para entender cómo interactúan los diferentes algoritmos con estos valores.
Aplicaciones en el mundo real#
El impacto de los ajustes en la tasa de aprendizaje es evidente en varias industrias de alto riesgo donde se despliegan computer vision tasks.
-
Sistemas de conducción autónoma: En el desarrollo de autonomous vehicles, los ingenieros utilizan vastos conjuntos de datos para entrenar modelos de object detection con el fin de identificar peatones y señales de tráfico. Al aplicar transfer learning a un modelo preentrenado como YOLO26, los desarrolladores suelen utilizar una tasa de aprendizaje mucho menor que la que usarían durante el entrenamiento inicial. Este "fine-tuning" asegura que el modelo aprenda los matices de entornos de conducción específicos (por ejemplo, carreteras nevadas frente a autopistas desérticas) sin borrar las capacidades generales de extracción de características que ya posee.
-
Imágenes de diagnóstico médico: En el medical image analysis, como la detección de tumores en resonancias magnéticas, la precisión es primordial. Una tasa de aprendizaje alta aquí crea el riesgo de que el modelo pase por alto las sutiles diferencias de textura que distinguen el tejido maligno del benigno. Los profesionales suelen emplear una técnica llamada "calentamiento de la tasa de aprendizaje" (learning rate warmup), aumentando gradualmente la tasa desde cero hasta un valor objetivo para estabilizar las primeras etapas del entrenamiento, asegurando que los pesos de la neural network se asienten en una configuración estable antes de que comience el aprendizaje agresivo. Puedes leer más sobre estas estrategias en el Google Machine Learning Crash Course.
Diferenciación de términos relacionados#
Es importante distinguir la tasa de aprendizaje de otros parámetros de entrenamiento, ya que a menudo se configuran en los mismos archivos de configuración pero cumplen propósitos diferentes:
- Tasa de aprendizaje frente a tamaño de lote: Mientras que la tasa de aprendizaje controla la magnitud de la actualización, el batch size determina el número de muestras de entrenamiento procesadas antes de que ocurra una actualización. Existe una fuerte relación entre ambos; a menudo, al aumentar el tamaño del lote, también hay que escalar la tasa de aprendizaje para mantener la eficiencia del entrenamiento, un concepto explorado en artículos sobre large-batch training.
- Tasa de aprendizaje frente a decaimiento: El decaimiento (decay) se refiere a una estrategia en la que la tasa de aprendizaje se reduce sistemáticamente con el tiempo. Un programador de tareas (scheduler) puede reducir la tasa en un factor de 10 cada 30 epochs. Esto ayuda a que el modelo realice grandes saltos conceptuales al principio y luego refine su precisión con pasos más pequeños hacia el final del entrenamiento. Esta es una característica estándar en el Ultralytics Python package.
Configurar la tasa de aprendizaje en Ultralytics YOLO#
Cuando utilizas marcos modernos, puedes ajustar fácilmente la tasa de aprendizaje inicial (lr0) y la fracción de la tasa de aprendizaje final (lrf). A continuación se muestra un ejemplo de cómo configurar esto utilizando el cliente compatible con la Ultralytics Platform para una ejecución de entrenamiento personalizada.
from ultralytics import YOLO
# Load the YOLO26 model (latest state-of-the-art architecture)
model = YOLO("yolo26n.pt")
# Train the model with a custom initial learning rate
# lr0=0.01 sets the initial rate
# lrf=0.01 sets the final learning rate to (lr0 * lrf)
results = model.train(data="coco8.yaml", epochs=10, lr0=0.01, lrf=0.01)Para usuarios avanzados, técnicas como el LR Finder (popularizado por fast.ai) pueden automatizar esencialmente el descubrimiento del mejor valor inicial ejecutando una breve época de prueba donde la tasa se incrementa exponencialmente hasta que la pérdida diverge. Dominar este hiperparámetro suele ser la clave para desbloquear un rendimiento SOTA (State-of-the-Art) en tus proyectos de IA.






