Model Weights
Descubre cómo los pesos de los modelos representan el conocimiento de la IA. Explora cómo Ultralytics YOLO26 utiliza pesos optimizados para entrenar e inferir de forma más rápida y precisa.
Los pesos del modelo son los parámetros ajustables dentro de un modelo de machine learning que transforman los datos de entrada en resultados predichos. En una red neuronal, estos pesos representan la fuerza de las conexiones entre las neuronas de distintas capas. Cuando se inicializa un modelo, estos pesos suelen establecerse en valores pequeños y aleatorios, lo que significa que el modelo no «sabe» nada. Mediante un proceso llamado entrenamiento, el modelo ajusta iterativamente estos pesos en función de los errores que comete y aprende gradualmente a reconocer patrones, características y relaciones en los datos. Puedes pensar en los pesos del modelo como la «memoria» o el «conocimiento» de la IA; almacenan lo que el sistema ha aprendido de sus datos de entrenamiento.
El papel de los pesos en el aprendizaje#
El objetivo principal de entrenar una red neuronal es encontrar el conjunto óptimo de pesos del modelo que minimice el error entre las predicciones del modelo y los valores reales. Este proceso consiste en pasar los datos por la red —un paso conocido como propagación hacia delante— y calcular después un valor de pérdida mediante una función de pérdida específica. Si la predicción es incorrecta, un algoritmo de optimización como el descenso de gradiente estocástico (SGD) o el optimizador Muon más reciente, utilizado en YOLO26, calcula cuánto ha contribuido cada peso al error.
Mediante una técnica llamada retropropagación, el algoritmo actualiza ligeramente los pesos para reducir el error la próxima vez. Este ciclo se repite miles o millones de veces hasta que los pesos del modelo se estabilizan y el sistema alcanza una gran precisión. Una vez completado el entrenamiento, los pesos se «congelan» y se guardan, lo que permite desplegar el modelo para realizar inferencias con datos nuevos que no haya visto.
Pesos del modelo frente a sesgos#
Es importante distinguir entre los pesos y los sesgos, ya que trabajan conjuntamente, pero cumplen funciones distintas. Mientras que los pesos del modelo determinan la fuerza y la dirección de la conexión entre las neuronas (controlando la pendiente de la activación), los sesgos permiten desplazar la función de activación hacia la izquierda o hacia la derecha. Este desplazamiento garantiza que el modelo pueda ajustarse mejor a los datos, incluso cuando todas las características de entrada son cero. En conjunto, los pesos y los sesgos forman los parámetros ajustables que definen el comportamiento de arquitecturas como las redes neuronales convolucionales (CNNs).
Aplicaciones en el mundo real#
Los pesos del modelo son el componente fundamental que permite a los sistemas de IA funcionar en diversos sectores. Estos son dos ejemplos concretos de cómo se aplican:
- Visión artificial en el comercio minorista: En un sistema de supermercado inteligente, un modelo como YOLO26 utiliza sus pesos entrenados para identificar productos en una estantería. Los pesos han «aprendido» características visuales, como la forma de una caja de cereales o el color de una lata de refresco, lo que permite al sistema detectar artículos, gestionar el inventario e incluso facilitar eficazmente los procesos de pago automatizado.
- Análisis de imágenes médicas: En el ámbito sanitario, los modelos de deep learning utilizan pesos especializados para analizar radiografías o imágenes de resonancia magnética. Por ejemplo, un modelo entrenado para la detección de tumores utiliza sus pesos para distinguir entre tejido sano y posibles anomalías. Estos pesos capturan patrones complejos y no lineales en los datos de píxeles que pueden resultar sutiles para el ojo humano, lo que ayuda a los radiólogos a realizar diagnósticos más rápidos.
Guardar y cargar pesos#
En la práctica, trabajar con pesos del modelo implica guardar los parámetros entrenados en un archivo y cargarlos posteriormente para realizar predicciones o ajustes finos. En el ecosistema de Ultralytics, normalmente se almacenan como archivos .pt (PyTorch).
Este es un ejemplo sencillo de cómo cargar pesos preentrenados en un modelo YOLO y ejecutar una predicción:
from ultralytics import YOLO
# Load a model with pre-trained weights (e.g., YOLO26n)
model = YOLO("yolo26n.pt")
# Run inference on an image using the loaded weights
results = model("https://ultralytics.com/images/bus.jpg")
# Print the number of detected objects
print(f"Detected {len(results[0].boxes)} objects.")Aprendizaje por transferencia y ajuste fino#
Uno de los aspectos más potentes de los pesos del modelo es su portabilidad. En lugar de entrenar un modelo desde cero —lo que requiere conjuntos de datos enormes y una capacidad de cálculo considerable—, los desarrolladores suelen utilizar el aprendizaje por transferencia. Esto consiste en tomar un modelo con pesos preentrenados en un conjunto de datos grande, como COCO o ImageNet, y adaptarlo a una tarea específica.
Por ejemplo, puedes tomar los pesos de un detector de objetos general y aplicarles un ajuste fino con un conjunto de datos más pequeño de paneles solares. Como los pesos preentrenados ya entienden los bordes, las formas y las texturas, el modelo converge mucho más rápido y necesita menos datos etiquetados. Herramientas como la plataforma de Ultralytics simplifican este proceso y permiten a los equipos gestionar conjuntos de datos, entrenar modelos en la nube y desplegar pesos optimizados en dispositivos periféricos sin complicaciones.
Compresión y optimización#
La investigación moderna en IA suele centrarse en reducir el tamaño de archivo de los pesos del modelo sin sacrificar el rendimiento, un proceso conocido como cuantización del modelo. Al reducir la precisión de los pesos (por ejemplo, de coma flotante de 32 bits a enteros de 8 bits), los desarrolladores pueden disminuir considerablemente el uso de memoria y mejorar la velocidad de inferencia. Esto es fundamental para desplegar modelos en hardware con recursos limitados, como teléfonos móviles o dispositivos Raspberry Pi. Además, técnicas como la poda eliminan los pesos que contribuyen poco al resultado, lo que optimiza aún más el modelo para aplicaciones en tiempo real.









