YOLO Vision 2026:
Volver al glosario de Ultralytics

Reinforcement Learning from Human Feedback (RLHF)

Aprende cómo el aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) alinea la IA con los valores humanos. Explora sus componentes principales y la integración con Ultralytics YOLO26.

El aprendizaje por refuerzo a partir de retroalimentación humana (RLHF, por sus siglas en inglés) es una técnica avanzada de aprendizaje automático que perfecciona los modelos de inteligencia artificial incorporando aportes humanos directos en el ciclo de entrenamiento. A diferencia del aprendizaje supervisado estándar, que depende únicamente de conjuntos de datos etiquetados estáticos, el RLHF introduce un mecanismo de dinamismo en la retroalimentación donde evaluadores humanos clasifican o puntúan las salidas del modelo. Este proceso permite que la IA capture objetivos complejos, subjetivos o matizados —como "utilidad", "seguridad" o "creatividad"— que son difíciles de definir con una función de pérdida matemática simple. El RLHF se ha convertido en un pilar fundamental en el desarrollo de modelos de lenguaje grandes (LLMs) modernos y de IA generativa, asegurando que los modelos base potentes se alineen eficazmente con los valores humanos y la intención del usuario.

Los componentes principales del RLHF#

El proceso de RLHF sigue generalmente un flujo de trabajo de tres pasos diseñado para cerrar la brecha entre las capacidades predictivas en bruto y el comportamiento alineado con las preferencias humanas.

  1. Ajuste fino supervisado (SFT): El flujo de trabajo suele comenzar con un modelo base preentrenado. Los desarrolladores realizan un ajuste fino inicial utilizando un conjunto de datos más pequeño y de alta calidad de demostraciones (por ejemplo, pares de preguntas y respuestas escritos por expertos). Este paso establece una política base, enseñando al modelo el formato general y el tono esperados para la tarea.

  2. Entrenamiento del modelo de recompensa: Esta fase es el rasgo distintivo del RLHF. Los anotadores humanos revisan múltiples salidas generadas por el modelo para la misma entrada y las clasifican de mejor a peor. Este esfuerzo de etiquetado de datos genera un conjunto de datos de preferencias. Una red neuronal independiente, llamada modelo de recompensa, se entrena con estos datos de comparación para predecir una puntuación escalar que refleje el juicio humano. Las herramientas disponibles en la Ultralytics Platform pueden optimizar la gestión de dichos flujos de trabajo de anotación.

  3. Optimización por aprendizaje por refuerzo: Por último, el modelo original actúa como un agente de IA dentro de un entorno de aprendizaje por refuerzo. Utilizando el modelo de recompensa como guía, los algoritmos de optimización como la optimización de políticas próxima (PPO) ajustan los parámetros del modelo para maximizar la recompensa esperada. Este paso alinea la política del modelo con las preferencias humanas aprendidas, fomentando comportamientos útiles y seguros a la vez que desalienta las salidas tóxicas o sin sentido.

Aplicaciones en el mundo real#

El RLHF ha demostrado ser crítico en el despliegue de sistemas de IA que requieren altos estándares de seguridad y una comprensión matizada de la interacción humana.

  • IA conversacional y chatbots: La aplicación más destacada del RLHF es alinear los chatbots para que sean útiles, inofensivos y honestos. Al penalizar las salidas que están sesgadas, son incorrectas de hecho o resultan peligrosas, el RLHF ayuda a mitigar la alucinación en LLMs y reduce el riesgo de sesgo algorítmico. Esto garantiza que los asistentes virtuales puedan rechazar instrucciones dañinas sin dejar de ser útiles para consultas legítimas.
  • Robótica y control físico: El RLHF se extiende más allá del texto a la IA en robótica, donde definir una función de recompensa perfecta para tareas físicas complejas resulta complicado. Por ejemplo, un robot que aprende a navegar por un almacén concurrido puede recibir comentarios de supervisores humanos sobre qué trayectorias eran seguras frente a las que causaron interrupciones. Esta retroalimentación perfecciona la política de control del robot de manera más eficaz que el simple aprendizaje por refuerzo profundo basado únicamente en la finalización de objetivos.

RLHF frente al aprendizaje por refuerzo estándar#

Resulta útil distinguir el RLHF del aprendizaje por refuerzo (RL) tradicional para comprender su utilidad específica.

  • RL estándar: En entornos tradicionales, la función de recompensa suele estar codificada de forma rígida por el entorno. Por ejemplo, en un videojuego, el entorno proporciona una señal clara (+1 por una victoria, -1 por una derrota). El agente optimiza sus acciones dentro de este proceso de decisión de Markov (MDP) definido.
  • RLHF: En muchos escenarios del mundo real, como escribir una historia creativa o conducir con cortesía, el "éxito" es subjetivo. El RLHF resuelve esto sustituyendo la recompensa codificada por un modelo de recompensa aprendido derivado de las preferencias humanas. Esto permite la optimización de conceptos abstractos como "calidad" o "idoneidad" que son imposibles de programar explícitamente.

Integración de la percepción con bucles de retroalimentación#

En aplicaciones visuales, los agentes alineados con RLHF suelen depender de la visión por computador (CV) para percibir el estado de su entorno antes de actuar. Un detector robusto, como YOLO26, funciona como la capa de percepción, proporcionando observaciones estructuradas (por ejemplo, "obstáculo detectado a 3 metros") que la red de políticas utiliza para seleccionar una acción.

El siguiente ejemplo de Python ilustra un concepto simplificado donde un modelo YOLO proporciona el estado ambiental. En un bucle de RLHF completo, la señal de "recompensa" provendría de un modelo entrenado con retroalimentación humana sobre las decisiones del agente basadas en estos datos de detección.

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

Al combinar potentes modelos de percepción con políticas refinadas mediante retroalimentación humana, los desarrolladores pueden construir sistemas que no solo son inteligentes, sino que también están rigurosamente alineados con los principios de seguridad de la IA. La investigación en curso sobre supervisión escalable, como la Constitutional AI, sigue haciendo evolucionar este campo, con el objetivo de reducir el cuello de botella de la anotación humana a gran escala manteniendo al mismo tiempo un alto rendimiento del modelo.

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático