Reinforcement Learning from Human Feedback (RLHF)
Aprende cómo el aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF) alinea la IA con los valores humanos. Explora sus componentes fundamentales y su integración con Ultralytics YOLO26.
El aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF) es una técnica avanzada de aprendizaje automático que perfecciona los modelos de inteligencia artificial incorporando la aportación directa de las personas en el ciclo de entrenamiento. A diferencia del aprendizaje supervisado estándar, que depende exclusivamente de conjuntos de datos etiquetados estáticos, RLHF introduce un mecanismo dinámico de retroalimentación en el que evaluadores humanos clasifican o puntúan las salidas del modelo. Este proceso permite a la IA captar objetivos complejos, subjetivos o sutiles —como «utilidad», «seguridad» o «creatividad»— que son difíciles de definir con una función de pérdida matemática sencilla. RLHF se ha convertido en un pilar fundamental del desarrollo de los modelos de lenguaje de gran tamaño (LLMs) modernos y de la IA generativa, ya que garantiza que los modelos fundacionales potentes se alineen eficazmente con los valores humanos y la intención de los usuarios.
Componentes principales de RLHF#
El proceso de RLHF suele seguir una canalización de tres pasos diseñada para cerrar la brecha entre las capacidades predictivas sin procesar y un comportamiento alineado con las personas.
-
Ajuste fino supervisado (SFT): El flujo de trabajo suele comenzar con un modelo fundacional preentrenado. Los desarrolladores realizan un ajuste fino inicial utilizando un conjunto de datos más pequeño y de alta calidad compuesto por demostraciones (por ejemplo, pares de preguntas y respuestas redactados por expertos). Este paso establece una política de referencia y enseña al modelo el formato general y el tono esperados para la tarea.
-
Entrenamiento del modelo de recompensa: Esta fase es el elemento distintivo de RLHF. Los anotadores humanos revisan varias salidas generadas por el modelo para la misma entrada y las clasifican de la mejor a la peor. Este trabajo de etiquetado de datos genera un conjunto de datos de preferencias. Se entrena una red neuronal independiente, denominada modelo de recompensa, con estos datos de comparación para predecir una puntuación escalar que refleje el criterio humano. Las herramientas disponibles en la plataforma de Ultralytics pueden agilizar la gestión de estos flujos de trabajo de anotación.
-
Optimización mediante aprendizaje por refuerzo: Por último, el modelo original actúa como un agente de IA dentro de un entorno de aprendizaje por refuerzo. Utilizando el modelo de recompensa como guía, algoritmos de optimización como la optimización de la política proximal (PPO) ajustan los parámetros del modelo para maximizar la recompensa esperada. Este paso alinea la política del modelo con las preferencias humanas aprendidas, fomenta comportamientos útiles y seguros y desincentiva las salidas tóxicas o absurdas.
Aplicaciones en el mundo real#
RLHF ha demostrado ser fundamental para implementar sistemas de IA que requieren altos estándares de seguridad y una comprensión matizada de la interacción humana.
- IA conversacional y chatbots: La aplicación más destacada de RLHF consiste en alinear los chatbots para que sean útiles, inofensivos y honestos. Al penalizar las salidas sesgadas, incorrectas desde el punto de vista factual o peligrosas, RLHF ayuda a mitigar las alucinaciones en los LLMs y reduce el riesgo de sesgo algorítmico. Esto garantiza que los asistentes virtuales puedan rechazar instrucciones perjudiciales y seguir siendo útiles para consultas legítimas.
- Robótica y control físico: RLHF va más allá del texto y se extiende a la IA en robótica, donde definir una función de recompensa perfecta para tareas físicas complejas resulta difícil. Por ejemplo, un robot que aprende a desplazarse por un almacén abarrotado podría recibir comentarios de supervisores humanos sobre qué trayectorias eran seguras y cuáles provocaban interrupciones. Esta retroalimentación perfecciona la política de control del robot de forma más eficaz que el simple aprendizaje por refuerzo profundo basado únicamente en completar el objetivo.
RLHF frente al aprendizaje por refuerzo estándar#
Para comprender su utilidad específica, resulta útil distinguir RLHF del aprendizaje por refuerzo (RL) tradicional.
- RL estándar: En los entornos tradicionales, la función de recompensa suele estar codificada de forma fija por el entorno. Por ejemplo, en un videojuego, el entorno proporciona una señal clara (+1 por ganar, -1 por perder). El agente optimiza sus acciones dentro de este proceso de decisión de Markov (MDP) definido.
- RLHF: En muchos escenarios del mundo real, como escribir una historia creativa o conducir con cortesía, el «éxito» es subjetivo. RLHF resuelve este problema sustituyendo la recompensa codificada de forma fija por un modelo de recompensa aprendido a partir de las preferencias humanas. Esto permite optimizar conceptos abstractos como la «calidad» o la «adecuación», que no se pueden programar explícitamente.
Integración de la percepción con los ciclos de retroalimentación#
En las aplicaciones visuales, los agentes alineados mediante RLHF suelen depender de la visión por ordenador (CV) para percibir el estado de su entorno antes de actuar. Un detector robusto, como YOLO26, funciona como capa de percepción y proporciona observaciones estructuradas (por ejemplo, «obstáculo detectado a 3 metros») que la red de políticas utiliza para seleccionar una acción.
El siguiente ejemplo de Python ilustra un concepto simplificado en el que un modelo YOLO proporciona el estado del entorno. En un ciclo completo de RLHF, la señal de «recompensa» procedería de un modelo entrenado con comentarios humanos sobre las decisiones del agente basadas en estos datos de detección.
from ultralytics import YOLO
# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")
# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")
# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)
print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.Al combinar potentes modelos de percepción con políticas perfeccionadas mediante la retroalimentación humana, los desarrolladores pueden crear sistemas que no solo sean inteligentes, sino que también estén rigurosamente alineados con los principios de la seguridad de la IA. La investigación en curso sobre la supervisión escalable, como la IA constitucional, sigue haciendo avanzar este campo con el objetivo de reducir el cuello de botella de la anotación humana a gran escala y mantener al mismo tiempo un alto rendimiento del modelo.









