Ultralytics YOLO27:
Volver al glosario de Ultralytics

Reinforcement Learning from Human Feedback (RLHF)

Aprende cómo el aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF) alinea la IA con los valores humanos. Explora sus componentes fundamentales y su integración con Ultralytics YOLO26.

El aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF) es una técnica avanzada de aprendizaje automático que perfecciona los modelos de inteligencia artificial incorporando la aportación directa de las personas en el ciclo de entrenamiento. A diferencia del aprendizaje supervisado estándar, que depende exclusivamente de conjuntos de datos etiquetados estáticos, RLHF introduce un mecanismo dinámico de retroalimentación en el que evaluadores humanos clasifican o puntúan las salidas del modelo. Este proceso permite a la IA captar objetivos complejos, subjetivos o sutiles —como «utilidad», «seguridad» o «creatividad»— que son difíciles de definir con una función de pérdida matemática sencilla. RLHF se ha convertido en un pilar fundamental del desarrollo de los modelos de lenguaje de gran tamaño (LLMs) modernos y de la IA generativa, ya que garantiza que los modelos fundacionales potentes se alineen eficazmente con los valores humanos y la intención de los usuarios.

Componentes principales de RLHF#

El proceso de RLHF suele seguir una canalización de tres pasos diseñada para cerrar la brecha entre las capacidades predictivas sin procesar y un comportamiento alineado con las personas.

  1. Ajuste fino supervisado (SFT): El flujo de trabajo suele comenzar con un modelo fundacional preentrenado. Los desarrolladores realizan un ajuste fino inicial utilizando un conjunto de datos más pequeño y de alta calidad compuesto por demostraciones (por ejemplo, pares de preguntas y respuestas redactados por expertos). Este paso establece una política de referencia y enseña al modelo el formato general y el tono esperados para la tarea.

  2. Entrenamiento del modelo de recompensa: Esta fase es el elemento distintivo de RLHF. Los anotadores humanos revisan varias salidas generadas por el modelo para la misma entrada y las clasifican de la mejor a la peor. Este trabajo de etiquetado de datos genera un conjunto de datos de preferencias. Se entrena una red neuronal independiente, denominada modelo de recompensa, con estos datos de comparación para predecir una puntuación escalar que refleje el criterio humano. Las herramientas disponibles en la plataforma de Ultralytics pueden agilizar la gestión de estos flujos de trabajo de anotación.

  3. Optimización mediante aprendizaje por refuerzo: Por último, el modelo original actúa como un agente de IA dentro de un entorno de aprendizaje por refuerzo. Utilizando el modelo de recompensa como guía, algoritmos de optimización como la optimización de la política proximal (PPO) ajustan los parámetros del modelo para maximizar la recompensa esperada. Este paso alinea la política del modelo con las preferencias humanas aprendidas, fomenta comportamientos útiles y seguros y desincentiva las salidas tóxicas o absurdas.

Aplicaciones en el mundo real#

RLHF ha demostrado ser fundamental para implementar sistemas de IA que requieren altos estándares de seguridad y una comprensión matizada de la interacción humana.

  • IA conversacional y chatbots: La aplicación más destacada de RLHF consiste en alinear los chatbots para que sean útiles, inofensivos y honestos. Al penalizar las salidas sesgadas, incorrectas desde el punto de vista factual o peligrosas, RLHF ayuda a mitigar las alucinaciones en los LLMs y reduce el riesgo de sesgo algorítmico. Esto garantiza que los asistentes virtuales puedan rechazar instrucciones perjudiciales y seguir siendo útiles para consultas legítimas.
  • Robótica y control físico: RLHF va más allá del texto y se extiende a la IA en robótica, donde definir una función de recompensa perfecta para tareas físicas complejas resulta difícil. Por ejemplo, un robot que aprende a desplazarse por un almacén abarrotado podría recibir comentarios de supervisores humanos sobre qué trayectorias eran seguras y cuáles provocaban interrupciones. Esta retroalimentación perfecciona la política de control del robot de forma más eficaz que el simple aprendizaje por refuerzo profundo basado únicamente en completar el objetivo.

RLHF frente al aprendizaje por refuerzo estándar#

Para comprender su utilidad específica, resulta útil distinguir RLHF del aprendizaje por refuerzo (RL) tradicional.

  • RL estándar: En los entornos tradicionales, la función de recompensa suele estar codificada de forma fija por el entorno. Por ejemplo, en un videojuego, el entorno proporciona una señal clara (+1 por ganar, -1 por perder). El agente optimiza sus acciones dentro de este proceso de decisión de Markov (MDP) definido.
  • RLHF: En muchos escenarios del mundo real, como escribir una historia creativa o conducir con cortesía, el «éxito» es subjetivo. RLHF resuelve este problema sustituyendo la recompensa codificada de forma fija por un modelo de recompensa aprendido a partir de las preferencias humanas. Esto permite optimizar conceptos abstractos como la «calidad» o la «adecuación», que no se pueden programar explícitamente.

Integración de la percepción con los ciclos de retroalimentación#

En las aplicaciones visuales, los agentes alineados mediante RLHF suelen depender de la visión por ordenador (CV) para percibir el estado de su entorno antes de actuar. Un detector robusto, como YOLO26, funciona como capa de percepción y proporciona observaciones estructuradas (por ejemplo, «obstáculo detectado a 3 metros») que la red de políticas utiliza para seleccionar una acción.

El siguiente ejemplo de Python ilustra un concepto simplificado en el que un modelo YOLO proporciona el estado del entorno. En un ciclo completo de RLHF, la señal de «recompensa» procedería de un modelo entrenado con comentarios humanos sobre las decisiones del agente basadas en estos datos de detección.

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

Al combinar potentes modelos de percepción con políticas perfeccionadas mediante la retroalimentación humana, los desarrolladores pueden crear sistemas que no solo sean inteligentes, sino que también estén rigurosamente alineados con los principios de la seguridad de la IA. La investigación en curso sobre la supervisión escalable, como la IA constitucional, sigue haciendo avanzar este campo con el objetivo de reducir el cuello de botella de la anotación humana a gran escala y mantener al mismo tiempo un alto rendimiento del modelo.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático