Deep Reinforcement Learning
Explora el aprendizaje profundo por refuerzo (DRL) y cómo combina la toma de decisiones de la IA con el aprendizaje profundo. Aprende a usar Ultralytics YOLO26 como capa de percepción desde hoy.
El aprendizaje por refuerzo profundo (DRL) es un subconjunto avanzado de la inteligencia artificial (AI) que combina las capacidades de toma de decisiones del aprendizaje por refuerzo con la capacidad de percepción del aprendizaje profundo (DL). Mientras que el aprendizaje por refuerzo tradicional depende de métodos tabulares para asignar situaciones a acciones, estos métodos tienen dificultades cuando el entorno es complejo o visual. El DRL supera esta limitación mediante el uso de redes neuronales para interpretar datos de entrada de alta dimensionalidad, como fotogramas de vídeo o lecturas de sensores, lo que permite a las máquinas aprender estrategias eficaces directamente de la experiencia sin instrucciones humanas explícitas.
El mecanismo central del DRL#
En un sistema de DRL, un agente de AI interactúa con un entorno en pasos de tiempo discretos. En cada paso, el agente observa el «estado» actual, selecciona una acción basándose en una política y recibe una señal de recompensa que indica el éxito o el fracaso de dicha acción. El objetivo principal es maximizar la recompensa acumulada a lo largo del tiempo.
El componente «profundo» hace referencia al uso de redes neuronales profundas para aproximar la política (la estrategia para actuar) o la función de valor (la recompensa futura estimada). Esto permite al agente procesar datos no estructurados, utilizando la visión por computador (CV) para «ver» el entorno de forma similar a una persona. Esta capacidad se basa en frameworks como PyTorch o TensorFlow, que facilitan el entrenamiento de estas redes complejas.
Aplicaciones en el mundo real#
El DRL ha pasado de la investigación teórica a aplicaciones prácticas de gran impacto en diversos sectores:
- Robótica avanzada: En el ámbito de la AI en robótica, el DRL permite a las máquinas dominar habilidades motoras complejas que resultan difíciles de programar manualmente. Los robots pueden aprender a agarrar objetos irregulares o desplazarse por terrenos accidentados perfeccionando sus movimientos en motores de física como NVIDIA Isaac Sim. Esto suele implicar entrenar con datos sintéticos antes de desplegar la política en hardware físico.
- Conducción autónoma: Los vehículos autónomos utilizan DRL para tomar decisiones en tiempo real en situaciones de tráfico impredecibles. Mientras que los modelos de detección de objetos identifican peatones y señales, los algoritmos de DRL emplean esa información para determinar políticas de conducción seguras para incorporarse a un carril, atravesar intersecciones y controlar la velocidad, gestionando de forma eficaz la latencia de inferencia necesaria para la seguridad.
La visión como observador del estado#
En muchas aplicaciones de DRL, el «estado» es visual. Los modelos de alta velocidad actúan como los ojos del agente y convierten las imágenes sin procesar en datos estructurados sobre los que puede actuar la red de políticas. El siguiente ejemplo ilustra cómo el modelo YOLO26 sirve como capa de percepción de un agente y extrae observaciones (por ejemplo, el número de obstáculos) del entorno.
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")Diferencias entre el DRL y conceptos relacionados#
Para comprender la posición única del aprendizaje por refuerzo profundo en el panorama de la AI, resulta útil diferenciarlo de términos similares:
- Aprendizaje por refuerzo (RL): El RL estándar es el concepto fundamental, pero normalmente depende de tablas de consulta (como las tablas Q), que dejan de ser prácticas con espacios de estados grandes. El DRL resuelve este problema mediante el aprendizaje profundo para aproximar funciones, lo que le permite gestionar entradas complejas como imágenes.
- Aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF): Mientras que el DRL normalmente optimiza una función de recompensa definida matemáticamente (por ejemplo, los puntos de un juego), el RLHF perfecciona modelos —en concreto, grandes modelos de lenguaje (LLMs)— utilizando preferencias humanas subjetivas para alinear el comportamiento de la AI con los valores humanos, una técnica popularizada por grupos de investigación como OpenAI.
- Aprendizaje no supervisado: Los métodos no supervisados buscan patrones ocultos en los datos sin retroalimentación explícita. En cambio, el DRL está orientado a objetivos y se basa en una señal de recompensa que guía activamente al agente hacia un objetivo específico, como se explica en los textos fundamentales de Sutton y Barto.
Los desarrolladores que necesiten gestionar los conjuntos de datos requeridos por las capas de percepción de los sistemas de DRL pueden utilizar la Ultralytics Platform, que simplifica los flujos de trabajo de anotación y entrenamiento en la nube. Además, los investigadores suelen utilizar entornos estandarizados como Gymnasium para comparar sus algoritmos de DRL con líneas base consolidadas.









