Deep Reinforcement Learning
Explora el Aprendizaje por Refuerzo Profundo (DRL) y cómo combina la toma de decisiones por IA con el deep learning. Aprende a usar Ultralytics YOLO26 como una capa de percepción hoy mismo.
Deep Reinforcement Learning (DRL) es un subconjunto avanzado de artificial intelligence (AI) que combina las capacidades de toma de decisiones del reinforcement learning con el poder perceptual del deep learning (DL). Mientras que el aprendizaje por refuerzo tradicional se basa en métodos tabulares para mapear situaciones a acciones, estos métodos tienen dificultades cuando el entorno es complejo o visual. DRL supera esto utilizando neural networks para interpretar datos de entrada de alta dimensión, como fotogramas de video o lecturas de sensores, lo que permite a las máquinas aprender estrategias efectivas directamente de la experiencia en bruto sin instrucción humana explícita.
El mecanismo central del DRL#
En un sistema DRL, un AI agent interactúa con un entorno en pasos de tiempo discretos. En cada paso, el agente observa el "estado" actual, selecciona una acción basada en una política y recibe una señal de recompensa que indica el éxito o el fracaso de esa acción. El objetivo principal es maximizar la recompensa acumulativa a lo largo del tiempo.
El componente "profundo" (deep) se refiere al uso de redes neuronales profundas para aproximar la política (la estrategia para actuar) o la función de valor (la recompensa futura estimada). Esto le permite al agente procesar datos no estructurados, utilizando computer vision (CV) para "ver" el entorno de manera muy similar a como lo hace un humano. Esta capacidad está impulsada por frameworks como PyTorch o TensorFlow, que facilitan el entrenamiento de estas redes complejas.
Aplicaciones en el mundo real#
El DRL ha ido más allá de la investigación teórica hacia aplicaciones prácticas de alto impacto en diversos sectores:
- Robótica avanzada: En el campo de AI in robotics, DRL permite a las máquinas dominar habilidades motoras complejas que son difíciles de programar de forma rígida. Los robots pueden aprender a agarrar objetos irregulares o recorrer terrenos irregulares refinando sus movimientos dentro de motores de física como NVIDIA Isaac Sim. Esto a menudo implica entrenar con synthetic data antes de implementar la política en el hardware físico.
- Conducción autónoma: Los Autonomous vehicles aprovechan DRL para tomar decisiones en tiempo real en escenarios de tráfico impredecibles. Mientras que los modelos de object detection identifican peatones y señales, los algoritmos DRL utilizan esa información para determinar políticas de conducción seguras para la fusión de carriles, la navegación en intersecciones y el control de velocidad, gestionando eficazmente la inference latency requerida para la seguridad.
La visión como observador de estados#
Para muchas aplicaciones de DRL, el "estado" es visual. Los modelos de alta velocidad actúan como los ojos del agente, convirtiendo imágenes en bruto en datos estructurados sobre los cuales la red de políticas puede actuar. El siguiente ejemplo ilustra cómo el modelo YOLO26 sirve como la capa de percepción para un agente, extrayendo observaciones (por ejemplo, recuentos de obstáculos) del entorno.
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")Diferenciación del DRL de conceptos relacionados#
Es útil diferenciar el aprendizaje por refuerzo profundo de términos similares para entender su posición única en el panorama de la IA:
- Reinforcement Learning (RL): El RL estándar es el concepto fundamental, pero normalmente se basa en tablas de búsqueda (como las tablas Q) que se vuelven poco prácticas para espacios de estados grandes. DRL resuelve esto utilizando el aprendizaje profundo para aproximar funciones, lo que le permite manejar entradas complejas como imágenes.
- Reinforcement Learning from Human Feedback (RLHF): Mientras que DRL normalmente se optimiza para una función de recompensa definida matemáticamente (por ejemplo, puntos en un juego), RLHF refina los modelos—específicamente los Large Language Models (LLMs)—utilizando preferencias humanas subjetivas para alinear el comportamiento de la IA con los valores humanos, una técnica popularizada por grupos de investigación como OpenAI.
- Unsupervised Learning: Los métodos no supervisados buscan patrones ocultos en los datos sin retroalimentación explícita. Por el contrario, DRL está orientado a objetivos, impulsado por una señal de recompensa que guía activamente al agente hacia un objetivo específico, como se analiza en los textos fundamentales de Sutton and Barto.
Los desarrolladores que buscan gestionar los conjuntos de datos necesarios para las capas de percepción de los sistemas DRL pueden utilizar la Ultralytics Platform, que simplifica los flujos de trabajo de anotación y entrenamiento en la nube. Además, los investigadores suelen utilizar entornos estandarizados como Gymnasium para comparar sus algoritmos DRL con líneas base establecidas.






