YOLO Vision 2026:
Volver al glosario de Ultralytics

Deep Reinforcement Learning

Explora el Aprendizaje por Refuerzo Profundo (DRL) y cómo combina la toma de decisiones por IA con el deep learning. Aprende a usar Ultralytics YOLO26 como una capa de percepción hoy mismo.

Deep Reinforcement Learning (DRL) es un subconjunto avanzado de artificial intelligence (AI) que combina las capacidades de toma de decisiones del reinforcement learning con el poder perceptual del deep learning (DL). Mientras que el aprendizaje por refuerzo tradicional se basa en métodos tabulares para mapear situaciones a acciones, estos métodos tienen dificultades cuando el entorno es complejo o visual. DRL supera esto utilizando neural networks para interpretar datos de entrada de alta dimensión, como fotogramas de video o lecturas de sensores, lo que permite a las máquinas aprender estrategias efectivas directamente de la experiencia en bruto sin instrucción humana explícita.

El mecanismo central del DRL#

En un sistema DRL, un AI agent interactúa con un entorno en pasos de tiempo discretos. En cada paso, el agente observa el "estado" actual, selecciona una acción basada en una política y recibe una señal de recompensa que indica el éxito o el fracaso de esa acción. El objetivo principal es maximizar la recompensa acumulativa a lo largo del tiempo.

El componente "profundo" (deep) se refiere al uso de redes neuronales profundas para aproximar la política (la estrategia para actuar) o la función de valor (la recompensa futura estimada). Esto le permite al agente procesar datos no estructurados, utilizando computer vision (CV) para "ver" el entorno de manera muy similar a como lo hace un humano. Esta capacidad está impulsada por frameworks como PyTorch o TensorFlow, que facilitan el entrenamiento de estas redes complejas.

Aplicaciones en el mundo real#

El DRL ha ido más allá de la investigación teórica hacia aplicaciones prácticas de alto impacto en diversos sectores:

  • Robótica avanzada: En el campo de AI in robotics, DRL permite a las máquinas dominar habilidades motoras complejas que son difíciles de programar de forma rígida. Los robots pueden aprender a agarrar objetos irregulares o recorrer terrenos irregulares refinando sus movimientos dentro de motores de física como NVIDIA Isaac Sim. Esto a menudo implica entrenar con synthetic data antes de implementar la política en el hardware físico.
  • Conducción autónoma: Los Autonomous vehicles aprovechan DRL para tomar decisiones en tiempo real en escenarios de tráfico impredecibles. Mientras que los modelos de object detection identifican peatones y señales, los algoritmos DRL utilizan esa información para determinar políticas de conducción seguras para la fusión de carriles, la navegación en intersecciones y el control de velocidad, gestionando eficazmente la inference latency requerida para la seguridad.

La visión como observador de estados#

Para muchas aplicaciones de DRL, el "estado" es visual. Los modelos de alta velocidad actúan como los ojos del agente, convirtiendo imágenes en bruto en datos estructurados sobre los cuales la red de políticas puede actuar. El siguiente ejemplo ilustra cómo el modelo YOLO26 sirve como la capa de percepción para un agente, extrayendo observaciones (por ejemplo, recuentos de obstáculos) del entorno.

from ultralytics import YOLO

# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")

# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Perform inference to extract the state (detected objects)
results = model(observation_frame)

# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")

Diferenciación del DRL de conceptos relacionados#

Es útil diferenciar el aprendizaje por refuerzo profundo de términos similares para entender su posición única en el panorama de la IA:

  • Reinforcement Learning (RL): El RL estándar es el concepto fundamental, pero normalmente se basa en tablas de búsqueda (como las tablas Q) que se vuelven poco prácticas para espacios de estados grandes. DRL resuelve esto utilizando el aprendizaje profundo para aproximar funciones, lo que le permite manejar entradas complejas como imágenes.
  • Reinforcement Learning from Human Feedback (RLHF): Mientras que DRL normalmente se optimiza para una función de recompensa definida matemáticamente (por ejemplo, puntos en un juego), RLHF refina los modelos—específicamente los Large Language Models (LLMs)—utilizando preferencias humanas subjetivas para alinear el comportamiento de la IA con los valores humanos, una técnica popularizada por grupos de investigación como OpenAI.
  • Unsupervised Learning: Los métodos no supervisados buscan patrones ocultos en los datos sin retroalimentación explícita. Por el contrario, DRL está orientado a objetivos, impulsado por una señal de recompensa que guía activamente al agente hacia un objetivo específico, como se analiza en los textos fundamentales de Sutton and Barto.

Los desarrolladores que buscan gestionar los conjuntos de datos necesarios para las capas de percepción de los sistemas DRL pueden utilizar la Ultralytics Platform, que simplifica los flujos de trabajo de anotación y entrenamiento en la nube. Además, los investigadores suelen utilizar entornos estandarizados como Gymnasium para comparar sus algoritmos DRL con líneas base establecidas.

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático