Deep Reinforcement Learning
Explora a aprendizagem profunda por reforço (DRL) e como combina a tomada de decisões da IA com a aprendizagem profunda. Aprende a utilizar hoje o Ultralytics YOLO26 como camada de perceção.
A Aprendizagem por Reforço Profundo (DRL) é um subconjunto avançado da inteligência artificial (AI) que combina as capacidades de tomada de decisão da aprendizagem por reforço com o poder percetivo da aprendizagem profunda (DL). Enquanto a aprendizagem por reforço tradicional depende de métodos tabulares para mapear situações para ações, estes métodos têm dificuldades quando o ambiente é complexo ou visual. A DRL ultrapassa esta limitação utilizando redes neuronais para interpretar dados de entrada de alta dimensionalidade, como fotogramas de vídeo ou leituras de sensores, permitindo que as máquinas aprendam estratégias eficazes diretamente a partir da experiência em bruto, sem instruções humanas explícitas.
O Mecanismo Central da DRL#
Num sistema de DRL, um agente de AI interage com um ambiente em passos de tempo discretos. Em cada passo, o agente observa o "estado" atual, seleciona uma ação com base numa política e recebe um sinal de recompensa que indica o sucesso ou insucesso dessa ação. O objetivo principal é maximizar a recompensa cumulativa ao longo do tempo.
O componente "profundo" refere-se à utilização de redes neuronais profundas para aproximar a política (a estratégia de atuação) ou a função de valor (a recompensa futura estimada). Isto permite ao agente processar dados não estruturados, utilizando visão computacional (CV) para "ver" o ambiente de forma semelhante a um ser humano. Esta capacidade é viabilizada por frameworks como PyTorch ou TensorFlow, que facilitam o treino destas redes complexas.
Aplicações no mundo real#
A DRL ultrapassou a investigação teórica e chegou a aplicações práticas de grande impacto em vários setores:
- Robótica Avançada: No campo da AI na robótica, a DRL permite que as máquinas dominem competências motoras complexas que são difíceis de programar manualmente. Os robôs podem aprender a agarrar objetos irregulares ou a atravessar terrenos acidentados, aperfeiçoando os seus movimentos em motores de física como o NVIDIA Isaac Sim. Isto envolve frequentemente o treino com dados sintéticos antes de implementar a política no hardware físico.
- Condução Autónoma: Os veículos autónomos utilizam DRL para tomar decisões em tempo real em cenários de trânsito imprevisíveis. Enquanto os modelos de deteção de objetos identificam peões e sinais, os algoritmos de DRL utilizam essa informação para determinar políticas de condução seguras para mudanças de faixa, navegação em interseções e controlo da velocidade, gerindo eficazmente a latência de inferência necessária para a segurança.
A Visão como Observador do Estado#
Em muitas aplicações de DRL, o "estado" é visual. Os modelos de alta velocidade funcionam como os olhos do agente, convertendo imagens em bruto em dados estruturados sobre os quais a rede de políticas pode atuar. O exemplo seguinte ilustra como o modelo YOLO26 funciona como camada de perceção de um agente, extraindo observações (por exemplo, contagens de obstáculos) do ambiente.
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")Distinção entre a DRL e Conceitos Relacionados#
É útil distinguir a Aprendizagem por Reforço Profundo de termos semelhantes para compreender a sua posição única no panorama da AI:
- Aprendizagem por Reforço (RL): A RL padrão é o conceito fundamental, mas normalmente depende de tabelas de consulta (como tabelas Q), que se tornam impraticáveis para espaços de estados grandes. A DRL resolve este problema utilizando aprendizagem profunda para aproximar funções, permitindo-lhe lidar com entradas complexas, como imagens.
- Aprendizagem por Reforço a partir de Feedback Humano (RLHF): Enquanto a DRL normalmente otimiza uma função de recompensa definida matematicamente (por exemplo, pontos num jogo), a RLHF aperfeiçoa modelos — especificamente Grandes Modelos de Linguagem (LLMs) — utilizando preferências humanas subjetivas para alinhar o comportamento da AI com os valores humanos, uma técnica popularizada por grupos de investigação como a OpenAI.
- Aprendizagem Não Supervisionada: Os métodos não supervisionados procuram padrões ocultos nos dados sem feedback explícito. Em contraste, a DRL é orientada para objetivos, sendo impulsionada por um sinal de recompensa que orienta ativamente o agente em direção a um objetivo específico, conforme discutido nas obras fundamentais de Sutton e Barto.
Os programadores que pretendam gerir os conjuntos de dados necessários para as camadas de perceção dos sistemas de DRL podem utilizar a Ultralytics Platform, que simplifica os fluxos de trabalho de anotação e treino na cloud. Além disso, os investigadores utilizam frequentemente ambientes padronizados, como o Gymnasium, para comparar os seus algoritmos de DRL com referências estabelecidas.









