Reinforcement Learning
Explora os conceitos fundamentais da aprendizagem por reforço (RL). Aprende como os agentes usam feedback para dominar tarefas e vê como o Ultralytics YOLO26 impulsiona sistemas de visão com RL.
A Aprendizagem por reforço (RL) é um subconjunto orientado para objetivos da aprendizagem automática (ML), no qual um sistema autónomo, conhecido como agente, aprende a tomar decisões executando ações e recebendo feedback do seu ambiente. Ao contrário da aprendizagem supervisionada, que depende de conjuntos de dados estáticos identificados com as respostas corretas, os algoritmos de RL aprendem através de um processo dinâmico de tentativa e erro. O agente interage com uma simulação ou com o mundo real, observando as consequências das suas ações para determinar quais as estratégias que geram as maiores recompensas a longo prazo. Esta abordagem imita de perto o conceito psicológico de condicionamento operante, no qual o comportamento é moldado por reforço positivo (recompensas) e reforço negativo (punições) ao longo do tempo.
Conceitos fundamentais do ciclo de RL#
Para compreender como funciona o RL, é útil visualizá-lo como um ciclo contínuo de interação. Este quadro é frequentemente formalizado matematicamente como um processo de decisão de Markov (MDP), que estrutura a tomada de decisões em situações onde os resultados são parcialmente aleatórios e parcialmente controlados pelo decisor.
Os principais componentes deste ciclo de aprendizagem incluem:
- Agente de IA: A entidade responsável pela aprendizagem e pela tomada de decisões. Percebe o ambiente e executa ações para maximizar o seu sucesso acumulado.
- Ambiente: O mundo externo onde o agente opera. Pode ser um videojogo complexo, uma simulação de mercado financeiro ou um armazém físico no contexto da IA na logística.
- Estado: Uma representação ou instantâneo da situação atual. Em aplicações visuais, isto envolve frequentemente o processamento de imagens de câmaras utilizando visão computacional (CV) para detetar objetos e obstáculos.
- Ação: O movimento ou escolha específica que o agente faz. O conjunto completo de todos os movimentos possíveis é designado por espaço de ações.
- Recompensa: Um sinal numérico enviado pelo ambiente ao agente após uma ação. Uma função de recompensa bem concebida atribui valores positivos a ações benéficas e penalizações a ações prejudiciais.
- Política: A estratégia ou conjunto de regras que o agente utiliza para determinar a ação seguinte com base no estado atual. Algoritmos como o Q-learning definem como esta política é atualizada e otimizada.
Aplicações no mundo real#
A aprendizagem por reforço ultrapassou a investigação teórica e chegou a implementações práticas e de elevado impacto em vários setores.
- Robótica avançada: No domínio da IA na robótica, o RL permite que as máquinas dominem competências motoras complexas que são difíceis de programar diretamente. Os robôs podem aprender a agarrar objetos irregulares ou a navegar por terrenos acidentados através de treino em motores de física como o NVIDIA Isaac Sim, antes da implementação no mundo real.
- Sistemas autónomos: Os veículos autónomos utilizam RL para tomar decisões em tempo real em situações de trânsito imprevisíveis. Enquanto os modelos de deteção de objetos identificam peões e sinais, os algoritmos de RL ajudam a determinar políticas de condução seguras para a mudança de faixa e a navegação em cruzamentos.
- Otimização estratégica: O RL ganhou atenção mundial quando sistemas como o AlphaGo da Google DeepMind derrotaram campeões mundiais humanos em jogos de tabuleiro complexos. Para além dos jogos, estes agentes otimizam a logística industrial, como o controlo dos sistemas de arrefecimento em centros de dados para reduzir o consumo de energia.
Integração da visão com RL#
Em muitas aplicações modernas, o "estado" que um agente observa é visual. Modelos de alto desempenho como o YOLO26 funcionam como a camada de perceção dos agentes de RL, convertendo imagens não processadas em dados estruturados. Estas informações processadas — como a localização e a classe dos objetos — tornam-se o estado que a política de RL utiliza para escolher uma ação.
O exemplo seguinte demonstra como utilizar o pacote ultralytics para processar um frame do ambiente, criando uma representação do estado (por exemplo, o número de objetos) para um ciclo de RL teórico.
from ultralytics import YOLO
# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")
# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Process the frame to extract the current 'state'
results = model(observation_frame)
# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")Diferenciação de Termos Relacionados#
É importante distinguir a Aprendizagem por reforço de outros paradigmas de aprendizagem automática:
- vs. Aprendizagem supervisionada: A aprendizagem supervisionada requer um supervisor externo experiente que forneça dados de treino identificados (por exemplo, "esta imagem contém um gato"). Em contrapartida, o RL aprende com as consequências das suas próprias ações sem identificadores explícitos, descobrindo caminhos ideais através da exploração.
- vs. Aprendizagem não supervisionada: A aprendizagem não supervisionada centra-se em encontrar estruturas ou padrões ocultos em dados não identificados (como agrupar clientes). O RL distingue-se por ser explicitamente orientado para objetivos, concentrando-se em maximizar um sinal de recompensa em vez de apenas descrever a estrutura dos dados.
À medida que o poder computacional aumenta, técnicas como a Aprendizagem por reforço a partir de feedback humano (RLHF) estão a aperfeiçoar ainda mais a forma como os agentes aprendem, alinhando os seus objetivos mais estreitamente com valores humanos complexos e normas de segurança. Os investigadores utilizam frequentemente ambientes padronizados como o Gymnasium para avaliar e melhorar estes algoritmos. Para as equipas que procuram gerir os conjuntos de dados necessários às camadas de perceção destes agentes, a Ultralytics Platform disponibiliza ferramentas abrangentes para anotação e gestão de modelos.









