Ultralytics YOLO27:
Voltar ao Glossário da Ultralytics

Reinforcement Learning

Explora os conceitos fundamentais da aprendizagem por reforço (RL). Aprende como os agentes usam feedback para dominar tarefas e vê como o Ultralytics YOLO26 impulsiona sistemas de visão com RL.

A Aprendizagem por reforço (RL) é um subconjunto orientado para objetivos da aprendizagem automática (ML), no qual um sistema autónomo, conhecido como agente, aprende a tomar decisões executando ações e recebendo feedback do seu ambiente. Ao contrário da aprendizagem supervisionada, que depende de conjuntos de dados estáticos identificados com as respostas corretas, os algoritmos de RL aprendem através de um processo dinâmico de tentativa e erro. O agente interage com uma simulação ou com o mundo real, observando as consequências das suas ações para determinar quais as estratégias que geram as maiores recompensas a longo prazo. Esta abordagem imita de perto o conceito psicológico de condicionamento operante, no qual o comportamento é moldado por reforço positivo (recompensas) e reforço negativo (punições) ao longo do tempo.

Conceitos fundamentais do ciclo de RL#

Para compreender como funciona o RL, é útil visualizá-lo como um ciclo contínuo de interação. Este quadro é frequentemente formalizado matematicamente como um processo de decisão de Markov (MDP), que estrutura a tomada de decisões em situações onde os resultados são parcialmente aleatórios e parcialmente controlados pelo decisor.

Os principais componentes deste ciclo de aprendizagem incluem:

  • Agente de IA: A entidade responsável pela aprendizagem e pela tomada de decisões. Percebe o ambiente e executa ações para maximizar o seu sucesso acumulado.
  • Ambiente: O mundo externo onde o agente opera. Pode ser um videojogo complexo, uma simulação de mercado financeiro ou um armazém físico no contexto da IA na logística.
  • Estado: Uma representação ou instantâneo da situação atual. Em aplicações visuais, isto envolve frequentemente o processamento de imagens de câmaras utilizando visão computacional (CV) para detetar objetos e obstáculos.
  • Ação: O movimento ou escolha específica que o agente faz. O conjunto completo de todos os movimentos possíveis é designado por espaço de ações.
  • Recompensa: Um sinal numérico enviado pelo ambiente ao agente após uma ação. Uma função de recompensa bem concebida atribui valores positivos a ações benéficas e penalizações a ações prejudiciais.
  • Política: A estratégia ou conjunto de regras que o agente utiliza para determinar a ação seguinte com base no estado atual. Algoritmos como o Q-learning definem como esta política é atualizada e otimizada.

Aplicações no mundo real#

A aprendizagem por reforço ultrapassou a investigação teórica e chegou a implementações práticas e de elevado impacto em vários setores.

  • Robótica avançada: No domínio da IA na robótica, o RL permite que as máquinas dominem competências motoras complexas que são difíceis de programar diretamente. Os robôs podem aprender a agarrar objetos irregulares ou a navegar por terrenos acidentados através de treino em motores de física como o NVIDIA Isaac Sim, antes da implementação no mundo real.
  • Sistemas autónomos: Os veículos autónomos utilizam RL para tomar decisões em tempo real em situações de trânsito imprevisíveis. Enquanto os modelos de deteção de objetos identificam peões e sinais, os algoritmos de RL ajudam a determinar políticas de condução seguras para a mudança de faixa e a navegação em cruzamentos.
  • Otimização estratégica: O RL ganhou atenção mundial quando sistemas como o AlphaGo da Google DeepMind derrotaram campeões mundiais humanos em jogos de tabuleiro complexos. Para além dos jogos, estes agentes otimizam a logística industrial, como o controlo dos sistemas de arrefecimento em centros de dados para reduzir o consumo de energia.

Integração da visão com RL#

Em muitas aplicações modernas, o "estado" que um agente observa é visual. Modelos de alto desempenho como o YOLO26 funcionam como a camada de perceção dos agentes de RL, convertendo imagens não processadas em dados estruturados. Estas informações processadas — como a localização e a classe dos objetos — tornam-se o estado que a política de RL utiliza para escolher uma ação.

O exemplo seguinte demonstra como utilizar o pacote ultralytics para processar um frame do ambiente, criando uma representação do estado (por exemplo, o número de objetos) para um ciclo de RL teórico.

from ultralytics import YOLO

# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")

# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Process the frame to extract the current 'state'
results = model(observation_frame)

# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")

Diferenciação de Termos Relacionados#

É importante distinguir a Aprendizagem por reforço de outros paradigmas de aprendizagem automática:

  • vs. Aprendizagem supervisionada: A aprendizagem supervisionada requer um supervisor externo experiente que forneça dados de treino identificados (por exemplo, "esta imagem contém um gato"). Em contrapartida, o RL aprende com as consequências das suas próprias ações sem identificadores explícitos, descobrindo caminhos ideais através da exploração.
  • vs. Aprendizagem não supervisionada: A aprendizagem não supervisionada centra-se em encontrar estruturas ou padrões ocultos em dados não identificados (como agrupar clientes). O RL distingue-se por ser explicitamente orientado para objetivos, concentrando-se em maximizar um sinal de recompensa em vez de apenas descrever a estrutura dos dados.

À medida que o poder computacional aumenta, técnicas como a Aprendizagem por reforço a partir de feedback humano (RLHF) estão a aperfeiçoar ainda mais a forma como os agentes aprendem, alinhando os seus objetivos mais estreitamente com valores humanos complexos e normas de segurança. Os investigadores utilizam frequentemente ambientes padronizados como o Gymnasium para avaliar e melhorar estes algoritmos. Para as equipas que procuram gerir os conjuntos de dados necessários às camadas de perceção destes agentes, a Ultralytics Platform disponibiliza ferramentas abrangentes para anotação e gestão de modelos.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática