YOLO Vision 2026 :
Retour au glossaire Ultralytics

Reinforcement Learning

Explore les concepts fondamentaux de l'apprentissage par renforcement (RL). Apprends comment les agents utilisent les retours pour maîtriser des tâches et découvre comment Ultralytics YOLO26 propulse les systèmes de vision RL.

L'apprentissage par renforcement (RL) est un sous-ensemble orienté vers les objectifs du machine learning (ML) dans lequel un système autonome, appelé agent, apprend à prendre des décisions en effectuant des actions et en recevant des retours de son environnement. Contrairement au supervised learning, qui repose sur des ensembles de données statiques étiquetés avec les bonnes réponses, les algorithmes de RL apprennent par un processus dynamique d'essais et d'erreurs. L'agent interagit avec une simulation ou le monde réel, en observant les conséquences de ses actions pour déterminer quelles stratégies rapportent les récompenses à long terme les plus élevées. Cette approche imite de près le concept psychologique du conditioning operant, où le comportement est façonné par le renforcement positif (récompenses) et le renforcement négatif (punitions) au fil du temps.

Concepts fondamentaux de la boucle RL#

Pour comprendre le fonctionnement du RL, il est utile de le visualiser comme un cycle d'interaction continu. Ce cadre est souvent formalisé mathématiquement comme un Markov Decision Process (MDP), qui structure la prise de décision dans des situations où les résultats sont en partie aléatoires et en partie contrôlés par le preneur de décision.

Les principaux composants de cette boucle d'apprentissage incluent :

  • AI Agent : L'entité responsable de l'apprentissage et de la prise de décisions. Elle perçoit l'environnement et prend des mesures pour maximiser son succès cumulé.
  • Environnement : Le monde extérieur dans lequel l'agent opère. Il peut s'agir d'un jeu vidéo complexe, d'une simulation de marché financier ou d'un entrepôt physique dans AI in logistics.
  • État : Un instantané ou une représentation de la situation actuelle. Dans les applications visuelles, cela implique souvent le traitement de flux de caméras à l'aide de computer vision (CV) pour détecter des objets et des obstacles.
  • Action : Le mouvement ou le choix spécifique que fait l'agent. L'ensemble complet de tous les mouvements possibles est appelé action space.
  • Récompense : Un signal numérique envoyé de l'environnement à l'agent après une action. Un reward function bien conçu attribue des valeurs positives pour les actions bénéfiques et des pénalités pour les actions préjudiciables.
  • Politique : La stratégie ou l'ensemble de règles que l'agent utilise pour déterminer la prochaine action en fonction de l'état actuel. Des algorithmes comme Q-learning définissent la manière dont cette politique est mise à jour et optimisée.

Applications concrètes#

L'apprentissage par renforcement est passé de la recherche théorique à des déploiements pratiques à fort impact dans diverses industries.

  • Robotique avancée : Dans le domaine de AI in robotics, le RL permet aux machines de maîtriser des compétences motrices complexes qu'il est difficile de coder en dur. Les robots peuvent apprendre à saisir des objets irréguliers ou à naviguer sur un terrain accidenté en s'entraînant dans des moteurs physiques comme NVIDIA Isaac Sim avant de se déployer dans le monde réel.
  • Systèmes autonomes : Les Autonomous vehicles utilisent le RL pour prendre des décisions en temps réel dans des scénarios de trafic imprévisibles. Alors que les modèles de object detection identifient les piétons et les panneaux, les algorithmes de RL aident à déterminer des politiques de conduite sûres pour la fusion de voies et la navigation aux carrefours.
  • Optimisation stratégique : Le RL a attiré l'attention mondiale lorsque des systèmes comme Google DeepMind's AlphaGo ont battu des champions du monde humains dans des jeux de société complexes. Au-delà du jeu, ces agents optimisent la logistique industrielle, comme le contrôle des systèmes de refroidissement dans les centres de données pour réduire la consommation d'énergie.

Intégration de la vision avec la RL#

Dans de nombreuses applications modernes, "l'état" observé par un agent est visuel. Des modèles haute performance comme YOLO26 agissent comme la couche de perception pour les agents de RL, convertissant les images brutes en données structurées. Ces informations traitées, telles que l'emplacement et la classe des objets, deviennent l'état que la politique de RL utilise pour choisir une action.

L'exemple suivant montre comment utiliser le package ultralytics pour traiter une image d'environnement, créant une représentation d'état (par exemple, le nombre d'objets) pour une boucle de RL théorique.

from ultralytics import YOLO

# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")

# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Process the frame to extract the current 'state'
results = model(observation_frame)

# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")

Différencier les termes associés#

Il est important de distinguer l'apprentissage par renforcement des autres paradigmes d'apprentissage automatique :

  • vs. Supervised Learning : Le supervised learning nécessite un superviseur externe compétent pour fournir des données d'entraînement étiquetées (par exemple, "cette image contient un chat"). En revanche, le RL apprend des conséquences de ses propres actions sans étiquettes explicites, découvrant des chemins optimaux par l'exploration.
  • vs. Unsupervised Learning : L'unsupervised learning se concentre sur la recherche de structures ou de modèles cachés dans des données non étiquetées (comme le clustering de clients). Le RL diffère car il est explicitement orienté vers les objectifs, se concentrant sur la maximisation d'un signal de récompense plutôt que de simplement décrire la structure des données.

À mesure que la puissance de calcul augmente, des techniques telles que le Reinforcement Learning from Human Feedback (RLHF) affinent encore la manière dont les agents apprennent, alignant leurs objectifs plus étroitement sur les valeurs humaines complexes et les normes de sécurité. Les chercheurs utilisent souvent des environnements standardisés comme Gymnasium pour évaluer et améliorer ces algorithmes. Pour les équipes cherchant à gérer les ensembles de données requis pour les couches de perception de ces agents, la Ultralytics Platform offre des outils complets d'annotation et de gestion des modèles.

Explore solutions

Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble le futur de l'IA !

Commence ton aventure avec le futur de l'apprentissage automatique