Ultralytics YOLO27 :
Retour au glossaire Ultralytics

Reinforcement Learning

Explore les concepts fondamentaux de l’apprentissage par renforcement (RL). Découvre comment les agents utilisent le feedback pour maîtriser des tâches et comment Ultralytics YOLO26 alimente les systèmes de vision par RL.

L’apprentissage par renforcement (RL) est un sous-ensemble orienté vers les objectifs de l’apprentissage automatique (ML), dans lequel un système autonome, appelé agent, apprend à prendre des décisions en effectuant des actions et en recevant des retours de son environnement. Contrairement à l’apprentissage supervisé, qui repose sur des jeux de données statiques étiquetés avec les bonnes réponses, les algorithmes de RL apprennent grâce à un processus dynamique d’essais et d’erreurs. L’agent interagit avec une simulation ou le monde réel et observe les conséquences de ses actions afin de déterminer quelles stratégies produisent les récompenses à long terme les plus élevées. Cette approche reproduit étroitement le concept psychologique de conditionnement opérant, dans lequel le comportement est façonné au fil du temps par le renforcement positif (récompenses) et le renforcement négatif (punitions).

Concepts clés de la boucle de RL#

Pour comprendre le fonctionnement du RL, il est utile de le visualiser comme un cycle continu d’interactions. Ce cadre est souvent formalisé mathématiquement comme un processus décisionnel de Markov (MDP), qui structure la prise de décision dans des situations où les résultats sont en partie aléatoires et en partie contrôlés par le décideur.

Les principaux composants de cette boucle d’apprentissage sont les suivants :

  • Agent d’IA : Entité responsable de l’apprentissage et de la prise de décision. Il perçoit l’environnement et effectue des actions afin de maximiser son succès cumulé.
  • Environnement : Monde extérieur dans lequel l’agent évolue. Il peut s’agir d’un jeu vidéo complexe, d’une simulation de marché financier ou d’un entrepôt physique dans le domaine de l’IA dans la logistique.
  • État : Instantané ou représentation de la situation actuelle. Dans les applications visuelles, cela implique souvent de traiter des flux vidéo provenant de caméras à l’aide de la vision par ordinateur (CV) afin de détecter les objets et les obstacles.
  • Action : Mouvement ou choix spécifique effectué par l’agent. L’ensemble complet de tous les mouvements possibles est appelé l’espace des actions.
  • Récompense : Signal numérique envoyé par l’environnement à l’agent après une action. Une fonction de récompense bien conçue attribue des valeurs positives aux actions bénéfiques et des pénalités aux actions nuisibles.
  • Politique : Stratégie ou ensemble de règles utilisé par l’agent pour déterminer l’action suivante à partir de l’état actuel. Des algorithmes comme l’apprentissage Q définissent la manière dont cette politique est mise à jour et optimisée.

Applications concrètes#

L’apprentissage par renforcement est passé de la recherche théorique à des déploiements pratiques à fort impact dans divers secteurs.

  • Robotique avancée : Dans le domaine de l’IA dans la robotique, le RL permet aux machines de maîtriser des compétences motrices complexes difficiles à programmer manuellement. Les robots peuvent apprendre à saisir des objets irréguliers ou à se déplacer sur des terrains accidentés en s’entraînant dans des moteurs physiques comme NVIDIA Isaac Sim avant leur déploiement dans le monde réel.
  • Systèmes autonomes : Les véhicules autonomes utilisent le RL pour prendre des décisions en temps réel dans des situations de circulation imprévisibles. Alors que les modèles de détection d’objets identifient les piétons et les panneaux, les algorithmes de RL contribuent à déterminer des politiques de conduite sûres pour les insertions sur voie et la navigation aux intersections.
  • Optimisation stratégique : Le RL a attiré l’attention du monde entier lorsque des systèmes comme AlphaGo de Google DeepMind ont vaincu des champions du monde humains dans des jeux de plateau complexes. Au-delà du jeu, ces agents optimisent la logistique industrielle, par exemple en contrôlant les systèmes de refroidissement des centres de données afin de réduire la consommation d’énergie.

Intégration de la vision au RL#

Dans de nombreuses applications modernes, l’« état » observé par un agent est visuel. Des modèles performants comme YOLO26 servent de couche de perception pour les agents de RL et convertissent les images brutes en données structurées. Ces informations traitées, telles que l’emplacement et la classe des objets, deviennent l’état que la politique de RL utilise pour choisir une action.

L’exemple suivant montre comment utiliser le package ultralytics pour traiter une image d’un environnement et créer une représentation de l’état (par exemple, le nombre d’objets) pour une boucle de RL théorique.

from ultralytics import YOLO

# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")

# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Process the frame to extract the current 'state'
results = model(observation_frame)

# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")

Différencier les termes associés#

Il est important de distinguer l’apprentissage par renforcement des autres paradigmes de l’apprentissage automatique :

  • Par rapport à l’apprentissage supervisé : L’apprentissage supervisé nécessite qu’un superviseur externe compétent fournisse des données d’entraînement étiquetées (par exemple, « cette image contient un chat »). En revanche, le RL apprend des conséquences de ses propres actions sans étiquettes explicites et découvre les chemins optimaux par l’exploration.
  • Par rapport à l’apprentissage non supervisé : L’apprentissage non supervisé vise à trouver des structures ou des motifs cachés dans des données non étiquetées (par exemple, regrouper des clients). Le RL s’en distingue parce qu’il est explicitement orienté vers les objectifs et cherche à maximiser un signal de récompense plutôt qu’à simplement décrire la structure des données.

À mesure que la puissance de calcul augmente, des techniques comme l’apprentissage par renforcement à partir des retours humains (RLHF) affinent davantage la manière dont les agents apprennent et alignent plus étroitement leurs objectifs sur des valeurs humaines complexes et des normes de sécurité. Les chercheurs utilisent souvent des environnements standardisés comme Gymnasium pour évaluer et améliorer ces algorithmes. Pour les équipes qui cherchent à gérer les jeux de données nécessaires aux couches de perception de ces agents, l’Ultralytics Platform propose des outils complets d’annotation et de gestion des modèles.

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique