YOLO Vision 2026:
Torna al glossario di Ultralytics

Reinforcement Learning

Scopri i concetti fondamentali del reinforcement learning (RL). Impara come gli agenti usino il feedback per padroneggiare le attività e scopri come Ultralytics YOLO26 alimenti i sistemi di visione basati sull’RL.

L'apprendimento per rinforzo (RL) è un sottoinsieme dell'apprendimento automatico (ML) orientato agli obiettivi, in cui un sistema autonomo, noto come agente, impara a prendere decisioni eseguendo azioni e ricevendo feedback dall'ambiente. A differenza dell'apprendimento supervisionato, che si basa su set di dati statici etichettati con le risposte corrette, gli algoritmi di RL apprendono attraverso un processo dinamico di tentativi ed errori. L'agente interagisce con una simulazione o con il mondo reale, osservando le conseguenze delle proprie azioni per determinare quali strategie producono le ricompense a lungo termine più elevate. Questo approccio riproduce fedelmente il concetto psicologico di condizionamento operante, in cui il comportamento viene modellato nel tempo attraverso il rinforzo positivo (ricompense) e il rinforzo negativo (punizioni).

Concetti fondamentali del ciclo di RL#

Per comprendere il funzionamento dell'RL, è utile visualizzarlo come un ciclo continuo di interazione. Questo modello viene spesso formalizzato matematicamente come un processo decisionale di Markov (MDP), che struttura il processo decisionale in situazioni in cui gli esiti sono in parte casuali e in parte controllati dal decisore.

I componenti principali di questo ciclo di apprendimento includono:

  • Agente di IA: l'entità responsabile dell'apprendimento e del processo decisionale. Percepisce l'ambiente e compie azioni per massimizzare il proprio successo cumulativo.
  • Ambiente: il mondo esterno in cui opera l'agente. Può trattarsi di un videogioco complesso, di una simulazione di mercato finanziario o di un magazzino fisico nell'IA nella logistica.
  • Stato: un'istantanea o una rappresentazione della situazione attuale. Nelle applicazioni visive, ciò comporta spesso l'elaborazione dei flussi video delle telecamere mediante la visione artificiale (CV) per rilevare oggetti e ostacoli.
  • Azione: la mossa o la scelta specifica compiuta dall'agente. L'insieme completo di tutte le mosse possibili è definito spazio delle azioni.
  • Ricompensa: un segnale numerico inviato dall'ambiente all'agente dopo un'azione. Una funzione di ricompensa ben progettata assegna valori positivi alle azioni vantaggiose e penalità a quelle dannose.
  • Policy: la strategia o l'insieme di regole utilizzato dall'agente per determinare l'azione successiva in base allo stato attuale. Algoritmi come il Q-learning definiscono come questa policy viene aggiornata e ottimizzata.

Applicazioni nel mondo reale#

L'apprendimento per rinforzo è passato dalla ricerca teorica a implementazioni pratiche e di grande impatto in vari settori.

  • Robotica avanzata: nel campo dell'IA nella robotica, l'RL consente alle macchine di acquisire complesse abilità motorie difficili da codificare manualmente. I robot possono imparare ad afferrare oggetti irregolari o a muoversi su terreni accidentati addestrandosi in motori fisici come NVIDIA Isaac Sim prima di essere impiegati nel mondo reale.
  • Sistemi autonomi: i veicoli autonomi utilizzano l'RL per prendere decisioni in tempo reale in scenari di traffico imprevedibili. Mentre i modelli di rilevamento degli oggetti identificano pedoni e segnali, gli algoritmi di RL aiutano a determinare policy di guida sicure per l'immissione nelle corsie e l'attraversamento degli incroci.
  • Ottimizzazione strategica: l'RL ha attirato l'attenzione globale quando sistemi come AlphaGo di Google DeepMind hanno sconfitto i campioni del mondo umani in complessi giochi da tavolo. Oltre al gaming, questi agenti ottimizzano la logistica industriale, ad esempio controllando i sistemi di raffreddamento nei data center per ridurre il consumo energetico.

Integrazione della visione con l'RL#

In molte applicazioni moderne, lo "stato" osservato da un agente è visivo. Modelli ad alte prestazioni come YOLO26 fungono da livello percettivo per gli agenti di RL, convertendo le immagini grezze in dati strutturati. Queste informazioni elaborate, come la posizione e la classe degli oggetti, diventano lo stato utilizzato dalla policy di RL per scegliere un'azione.

L'esempio seguente mostra come utilizzare il pacchetto ultralytics per elaborare un fotogramma dell'ambiente, creando una rappresentazione dello stato (ad esempio, il numero di oggetti) per un ciclo di RL teorico.

from ultralytics import YOLO

# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")

# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Process the frame to extract the current 'state'
results = model(observation_frame)

# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")

Distinzione tra termini correlati#

È importante distinguere l'apprendimento per rinforzo dagli altri paradigmi dell'apprendimento automatico:

  • Rispetto all'apprendimento supervisionato: l'apprendimento supervisionato richiede un supervisore esterno competente che fornisca dati di addestramento etichettati (ad esempio, "questa immagine contiene un gatto"). Al contrario, l'RL apprende dalle conseguenze delle proprie azioni senza etichette esplicite, scoprendo i percorsi ottimali attraverso l'esplorazione.
  • Rispetto all'apprendimento non supervisionato: l'apprendimento non supervisionato si concentra sull'individuazione di strutture o schemi nascosti all'interno di dati non etichettati (come il clustering dei clienti). L'RL si differenzia perché è esplicitamente orientato agli obiettivi e si concentra sulla massimizzazione di un segnale di ricompensa anziché sulla semplice descrizione della struttura dei dati.

Con l'aumento della potenza di calcolo, tecniche come il reinforcement learning dal feedback umano (RLHF) perfezionano ulteriormente il modo in cui apprendono gli agenti, allineando più strettamente i loro obiettivi ai complessi valori umani e agli standard di sicurezza. I ricercatori utilizzano spesso ambienti standardizzati come Gymnasium per sottoporre questi algoritmi a benchmark e migliorarli. Per i team che desiderano gestire i set di dati necessari ai livelli percettivi di questi agenti, la Ultralytics Platform offre strumenti completi per l'annotazione e la gestione dei modelli.

Explore solutions

Real-time AI that works with your team

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Real-time AI that works with your team

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Real-time AI that works with your team

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Real-time AI that works with your operation

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Real-time AI that works with your team

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Real-time AI that works with your team

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Real-time AI that works with your team

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Real-time AI that works with your operation

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Real-time AI that works with your team

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Real-time AI that works with your team

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Real-time AI that works with your team

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Real-time AI that works with your operation

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning