Ultralytics YOLO27:
AI per la visione

Gli ultimi aggiornamenti di OpenAI: Canvas, fine-tuning della visione e altro

Scopri con noi i recenti aggiornamenti di ChatGPT rilasciati da OpenAI. Esploreremo Canvas, il fine-tuning per le funzionalità di visione e la più recente funzione Search.

ABAbirami Vina9 min read
Panoramica degli ultimi aggiornamenti di ChatGPT di OpenAI

Quando abbiamo analizzato l'ultima volta i modelli o1 di OpenAI a settembre (progettati per migliorare il ragionamento), in ChatGPT sono state aggiunte molte funzionalità nuove e interessanti. Alcune di queste novità sono rivolte agli sviluppatori, mentre altre sono pensate per perfezionare l'esperienza utente. Nel complesso, ogni aggiornamento contribuisce a rendere le interazioni con ChatGPT più intuitive ed efficaci.

Aggiornamenti come Canvas, progettato per la scrittura e la programmazione collaborative, e il fine-tuning delle capacità visive, che migliora il modo in cui ChatGPT lavora con le immagini, hanno suscitato grande interesse, incoraggiando gli utenti a esplorare possibilità più creative. Nel frattempo, gli aggiornamenti tecnici, come le nuove API e i report sui test di equità, affrontano aspetti come l'integrazione dei modelli e le pratiche di IA etica. Esaminiamo più da vicino le funzionalità più recenti di ChatGPT di OpenAI per comprenderle meglio.

Panoramica della funzionalità Canvas di OpenAI#

Canvas è il primo aggiornamento importante dell'interfaccia utente (UI) di ChatGPT dal suo lancio. È una nuova interfaccia con un layout a due schermate, i prompt nella barra laterale sinistra e le risposte nella finestra a destra. La nuova UI elimina il consueto flusso di lavoro basato su una struttura simile a una chat a schermata singola e passa a un layout a due schermate adatto al multitasking, aumentando la produttività.

Canvas introduce aggiornamenti dell'UI in ChatGPT

Fig. 1 Canvas introduce aggiornamenti dell'UI in ChatGPT.

Prima dell'introduzione di Canvas, lavorare con documenti lunghi in ChatGPT significava dover scorrere molto verso l'alto e verso il basso. Nel nuovo layout, i prompt vengono visualizzati nella barra laterale sinistra, mentre il documento di testo o lo snippet di codice occupa la maggior parte dello schermo. Se necessario, puoi persino personalizzare le dimensioni della barra laterale sinistra e della schermata di output. Inoltre, puoi selezionare una parte del testo o una sezione di codice e modificare quella sezione specifica senza alterare l'intero documento.

Modifica di sezioni specifiche di testo usando Canvas

Fig. 2. Modifica di sezioni specifiche di testo usando Canvas.

Se usi Canvas, noterai che nell'interfaccia di ChatGPT non c'è alcun pulsante o interruttore specifico per aprirlo. Invece, quando lavori con il modello GPT-4o, Canvas si apre automaticamente se rileva che stai modificando, scrivendo o programmando. Per i prompt più semplici rimane inattivo. Se vuoi aprirlo manualmente, puoi usare prompt come "Apri Canvas" o "Mostrami il layout di Canvas".

Attualmente Canvas è in versione beta ed è disponibile solo con GPT-4o. Tuttavia, OpenAI ha dichiarato che Canvas sarà disponibile per tutti gli utenti gratuiti quando uscirà dalla versione beta.

Aggiornamenti dell'API di ChatGPT#

OpenAI ha rilasciato tre nuovi aggiornamenti dell'API di ChatGPT mirati a migliorare efficienza, scalabilità e versatilità. Esaminiamo più da vicino ciascuno di questi aggiornamenti.

Distillazione del modello#

Utilizzando la funzionalità Model Distillation tramite le API di OpenAI, gli sviluppatori possono usare gli output di modelli avanzati come GPT-4o o o1-preview per migliorare le prestazioni di modelli più piccoli ed economici come GPT-4o mini. La distillazione del modello è un processo che consiste nell'addestrare modelli più piccoli a imitare il comportamento di quelli più avanzati, rendendoli più efficienti per attività specifiche.

Prima dell'introduzione di questa funzionalità, gli sviluppatori dovevano coordinare manualmente diverse attività usando strumenti differenti. Queste attività includevano la generazione di dataset, la misurazione delle prestazioni del modello e il fine-tuning dei modelli, rendendo spesso il processo complesso e soggetto a errori. L'aggiornamento Model Distillation permette agli sviluppatori di usare Stored Completions, uno strumento che consente di generare automaticamente dataset acquisendo e memorizzando le coppie input-output prodotte dai modelli avanzati tramite l'API.

Un'altra funzionalità di Model Distillation, Evals (attualmente in versione beta), aiuta a misurare le prestazioni di un modello in attività specifiche, senza dover creare script di valutazione personalizzati o usare strumenti separati. Usando i dataset generati con Stored Completions e valutando le prestazioni con Evals, gli sviluppatori possono eseguire il fine-tuning dei propri modelli GPT personalizzati.

Uso di Evals per misurare le prestazioni del modello

Fig. 3 Puoi usare Evals per misurare le prestazioni del modello.

Caching dei prompt#

Spesso, quando si sviluppano applicazioni di IA, soprattutto chatbot, lo stesso contesto (le informazioni di base o la cronologia delle conversazioni precedenti necessarie per comprendere la richiesta attuale) viene usato ripetutamente per più chiamate API. Il Prompt Caching permette agli sviluppatori di riutilizzare gli token di input usati di recente (segmenti di testo che il modello elabora per comprendere il prompt e generare una risposta), contribuendo a ridurre costi e latenza.

Dal 1° ottobre, OpenAI ha applicato automaticamente il Prompt Caching a modelli come GPT-4o, GPT-4o mini, o1-preview e o1-mini. Ciò significa che, quando gli sviluppatori usano l'API per interagire con un modello tramite un prompt lungo (oltre 1.024 token), il sistema salva le parti che ha già elaborato.

In questo modo, se gli stessi prompt o prompt simili vengono usati nuovamente, il sistema può evitare di ricalcolare quelle parti. Il sistema memorizza automaticamente nella cache la parte più lunga del prompt già incontrata, iniziando da 1.024 token e aggiungendo blocchi di 128 token man mano che il prompt si allunga.

API Realtime#

La creazione di un assistente vocale richiede generalmente di trascrivere l'audio in testo, elaborare il testo e poi riconvertirlo in audio per riprodurre la risposta. L'API Realtime di OpenAI mira a gestire l'intero processo con una singola richiesta API. Semplificando il processo, l'API consente conversazioni in tempo reale con l'IA.

Ad esempio, un assistente vocale integrato con l'API Realtime può eseguire azioni specifiche, come effettuare un ordine o trovare informazioni, in base alle richieste degli utenti. L'API rende l'assistente vocale più reattivo e in grado di adattarsi rapidamente alle esigenze degli utenti. L'API Realtime è diventata disponibile in beta pubblica il 1° ottobre, con sei voci. Il 30 ottobre sono state aggiunte altre cinque voci, per un totale di undici voci disponibili.

Uso dell'API Realtime per esercitarsi nelle conversazioni in una nuova lingua

Fig. 4 Un esempio dell'uso dell'API Realtime per esercitarsi nelle conversazioni in una nuova lingua.

Fine-tuning di ChatGPT per attività di visione#

In origine, il modello linguistico con capacità visive GPT-4o poteva essere sottoposto a fine-tuning e personalizzato solo usando dataset esclusivamente testuali. Ora, con il rilascio dell'API per il fine-tuning della visione, gli sviluppatori possono addestrare e personalizzare GPT-4o usando dataset di immagini. Dal suo rilascio, il fine-tuning della visione è diventato un argomento di grande interesse tra gli sviluppatori e gli ingegneri della computer vision.

Per eseguire il fine-tuning delle capacità visive di GPT-4o, gli sviluppatori possono usare dataset di immagini che vanno da un minimo di 100 immagini a un massimo di 50.000. Dopo aver verificato che il dataset corrisponda al formato richiesto da OpenAI, è possibile caricarlo sulla piattaforma OpenAI e sottoporre il modello a fine-tuning per applicazioni specifiche.

Ad esempio, Automat, un'azienda di automazione, ha usato un dataset di schermate per addestrare GPT-4o a identificare gli elementi dell'UI su uno schermo in base a una descrizione. Ciò contribuisce a semplificare l'Automazione dei processi robotici (RPA), rendendo più facile per i bot interagire con le interfacce utente. Invece di basarsi su coordinate fisse o regole complesse per i selettori, il modello può identificare gli elementi dell'UI in base a descrizioni semplici, rendendo le configurazioni di automazione più adattabili e più facili da gestire quando le interfacce cambiano.

Uso di un modello GPT-4o sottoposto a fine-tuning per rilevare gli elementi dell'UI

Fig. 5 Uso di una versione del modello GPT-4o sottoposta a fine-tuning per rilevare gli elementi dell'UI.

Rilevamento dell'equità e dei bias in ChatGPT#

Le preoccupazioni etiche relative alle applicazioni di IA sono un tema di discussione importante, man mano che l'IA diventa sempre più avanzata. Poiché le risposte di ChatGPT si basano sui prompt forniti dagli utenti e sui dati disponibili su Internet, può essere difficile perfezionare il suo linguaggio affinché sia sempre responsabile. I report affermano che le risposte di ChatGPT sono condizionate da bias in base al nome, al genere e alla razza. Per affrontare questo problema, il team interno di OpenAI ha condotto un primo test di equità in prima persona.

I nomi spesso contengono indizi sottili sulla nostra cultura e su fattori geografici. Nella maggior parte dei casi, ChatGPT ignora gli indizi sottili presenti nei nomi. Tuttavia, in alcuni casi, i nomi che riflettono razza o cultura portano ChatGPT a fornire risposte diverse, circa l'1% delle quali contiene linguaggio dannoso. Eliminare i bias e il linguaggio dannoso è un compito difficile per un modello linguistico. Tuttavia, condividendo pubblicamente questi risultati e riconoscendo i limiti del modello, OpenAI aiuta gli utenti a perfezionare i propri prompt per ottenere risposte più neutrali e prive di bias.

Un esempio di risposte diverse di ChatGPT dovute al nome dell'utente

Fig. 6 Un esempio di risposte diverse dovute al nome dell'utente.

Comprendere la ricerca di ChatGPT#

Quando ChatGPT è stato lanciato per la prima volta, nella comunità dell'IA si discuteva se potesse sostituire la navigazione web tradizionale. Ora molti utenti usano ChatGPT al posto di Google Search.

Il nuovo aggiornamento di OpenAI, la funzionalità Search, fa un ulteriore passo avanti. Con Search, ChatGPT genera risposte aggiornate e include link a fonti pertinenti. Dal 31 ottobre, la funzionalità Search è disponibile per tutti gli utenti ChatGPT Plus e Team, rendendo ChatGPT più simile a un motore di ricerca basato sull'IA.

Un esempio dell'uso della nuova funzionalità Search di ChatGPT

Fig. 7 Un esempio dell'uso della nuova funzionalità Search di ChatGPT.

La strada da seguire#

Gli aggiornamenti recenti di ChatGPT si concentrano sul rendere l'IA più utile, flessibile ed equa. La nuova funzionalità Canvas aiuta gli utenti a lavorare in modo più efficiente, mentre il fine-tuning della visione consente agli sviluppatori di personalizzare i modelli affinché gestiscano meglio le attività visive. Affrontare il tema dell'equità e ridurre i bias sono inoltre priorità fondamentali, per garantire che l'IA funzioni bene per tutti, indipendentemente da chi siano. Che tu sia uno sviluppatore che esegue il fine-tuning dei modelli o semplicemente utilizzi le funzionalità più recenti, ChatGPT si sta evolvendo per soddisfare un'ampia gamma di esigenze. Grazie alle funzionalità in tempo reale, all'integrazione visiva e all'attenzione per un uso responsabile, questi aggiornamenti stanno costruendo un'esperienza di IA più affidabile e degna di fiducia per tutti.

Scopri di più sull'IA visitando il nostro repository GitHub e partecipando alla nostra community. Approfondisci le applicazioni dell'IA nella guida autonoma e nell'assistenza sanitaria.

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning