YOLO Vision 2026:
Vision AI

Gli ultimi aggiornamenti di OpenAI: Canvas, fine-tuning per la visione e altro ancora

Unisciti a noi mentre esaminiamo da vicino i recenti aggiornamenti di ChatGPT rilasciati da OpenAI. Esploreremo Canvas, il fine-tuning per le funzionalità di visione e la più recente funzione di ricerca.

ABAbirami Vina4 min read
Una panoramica degli ultimi aggiornamenti di ChatGPT di OpenAI

Dopo aver esaminato i modelli o1 di OpenAI a settembre (progettati per migliorare il ragionamento), sono state aggiunte a ChatGPT molte nuove ed entusiasmanti funzionalità. Alcune di queste novità sono pensate per gli sviluppatori, mentre altre servono a perfezionare l'esperienza utente. Nel complesso, ogni aggiornamento contribuisce a rendere le interazioni con ChatGPT più intuitive ed efficaci.

Aggiornamenti come Canvas, progettato per la scrittura e la programmazione collaborative, e il fine-tuning per le funzionalità di visione che migliora il modo in cui ChatGPT gestisce le immagini, hanno suscitato molto interesse, incoraggiando gli utenti a esplorare nuove possibilità creative. Nel frattempo, gli aggiornamenti tecnici, come le nuove API e i rapporti sui test di equità, affrontano aspetti legati all'integrazione del modello e alle pratiche di IA etica. Scopriamo insieme le ultime funzionalità di ChatGPT rilasciate da OpenAI!

Una panoramica della funzionalità Canvas di OpenAI#

Canvas è il primo importante aggiornamento dell'interfaccia utente (UI) di ChatGPT dal suo rilascio. È una nuova interfaccia con un layout a due schermi, i prompt nella barra laterale sinistra e le risposte nella finestra destra. La nuova UI elimina la solita struttura a schermo singolo tipica delle chat e passa a un layout a due schermi, adatto al multitasking per aumentare la produttività.

Canvas porta aggiornamenti dell'interfaccia utente su ChatGPT

Fig 1. Canvas introduce aggiornamenti dell'interfaccia utente in ChatGPT.

Prima dell'introduzione di Canvas, lavorare con documenti lunghi su ChatGPT significava dover scorrere spesso la pagina verso l'alto e verso il basso. Nel nuovo layout, i prompt vengono visualizzati nella barra laterale sinistra, mentre il documento di testo o lo snippet di codice occupa la maggior parte dello schermo. Se necessario, puoi persino personalizzare le dimensioni della barra laterale sinistra e della schermata di output. Inoltre, puoi selezionare una porzione di testo o una sezione di codice e modificare quella specifica parte senza alterare l'intero documento.

Modifica di sezioni specifiche di testo tramite Canvas

Fig 2. Modifica di sezioni specifiche di testo usando Canvas.

Se usi Canvas, noterai che non esiste un pulsante o un interruttore specifico per aprirlo nell'interfaccia di ChatGPT. Al contrario, quando lavori con il modello GPT-4o, Canvas si apre automaticamente se rileva che stai modificando, scrivendo o programmandò. Per i prompt più semplici, rimane inattivo. Se desideri aprirlo manualmente, puoi usare prompt come "Apri Canvas" o "Mostrami il layout di Canvas".

Attualmente, Canvas è in beta e disponibile solo con GPT-4o. Tuttavia, OpenAI ha menzionato che Canvas sarà disponibile per tutti gli utenti gratuiti una volta uscito dalla fase beta.

Aggiornamenti delle API di ChatGPT#

OpenAI ha rilasciato tre nuovi aggiornamenti alle API di ChatGPT volti a migliorare efficienza, scalabilità e versatilità. Analizziamo più da vicino ciascuno di questi aggiornamenti.

Distillazione dei modelli#

Sfruttando la funzione di Model Distillation tramite le API di OpenAI, gli sviluppatori possono utilizzare gli output di modelli avanzati come GPT-4o o o1-preview per migliorare le prestazioni di modelli più piccoli e convenienti come GPT-4o mini. La distillazione dei modelli è un processo che prevede l'addestramento di modelli più piccoli affinché imitino il comportamento di quelli più avanzati, rendendoli più efficienti per compiti specifici.

Prima che questa funzione venisse introdotta, gli sviluppatori dovevano coordinare manualmente una serie di attività utilizzando strumenti diversi. Queste attività includevano la generazione di dataset, la misurazione delle prestazioni del modello e il fine-tuning dei modelli, rendendo spesso il processo complesso e incline agli errori. L'aggiornamento Model Distillation consente agli sviluppatori di utilizzare Stored Completions, uno strumento che permette di generare automaticamente dataset catturando e memorizzando le coppie di input-output prodotte dai modelli avanzati tramite l'API.

Un'altra funzionalità di Model Distillation, Evals (attualmente in versione beta), aiuta a misurare le prestazioni di un modello su compiti specifici, senza la necessità di creare script di valutazione personalizzati o di utilizzare strumenti separati. Utilizzando i dataset generati con Stored Completions e valutandone le prestazioni con Evals, gli sviluppatori possono eseguire il fine-tuning dei propri modelli GPT personalizzati.

Utilizzo di Evals per misurare le prestazioni del modello

Fig 3. Puoi usare Evals per misurare le prestazioni del modello.

Caching dei prompt#

Spesso nello sviluppo di applicazioni di IA, in particolare chatbot, lo stesso contesto (le informazioni di background o la cronologia della conversazione precedente necessarie per comprendere la richiesta attuale) viene utilizzato ripetutamente per più chiamate API. Prompt Caching consente agli sviluppatori di riutilizzare i token di input usati di recente (segmenti di testo elaborati dal modello per comprendere il prompt e generare una risposta), contribuendo a ridurre costi e latenza.

Dal 1° ottobre, OpenAI ha applicato automaticamente Prompt Caching ai suoi modelli come GPT-4o, GPT-4o mini, o1-preview e o1-mini. Ciò significa che quando gli sviluppatori utilizzano l'API per interagire con un modello caratterizzato da un prompt lungo (oltre 1.024 token), il sistema salva le parti che ha già elaborato.

In questo modo, se vengono utilizzati di nuovo prompt identici o simili, può evitare di ricalcolare quelle parti. Il sistema memorizza automaticamente nella cache la parte più lunga del prompt precedentemente incontrata, iniziando con 1.024 token e aggiungendo blocchi da 128 token man mano che il prompt si allunga.

API Realtime#

La creazione di un assistente vocale comporta in genere la necessità di trascrivere l'audio in testo, elaborare il testo e quindi riconvertirlo in audio per riprodurre la risposta. L'API Realtime di OpenAI mira a gestire l'intero processo con una singola richiesta API. Semplificando il flusso, l'API abilita conversazioni in tempo reale con l'IA.

Ad esempio, un assistente vocale integrato con la Realtime API può eseguire azioni specifiche, come effettuare un ordine o trovare informazioni, in base alle richieste dell'utente. L'API rende l'assistente vocale più reattivo e in grado di adattarsi rapidamente alle esigenze degli utenti. La Realtime API è diventata disponibile in beta pubblica il 1° ottobre con sei voci. Il 30 ottobre sono state aggiunte altre cinque voci, portando il totale a undici voci disponibili.

Utilizzo della Realtime API per fare pratica di conversazione in una nuova lingua

Fig 4. Un esempio di utilizzo della Realtime API per fare pratica di conversazione in una nuova lingua.

Fine-tuning di ChatGPT per attività visive#

Originariamente, il modello linguistico visivo GPT-4o poteva essere sottoposto a fine-tuning e personalizzato solo usando dataset di solo testo. Ora, con il rilascio dell'API di fine-tuning visivo, gli sviluppatori possono addestrare e personalizzare GPT-4o usando dataset di immagini. Dal suo rilascio, il fine-tuning visivo è diventato un argomento di grande interesse tra sviluppatori e ingegneri di visione artificiale.

Per effettuare il fine-tuning delle capacità visive di GPT-4o, gli sviluppatori possono usare dataset di immagini che spaziano da un minimo di 100 immagini a un massimo di 50.000. Dopo aver verificato che il dataset rispetti il formato richiesto da OpenAI, può essere caricato sulla piattaforma OpenAI e il modello può essere sottoposto a fine-tuning per applicazioni specifiche.

Ad esempio, Automat, un'azienda di automazione, ha utilizzato un dataset di schermate per addestrare GPT-4o a identificare gli elementi dell'interfaccia utente sullo schermo basandosi su una descrizione. Questo aiuta a ottimizzare l'automazione dei processi robotici (RPA), semplificando l'interazione dei bot con le interfacce utente. Invece di affidarsi a coordinate fisse o a complesse regole di selezione, il modello è in grado di identificare gli elementi dell'interfaccia utente tramite semplici descrizioni, rendendo la configurazione dell'automazione più flessibile e semplice da mantenere quando le interfacce cambiano.

Utilizzo di un modello GPT-4o sottoposto a fine-tuning per rilevare elementi dell'interfaccia utente

Fig 5. Utilizzo di una versione con fine-tuning del modello GPT-4o per rilevare elementi dell'interfaccia utente.

Equità di ChatGPT e rilevamento dei bias#

Le preoccupazioni etiche relative alle applicazioni di IA sono un argomento di discussione centrale man mano che l'IA diventa sempre più avanzata. Poiché le risposte di ChatGPT si basano sui prompt forniti dall'utente e sui dati disponibili su Internet, può risultare difficile fare in modo che il suo linguaggio sia sempre responsabile. I rapporti indicano che le risposte di ChatGPT sono influenzate da pregiudizi legati a nome, genere e razza. Per affrontare questo problema, il team interno di OpenAI ha condotto un test di equità in prima persona.

I nomi spesso contengono indizi sottili riguardo alla nostra cultura e a fattori geografici. Nella maggior parte dei casi, ChatGPT ignora tali indizi nei nomi. Tuttavia, in alcune circostanze, i nomi che riflettono la razza o la cultura generano risposte differenti da parte di ChatGPT, e circa l'1% di queste include un linguaggio dannoso. Eliminare i pregiudizi e il linguaggio dannoso è un compito arduo per un modello linguistico. Ciononostante, condividendo pubblicamente questi risultati e riconoscendo i limiti del modello, OpenAI aiuta gli utenti a perfezionare i propri prompt per ottenere risposte più neutrali e prive di pregiudizi.

Un esempio di risposte differenti di ChatGPT dovute al nome dell'utente

Fig 6. Un esempio di risposte differenti dovute al nome dell'utente.

Capire la ricerca di ChatGPT#

Quando ChatGPT è stato lanciato per la prima volta, c'erano discussioni nella comunità AI sulla possibilità che potesse sostituire la tradizionale navigazione web. Ora, molti utenti usano ChatGPT al posto di Google Search.

Il nuovo aggiornamento di OpenAI, la funzionalità di Ricerca, fa un ulteriore passo avanti. Con la Ricerca, ChatGPT genera risposte aggiornate e include collegamenti a fonti pertinenti. A partire dal 31 ottobre, la funzionalità di Ricerca è disponibile per tutti gli utenti ChatGPT Plus e Team, rendendo ChatGPT simile a un motore di ricerca basato su AI.

Un esempio di utilizzo della nuova funzione Search di ChatGPT

Fig 7. Un esempio di utilizzo della nuova funzione Search di ChatGPT.

La strada da percorrere#

I recenti aggiornamenti di ChatGPT si concentrano sul rendere l'AI più utile, flessibile ed equa. La nuova funzionalità Canvas aiuta gli utenti a lavorare in modo più efficiente, mentre il fine-tuning visivo consente agli sviluppatori di personalizzare i modelli per gestire meglio le attività visive. Affrontare l'equità e ridurre i bias sono anche priorità chiave, garantendo che l'AI funzioni bene per tutti, indipendentemente da chi siano. Che tu sia uno sviluppatore che esegue il fine-tuning dei modelli o che tu stia solo usando le ultime funzionalità, ChatGPT si sta evolvendo per soddisfare una vasta gamma di esigenze. Con capacità in tempo reale, integrazione visiva e un focus sull'uso responsabile, questi aggiornamenti stanno costruendo un'esperienza AI più affidabile e degna di fiducia per tutti.

Esplora ulteriormente l'IA visitando il nostro repository GitHub e unendoti alla nostra community. Scopri di più sulle applicazioni dell'IA nella guida autonoma e nel settore sanitario.

Explore solutions

Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più
Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più
Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo viaggio con il futuro del machine learning