Il 2024 inizia con un'ondata di AI generativa
Uno sguardo alle entusiasmanti innovazioni dell'AI del primo trimestre del 2024. Parleremo di scoperte come l'AI Sora di OpenAI, il chip cerebrale di Neuralink e gli ultimi LLM.

La comunità dell'IA sembra conquistare le prime pagine quasi ogni giorno. I primi mesi del 2024 sono stati entusiasmanti e ricchi di nuove innovazioni nel campo dell'IA. Dai nuovi e potenti modelli linguistici di grandi dimensioni agli impianti nel cervello umano, il 2024 si preannuncia straordinario.
Stiamo assistendo alla trasformazione dei settori da parte dell'IA, che rende le informazioni più accessibili e muove persino i primi passi verso la fusione delle nostre menti con le macchine. Ripercorriamo il primo trimestre del 2024 e analizziamo più da vicino i progressi compiuti nell'IA in pochi mesi.
I modelli linguistici di grandi dimensioni sono di tendenza#
I modelli linguistici di grandi dimensioni (LLMs), progettati per comprendere, generare e manipolare il linguaggio umano sulla base di enormi quantità di dati testuali, sono stati protagonisti del primo trimestre del 2024. Molte importanti aziende tecnologiche hanno rilasciato i propri modelli LLM, ciascuno con capacità uniche. Lo straordinario successo di precedenti LLM come GPT-3 ha ispirato questa tendenza. Ecco alcuni dei rilasci di LLM più importanti dell'inizio del 2024.
Claude 3 di Anthropic#
Anthropic ha rilasciato Claude 3 il 14 marzo 2024. Il modello Claude 3 è disponibile in tre versioni: Opus, Sonnet e Haiku, ciascuna pensata per mercati e scopi diversi. Haiku, il modello più rapido, è ottimizzato per risposte veloci e basilari. Sonnet bilancia velocità e intelligenza ed è destinato alle applicazioni aziendali. Opus, la versione più avanzata, offre capacità di intelligenza e ragionamento senza pari ed è ideale per attività complesse e per raggiungere i migliori risultati nei benchmark.
Claude 3 vanta numerose funzionalità e migliorie avanzate:
- Conversazioni multilingue migliorate: capacità migliorate in lingue tra cui spagnolo, giapponese e francese.
- Funzionalità avanzate di visione: capacità di gestire diversi formati visivi.
- Rifiuti ridotti al minimo: dimostra una maggiore comprensione con meno rifiuti non necessari, indicando una migliore comprensione del contesto.
- Finestra di contesto estesa: offre una finestra di contesto di 200K, ma può elaborare input di oltre 1 milione di token in base alle esigenze dei clienti.

Fig. 1. Claude 3 è più consapevole del contesto rispetto alle versioni precedenti.
DBRX di Databricks#
Databricks DBRX è un LLM aperto e general-purpose rilasciato da Databricks il 27 marzo 2024. DBRX ottiene ottimi risultati in diversi benchmark, tra cui comprensione del linguaggio, programmazione e matematica. Supera altri modelli affermati pur essendo circa il 40% più piccolo di modelli simili.

Fig. 2. Confronto tra DBRX e altri modelli.
DBRX è stato addestrato mediante la predizione del token successivo con un'architettura a miscela di esperti (MoE) a grana fine, motivo per cui possiamo osservare miglioramenti significativi nelle prestazioni di addestramento e inferenza. La sua architettura consente al modello di prevedere con maggiore accuratezza la parola successiva in una sequenza consultando un insieme diversificato di sottomodelli specializzati (gli "esperti"). Questi sottomodelli sono efficaci nella gestione di diversi tipi di informazioni o attività.
Gemini 1.5 di Google#
Google ha presentato Gemini 1.5, un modello di IA multimodale efficiente dal punto di vista computazionale in grado di analizzare grandi quantità di dati testuali, video e audio, il 15 febbraio 2024. Il modello più recente è più avanzato in termini di prestazioni, efficienza e capacità. Una caratteristica fondamentale di Gemini 1.5 è la sua svolta nella comprensione dei contesti lunghi. Il modello è in grado di gestire in modo coerente fino a 1 milione di token. Anche le capacità di Gemini 1.5 sono dovute a una nuova architettura basata su MoE.

Fig. 3. Confronto tra le lunghezze del contesto degli LLM più diffusi
Ecco alcune delle funzionalità più interessanti di Gemini 1.5:
- Gestione dei dati migliorata: consente di caricare direttamente grandi file PDF, repository di codice o video lunghi come prompt. Il modello è in grado di ragionare tra diverse modalità e produrre testo.
- Caricamento e interrogazione di più file: ora gli sviluppatori possono caricare più file e porre domande.
- Utilizzabile per diverse attività: è ottimizzato per scalare su attività eterogenee e mostra miglioramenti in aree come matematica, scienze, ragionamento, multilinguismo, comprensione dei video e codice.
Immagini sorprendenti generate dall'IA#
Il primo trimestre del 2024 ha portato alla luce modelli di IA generativa in grado di creare immagini così realistiche da suscitare dibattiti sul futuro dei social media e sui progressi dell'IA. Esaminiamo i modelli che stanno alimentando la discussione.
Sora di OpenAI#
OpenAI, l'azienda creatrice di ChatGPT, ha annunciato il 15 febbraio 2024 un modello di deep learning text-to-video all'avanguardia chiamato Sora. Sora è un generatore text-to-video in grado di creare video della durata di un minuto con elevata qualità visiva, basati sui prompt testuali degli utenti.
Ad esempio, osserva il prompt seguente.
“Un mondo di papercraft splendidamente realizzato, raffigurante una barriera corallina ricca di pesci colorati e creature marine.”
Ecco invece un fotogramma del video generato.

Fig. 4. Un fotogramma di un video generato da Sora.
L'architettura di Sora rende tutto questo possibile combinando modelli di diffusione per la generazione delle texture e modelli Transformer per la coerenza strutturale. Finora, l'accesso a Sora è stato concesso a red teamer e a un gruppo selezionato di artisti visivi, designer e registi per comprendere i rischi e raccogliere feedback.
Stable Diffusion 3 di Stability AI#
Stability AI ha annunciato l'arrivo di Stable Diffusion 3, un modello di generazione text-to-image, il 22 febbraio 2024. Il modello combina un'architettura Transformer di diffusione e il flow matching. Non è ancora stato pubblicato un documento tecnico, ma ci sono alcune funzionalità chiave da tenere d'occhio.

Fig. 5. Immagine generata in base al prompt: “Illustrazione anime epica di un mago in cima a una montagna di notte che lancia un incantesimo cosmico nel cielo scuro con la scritta "Stable Diffusion 3" realizzata con energia colorata” (Fonte)
L'ultimo modello di Stable Diffusion offre prestazioni, qualità delle immagini e accuratezza migliorate nella creazione di immagini con più soggetti. Stable Diffusion 3 offrirà inoltre una varietà di modelli da 800 milioni a 8 miliardi di parametri. Consentirà agli utenti di scegliere in base alle proprie esigenze specifiche di scalabilità e dettaglio.
Lumiere di Google#
Il 23 gennaio 2024, Google ha lanciato Lumiere, un modello di diffusione text-to-video. Lumiere utilizza un'architettura chiamata Space-Time-U-Net, o STUNet in breve. Questa aiuta Lumiere a comprendere dove si trovano gli elementi e come si muovono in un video. In questo modo può generare video fluidi e realistici.

Fig. 6. Un fotogramma di un video generato in base al prompt: “Panda suona l'ukulele a casa.”
Con la capacità di generare 80 fotogrammi per video, Lumiere sta superando i limiti e stabilendo nuovi standard per la qualità video nel settore dell'IA. Ecco alcune funzionalità di Lumiere:
- Da immagine a video: partendo da un'immagine e da un prompt, Lumiere può animare le immagini trasformandole in video.
- Generazione stilizzata: Lumiere può creare video in stili specifici utilizzando una singola immagine di riferimento.
- Cinemagraph: Lumiere può animare regioni specifiche all'interno di un'immagine per creare scene dinamiche, ad esempio un particolare oggetto in movimento mentre il resto della scena rimane statico.
- Video inpainting: può modificare parti di un video, ad esempio cambiando l'abbigliamento delle persone o alterando i dettagli dello sfondo.
Il futuro sembra essere già qui#
L'inizio del 2024 ha portato anche numerose innovazioni nell'IA che sembrano uscite da un film di fantascienza. Si sta lavorando su elementi che in passato avremmo definito impossibili. Il futuro non sembra più così lontano, come dimostrano le seguenti scoperte.
Neuralink di Elon Musk#
Il Neuralink di Elon Musk ha impiantato con successo il suo chip cerebrale wireless in un essere umano il 29 gennaio 2024. Si tratta di un enorme passo avanti verso la connessione del cervello umano ai computer. Elon Musk ha condiviso che il primo prodotto di Neuralink, chiamato ‘Telepathy’, è in fase di sviluppo.

Fig. 7. L'impianto Neuralink
L'obiettivo è consentire agli utenti, in particolare a chi ha perso la funzionalità degli arti, di controllare i dispositivi senza sforzo attraverso i propri pensieri. Le potenziali applicazioni vanno oltre la semplice comodità. Elon Musk immagina un futuro in cui le persone affette da paralisi possano comunicare facilmente.
HoloTile Floor di Disney#
Il 18 gennaio 2024, Walt Disney Imagineering ha presentato HoloTile Floor. È stato definito il primo tapis roulant omnidirezionale multipersona al mondo.

Fig. 8. L'Imagineer di Disney Lanny Smoot posa sulla sua ultima innovazione, il pavimento HoloTile.
Può muoversi sotto qualsiasi persona o oggetto come se fosse telecinesi, per offrire un'esperienza immersiva di realtà virtuale e aumentata. Puoi camminare in qualsiasi direzione ed evitare collisioni mentre lo utilizzi. HoloTile Floor di Disney può anche essere installato sui palcoscenici teatrali per danzare e muoversi in modi creativi.
Vision Pro di Apple#
Il 2 febbraio 2024, il visore Vision Pro di Apple, tanto atteso, è arrivato sul mercato. Include numerose funzionalità e applicazioni progettate per ridefinire l'esperienza di realtà virtuale e aumentata. Il visore Vision Pro si rivolge a un pubblico eterogeneo combinando intrattenimento, produttività e spatial computing. Apple ha annunciato con orgoglio che al momento del lancio oltre 600 app, dagli strumenti per la produttività ai giochi e ai servizi di intrattenimento, erano ottimizzate per Vision Pro.
Devin di Cognition#
Il 12 marzo 2024, Cognition ha rilasciato un assistente per l'ingegneria del software chiamato Devin. Devin è il primo tentativo al mondo di creare un ingegnere del software IA autonomo. A differenza dei tradizionali assistenti alla programmazione, che offrono suggerimenti o completano attività specifiche, Devin è progettato per gestire interi progetti di sviluppo software, dal concetto iniziale al completamento.
Può apprendere nuove tecnologie, creare e distribuire app complete, individuare e correggere bug, addestrare i propri modelli, contribuire a codebase open source e di produzione e persino svolgere veri incarichi di sviluppo su siti come Upwork.

Fig. 9. Confronto tra Devin e altri modelli.
Devin è stato valutato su SWE-bench, un benchmark impegnativo che chiede agli agenti di risolvere problemi reali di GitHub presenti in progetti open source come Django e scikit-learn. Ha risolto correttamente il 13,86% dei problemi dall'inizio alla fine, rispetto al precedente stato dell'arte dell'1,96%.
Menzioni d'onore#
Sono successe così tante cose che non è possibile trattarle tutte in questo articolo. Ecco però alcune altre menzioni d'onore.
- LATTE3D di NVIDIA, annunciato il 21 marzo 2024, è un modello di IA text-to-3D che crea istantaneamente rappresentazioni 3D a partire da prompt testuali.
- Il nuovo generatore text-to-video di Midjourney, anticipato dal CEO David Holz, ha iniziato l'addestramento a gennaio e dovrebbe essere lanciato presto.
- Per portare avanti la rivoluzione dei PC dotati di IA, Lenovo ha rilasciato il ThinkBook 13x con tecnologia E Ink Prism e laptop IA ad alte prestazioni l'8 gennaio 2024.
Resta aggiornato sulle tendenze dell'IA insieme a noi!#
L'inizio del 2024 ha visto progressi rivoluzionari nell'IA e numerose importanti pietre miliari tecnologiche. Ma questo è solo l'inizio di ciò che l'IA può fare. Se vuoi saperne di più sugli ultimi sviluppi dell'IA, Ultralytics è qui per aiutarti.
Dai un'occhiata al nostro repository GitHub per scoprire i nostri ultimi contributi nel campo della computer vision e dell'IA. Puoi anche consultare le nostre pagine dedicate alle soluzioni per vedere come l'IA viene utilizzata in settori come la produzione e la sanità.









