Ultralytics YOLO27 :
Vision par IA

2024 commence avec une vague d’IA générative

Découvre les innovations passionnantes de l’IA du premier trimestre 2024. Nous aborderons des avancées comme Sora AI d’OpenAI, la puce cérébrale de Neuralink et les derniers LLM.

ABAbirami Vina10 min read
Les avancées de l’IA générative au début de 2024

La communauté de l’IA semble faire les gros titres presque chaque jour. Les premiers mois de 2024 ont été passionnants et riches en nouvelles innovations dans le domaine de l’IA. Des nouveaux grands modèles de langage puissants aux implants cérébraux humains, 2024 s’annonce remarquable.

Nous voyons l’IA transformer les secteurs d’activité, rendre l’information plus accessible et même faire ses premiers pas vers la fusion de nos esprits avec les machines. Revenons sur le premier trimestre 2024 et examinons de plus près les progrès réalisés dans le domaine de l’IA en seulement quelques mois.

Les LLM sont tendance#

Les grands modèles de langage (LLM), conçus pour comprendre, générer et manipuler le langage humain à partir de vastes quantités de données textuelles, ont occupé le devant de la scène au premier trimestre 2024. De nombreuses grandes entreprises technologiques ont publié leurs propres modèles LLM, chacun doté de capacités uniques. Le succès incroyable de modèles LLM précédents comme GPT-3 a inspiré cette tendance. Voici quelques-unes des sorties de modèles LLM les plus remarquables du début de 2024.

Claude 3 d’Anthropic#

Anthropic a publié Claude 3 le 14 mars 2024. Le modèle Claude 3 existe en trois versions : Opus, Sonnet et Haiku, chacune répondant à des marchés et des usages différents. Haiku, le modèle le plus rapide, est optimisé pour fournir des réponses rapides et simples. Sonnet équilibre vitesse et intelligence et cible les applications d’entreprise. Opus, la version la plus avancée, offre une intelligence et des capacités de raisonnement inégalées. Il est idéal pour les tâches complexes et l’obtention de performances de pointe.

Claude 3 offre de nombreuses fonctionnalités et améliorations avancées :

  • Conversations multilingues améliorées : capacités renforcées dans des langues comme l’espagnol, le japonais et le français.
  • Fonctionnalités avancées de vision : capable de gérer divers formats visuels.
  • Refus minimisés : fait preuve d’une meilleure compréhension avec moins de refus inutiles, ce qui témoigne d’une compréhension accrue du contexte.
  • Fenêtre de contexte étendue : elle offre une fenêtre de contexte de 200K, mais peut traiter des entrées de plus d’un million de tokens selon les besoins des clients.

Graphique montrant la compréhension contextuelle de Claude 3 par rapport aux versions précédentes

Fig. 1 Claude 3 est plus conscient du contexte que les versions précédentes.

DBRX de Databricks#

Databricks DBRX est un modèle LLM ouvert à usage général publié par Databricks le 27 mars 2024. DBRX obtient d’excellents résultats sur divers benchmarks, notamment en compréhension du langage, en programmation et en mathématiques. Il surpasse d’autres modèles établis tout en étant environ 40 % plus petit que des modèles similaires.

Comparaison de DBRX avec d’autres modèles

Fig. 2 Comparaison de DBRX avec d’autres modèles.

DBRX a été entraîné par prédiction du token suivant à l’aide d’une architecture de mélange d’experts (MoE) finement structurée, ce qui explique les améliorations significatives observées au niveau des performances d’entraînement et d’inférence. Son architecture permet au modèle de prédire plus précisément le mot suivant d’une séquence en consultant un ensemble diversifié de sous-modèles spécialisés (les « experts »). Ces sous-modèles sont efficaces pour gérer différents types d’informations ou de tâches.

Gemini 1.5 de Google#

Google a présenté Gemini 1.5, un modèle d’IA multimodal économe en calcul capable d’analyser d’importants volumes de données textuelles, vidéo et audio, le 15 février 2024. Le dernier modèle est plus avancé en matière de performances, d’efficacité et de capacités. L’une des principales fonctionnalités de Gemini 1.5 est sa percée dans la compréhension des contextes longs. Le modèle est capable de gérer systématiquement jusqu’à 1 million de tokens. Les capacités de Gemini 1.5 reposent également sur une nouvelle architecture fondée sur un mélange d’experts (MoE).

Comparaison des longueurs de contexte de modèles LLM populaires

Fig. 3 Comparaison des longueurs de contexte de modèles LLM populaires

Voici quelques-unes des fonctionnalités les plus intéressantes de Gemini 1.5 :

  • Gestion améliorée des données : permet de téléverser directement de volumineux fichiers PDF, des dépôts de code ou de longues vidéos comme invites. Le modèle peut raisonner entre plusieurs modalités et produire du texte.
  • Téléversement et requêtes portant sur plusieurs fichiers : les développeurs peuvent désormais téléverser plusieurs fichiers et poser des questions.
  • Utilisable pour différentes tâches : il est optimisé pour s’adapter à diverses tâches et affiche des améliorations dans des domaines comme les mathématiques, les sciences, le raisonnement, le multilinguisme, la compréhension vidéo et le code.

Des visuels époustouflants grâce à l’IA#

Le premier trimestre 2024 a révélé des modèles d’IA générative capables de créer des visuels si réalistes qu’ils ont suscité des débats sur l’avenir des réseaux sociaux et les progrès de l’IA. Examinons les modèles qui alimentent cette conversation.

Sora d’OpenAI#

OpenAI, le créateur de ChatGPT, a annoncé le 15 février 2024 un modèle d’apprentissage profond de pointe de conversion texte-vidéo appelé Sora. Sora est un générateur texte-vidéo capable de produire des vidéos d’une durée pouvant atteindre une minute, avec une grande qualité visuelle, à partir d’invites textuelles fournies par l’utilisateur.

Par exemple, regarde l’invite suivante.

« Un monde en papier magnifiquement rendu représentant un récif corallien, foisonnant de poissons et de créatures marines colorés. »

Voici une image extraite de la vidéo générée.

Une image extraite d’une vidéo générée par Sora d’OpenAI

Fig. 4 Une image extraite d’une vidéo générée par Sora.

L’architecture de Sora rend cela possible en combinant des modèles de diffusion pour générer les textures et des modèles Transformer pour assurer la cohérence structurelle. Jusqu’à présent, l’accès à Sora a été accordé à des membres de red teams ainsi qu’à un groupe restreint d’artistes visuels, de designers et de cinéastes afin de comprendre les risques et de recueillir leurs retours.

Stable Diffusion 3 de Stability AI#

Stability AI a annoncé l’arrivée de Stable Diffusion 3, un modèle de génération texte-image, le 22 février 2024. Le modèle combine une architecture Transformer de diffusion et l’appariement de flux. Aucun article technique n’a encore été publié, mais plusieurs fonctionnalités clés méritent d’être surveillées.

Image générée par Stable Diffusion 3 représentant un sorcier lançant un sort cosmique

Fig. 5. Image produite à partir de l’invite : « Illustration anime épique représentant un sorcier au sommet d’une montagne, la nuit, lançant un sort cosmique dans le ciel sombre affichant « Stable Diffusion 3 », composé d’une énergie colorée » (Source)

Le dernier modèle de Stable Diffusion offre de meilleures performances, une meilleure qualité d’image et une meilleure précision lors de la création d’images comportant plusieurs sujets. Stable Diffusion 3 proposera également une variété de modèles comptant de 800 millions à 8 milliards de paramètres. Les utilisateurs pourront choisir en fonction de leurs besoins spécifiques en matière d’évolutivité et de niveau de détail.

Lumiere de Google#

Le 23 janvier 2024, Google a lancé Lumiere, un modèle de diffusion texte-vidéo. Lumiere utilise une architecture appelée Space-Time-U-Net, ou STUNet en abrégé. Elle aide Lumiere à comprendre où se trouvent les éléments et comment ils se déplacent dans une vidéo. Il peut ainsi générer des vidéos fluides et réalistes.

Une image extraite d’une vidéo générée par Lumiere de Google montrant un panda jouant du ukulélé

Fig. 6 Une image extraite d’une vidéo générée à partir de l’invite : « Panda joue du ukulélé à la maison. »

Grâce à sa capacité à générer 80 images par vidéo, Lumiere repousse les limites et établit de nouvelles normes en matière de qualité vidéo dans le domaine de l’IA. Voici quelques fonctionnalités de Lumiere :

  • Image vers vidéo : à partir d’une image et d’une invite, Lumiere peut animer des images pour créer des vidéos.
  • Génération stylisée : Lumiere peut créer des vidéos dans des styles spécifiques à partir d’une seule image de référence.
  • Cinemagraphs : Lumiere peut animer des régions spécifiques d’une image pour créer des scènes dynamiques, comme un objet particulier en mouvement tandis que le reste de la scène demeure statique.
  • Inpainting vidéo : il peut modifier certaines parties d’une vidéo, par exemple changer la tenue des personnes ou modifier des détails de l’arrière-plan.

Le futur semble être là#

Le début de 2024 a également apporté de nombreuses innovations en matière d’IA qui semblent tout droit sorties d’un film de science-fiction. Des choses que nous aurions auparavant considérées comme impossibles sont désormais en cours de développement. Avec les découvertes suivantes, le futur ne semble plus si lointain.

Le Neuralink d’Elon Musk a implanté avec succès sa puce cérébrale sans fil chez un humain le 29 janvier 2024. Il s’agit d’une avancée majeure vers la connexion des cerveaux humains aux ordinateurs. Elon Musk a indiqué que le premier produit de Neuralink, baptisé « Telepathy », était en préparation.

L’implant Neuralink

Fig. 7 L’implant Neuralink

L’objectif est de permettre aux utilisateurs, en particulier à ceux qui ont perdu l’usage de leurs membres, de contrôler des appareils sans effort par la pensée. Les applications potentielles vont au-delà du simple confort. Elon Musk imagine un avenir où les personnes paralysées pourront communiquer facilement.

Le sol HoloTile de Disney#

Le 18 janvier 2024, Walt Disney Imagineering a dévoilé le sol HoloTile. Celui-ci a été présenté comme le premier tapis roulant au monde permettant à plusieurs personnes de se déplacer dans toutes les directions.

L’Imagineer de Disney Lanny Smoot sur le sol HoloTile

Fig. 8. L’Imagineer de Disney Lanny Smoot pose sur sa dernière innovation, le sol HoloTile.

Il peut se déplacer sous n’importe quelle personne ou n’importe quel objet, comme par télékinésie, pour offrir une expérience immersive de réalité virtuelle et augmentée. Tu peux marcher dans n’importe quelle direction et éviter les collisions lorsque tu te trouves dessus. Le sol HoloTile de Disney peut également être installé sur des scènes de théâtre pour danser et se déplacer de manière créative.

Vision Pro d’Apple#

Le 2 février 2024, le casque Vision Pro très attendu d’Apple est arrivé sur le marché. Il propose de nombreuses fonctionnalités et applications conçues pour redéfinir l’expérience de réalité virtuelle et augmentée. Le casque Vision Pro s’adresse à un public varié en combinant divertissement, productivité et informatique spatiale. Apple a fièrement annoncé que plus de 600 applications, allant des outils de productivité aux jeux et services de divertissement, étaient optimisées pour Vision Pro lors de son lancement.

Devin de Cognition#

Le 12 mars 2024, Cognition a publié un assistant d’ingénierie logicielle appelé Devin. Devin est la première tentative au monde de créer un ingénieur logiciel IA autonome. Contrairement aux assistants de programmation traditionnels qui proposent des suggestions ou accomplissent des tâches spécifiques, Devin est conçu pour gérer des projets complets de développement logiciel, de l’idée initiale à la finalisation.

Il peut apprendre de nouvelles technologies, développer et déployer des applications complètes, trouver et corriger des bugs, entraîner ses propres modèles, contribuer à des bases de code open source et de production, et même accepter de véritables missions de développement sur des sites comme Upwork.

Comparaison de Devin avec d’autres modèles

Fig. 9 Comparaison de Devin avec d’autres modèles.

Devin a été évalué sur SWE-bench, un benchmark exigeant qui demande aux agents de résoudre des problèmes GitHub réels rencontrés dans des projets open source comme Django et scikit-learn. Il a résolu correctement 13,86 % des problèmes de bout en bout, contre 1,96 % pour la meilleure performance précédente.

Mentions honorables#

Il s’est passé tellement de choses qu’il est impossible de tout couvrir dans cet article. Voici néanmoins quelques autres mentions honorables.

  • LATTE3D de NVIDIA, annoncé le 21 mars 2024, est un modèle d’IA texte-3D qui crée instantanément des représentations 3D à partir d’invites textuelles.
  • Le nouveau générateur texte-vidéo de Midjourney, annoncé par son PDG David Holz, a commencé son entraînement en janvier et devrait être lancé prochainement.
  • Pour faire progresser la révolution des PC dotés d’IA, Lenovo a lancé le ThinkBook 13x avec la technologie E Ink Prism et des ordinateurs portables hautes performances dotés d’IA le 8 janvier 2024.

Reste au fait des tendances de l’IA avec nous !#

Le début de 2024 a été marqué par des avancées révolutionnaires dans le domaine de l’IA et par de nombreux jalons technologiques majeurs. Mais ce n’est que le début de ce que l’IA peut accomplir. Si tu veux en savoir plus sur les dernières avancées de l’IA, Ultralytics est là pour t’aider.

Consulte notre dépôt GitHub pour découvrir nos dernières contributions en vision par ordinateur et en IA. Tu peux également consulter nos pages de solutions pour voir comment l’IA est utilisée dans des secteurs comme la fabrication et les soins de santé.

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique