Sécurité prête pour l'entreprise : Conforme ISO 27001 + SOC 2 Type I.
Retour au glossaire Ultralytics

Medusa Heads

Découvre comment les têtes Medusa accélèrent le décodage des LLM. Apprends comment cette architecture multi-têtes permet la prédiction parallèle de jetons pour réduire la latence dans l'inférence IA.

En apprentissage automatique moderne, en particulier dans l'architecture des large language models, ce terme désigne un cadre de décodage innovant conçu pour accélérer la génération de texte. S'inspirant de la créature mythologique aux multiples serpents pour cheveux, ces architectures utilisent plusieurs têtes de décodage attachées à un seul modèle de base gelé. Cette structure permet au réseau de prédire plusieurs jetons suivants simultanément plutôt que de compter strictement sur une génération autorégressive étape par étape. En esquissant plusieurs possibilités futures en parallèle, les systèmes peuvent réduire considérablement la inference latency sans nécessiter de modèle d'esquisse séparé et plus petit.

Comprendre l'architecture#

La génération de langage traditionnelle repose sur un processus autorégressif, où un modèle prédit le mot suivant en fonction de la séquence des mots précédents. Bien que précis, ce traitement séquentiel crée des goulots d'étranglement dans la vitesse de calcul, un défi bien documenté dans de récentes Stanford NLP Group research. Le cadre Medusa contourne cela en ajoutant des têtes de réseau de neurones supplémentaires au dernier état caché du modèle.

Chacune de ces têtes supplémentaires est entraînée à prédire un jeton à une position future différente. Pendant la génération, ces têtes créent un arbre de séquences de jetons probables. Un mécanisme d'attention d'arbre vérifie ensuite ces séquences simultanément. Si les prédictions correspondent aux attentes du modèle de base, plusieurs jetons sont acceptés en une seule passe avant. Cette technique est une forme hautement efficace de speculative decoding, et les détails sur ses mécanismes fondamentaux peuvent être explorés dans de modernes academic papers on arXiv.

Applications concrètes en IA#

Les capacités de prédiction parallèle de cette architecture sont particulièrement précieuses dans les scénarios nécessitant un real-time inference rapide et à volume élevé.

  • Agents conversationnels en temps réel : Les bots de service client avancés alimentés par les OpenAI's generative models ou le Anthropic's Claude framework s'appuient sur des réponses à faible latence pour maintenir un flux conversationnel naturel. En prédéterminant plusieurs jetons à la fois, ces agents peuvent diffuser du texte aux utilisateurs beaucoup plus rapidement.
  • Outils d'autocomplétion de code : Les environnements de programmation assistés par IA utilisent ces architectures multi-têtes pour suggérer instantanément des lignes entières ou des blocs de code. Comme le code possède des structures de syntaxe hautement prévisibles, les têtes parallèles peuvent esquisser précisément des fermetures de fonctions ou des boucles, améliorant ainsi l'efficacité du développeur.

Distinction entre les termes architecturaux connexes#

Bien qu'ils partagent des similitudes conceptuelles, il est important de distinguer ce terme spécifique au TAL des composants structurels présents dans les systèmes de computer vision.

  • Detection Head : Dans les modèles de vision comme le pointe de technologie Ultralytics YOLO26, la « tête » fait référence aux couches finales du réseau responsables de la sortie de prédictions spatiales, telles que les boîtes englobantes et les probabilités de classe pour object detection.
  • Tête Medusa : Inversement, ce terme s'applique spécifiquement au traitement automatique du langage naturel et aux vision-language models où l'objectif est de prédire des jetons séquentiels en parallèle pour contourner les goulots d'étranglement autorégressifs.

Mise en œuvre de structures multi-têtes#

Qu'il s'agisse de construire des têtes de prédiction spatiale pour la vision ou des prédicteurs de jetons parallèles pour le texte, les structures multi-têtes partagent des principes de mise en œuvre similaires utilisant des bibliothèques de bas niveau comme PyTorch. L'extrait suivant montre comment construire un module multi-têtes simple qui traite une représentation de caractéristiques partagée à travers plusieurs couches parallèles.

import torch
import torch.nn as nn


class ParallelHeads(nn.Module):
    def __init__(self, hidden_dim, num_heads):
        super().__init__()
        # Shared backbone representation
        self.base = nn.Linear(128, hidden_dim)
        # Multiple parallel heads predicting concurrent states
        self.heads = nn.ModuleList([nn.Linear(hidden_dim, 50) for _ in range(num_heads)])

    def forward(self, x):
        features = torch.relu(self.base(x))
        # Return predictions from all heads simultaneously
        return [head(features) for head in self.heads]


model = ParallelHeads(hidden_dim=64, num_heads=3)
predictions = model(torch.randn(1, 128))

Pour rationaliser le développement et le déploiement de modèles complexes à plusieurs couches dans des environnements de production, les développeurs utilisent souvent des systèmes complets comme la Ultralytics Platform. Cela permet aux équipes de gérer les model deploymentoptions de manière transparente, garantissant que les architectures optimisées pour la vitesse — que ce soit par le décodage spéculatif ou des têtes de détection de vision efficaces — fonctionnent de manière fiable dans le monde réel. Pour obtenir d'autres perspectives sur l'optimisation des flux de travail d'apprentissage automatique, tu peux consulter les publications de Google DeepMind ou explorer les actes dans la ACM Digital Library.

Explore solutions

Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble le futur de l'IA !

Commence ton aventure avec le futur de l'apprentissage automatique