YOLO Vision 2026 :
Retour au glossaire Ultralytics

Longformer

Explore l'architecture Longformer pour traiter efficacement les longues séquences de données. Apprends comment l'attention éparse surmonte les limites de mémoire pour le NLP et la vision par ordinateur.

Le Longformer est un type spécialisé d'architecture de Deep Learning conçu pour traiter efficacement de longues séquences de données, surmontant ainsi les limitations des modèles traditionnels. Initialement introduit pour répondre aux contraintes des Transformers standards, qui peinent généralement avec des séquences de plus de 512 jetons en raison de restrictions de mémoire, le Longformer utilise un mécanisme d'attention modifié. En réduisant la complexité computationnelle de quadratique à linéaire, cette architecture permet aux systèmes d'IA d'analyser des documents entiers, des transcriptions de grande longueur ou des séquences génétiques complexes en un seul passage sans tronquer l'entrée.

Le problème du goulot d'étranglement de l'attention#

Pour comprendre l'importance du Longformer, il est essentiel d'examiner les limites de prédécesseurs tels que BERT et les premiers modèles GPT-3. Les transformers standards utilisent une opération d'« auto-attention » où chaque jeton (mot ou partie de mot) interagit avec tous les autres jetons de la séquence. Cela engendre un coût de calcul quadratique ; doubler la longueur de la séquence quadruple la mémoire requise sur le GPU. Par conséquent, la plupart des modèles standards imposent une limite stricte sur la taille des entrées, forçant souvent les data scientists à découper les documents en segments plus petits et déconnectés, ce qui entraîne une perte de contexte.

Le Longformer résout ce problème en introduisant l'Attention clairsemée (Sparse Attention). Au lieu d'une connexion complète de type tous-à-tous, il utilise une combinaison d'attention locale par fenêtre et d'attention globale :

  • Attention par fenêtre glissante : Chaque jeton n'interagit qu'avec ses voisins immédiats. Cela permet de capturer le contexte local et la structure syntaxique, de la même manière qu'un Convolutional Neural Network (CNN) traite les images.
  • Fenêtre glissante dilatée : Pour augmenter le champ récepteur sans accroître les calculs, la fenêtre peut intégrer des espaces, permettant au modèle de voir « plus loin » dans le texte.
  • Attention globale : Des jetons spécifiques pré-sélectionnés (tels que le jeton de classification [CLS]) interagissent avec tous les autres jetons de la séquence, et tous les jetons interagissent avec eux. Cela garantit que le modèle conserve une compréhension de haut niveau de l'ensemble de l'entrée pour des tâches telles que la synthèse de texte.

Applications concrètes#

La capacité à traiter des milliers de jetons simultanément ouvre de nouvelles perspectives pour le Natural Language Processing (NLP) et au-delà.

Analyse de documents juridiques et médicaux#

Dans des secteurs tels que le droit et la santé, les documents sont rarement courts. Un contrat juridique ou le dossier médical d'un patient peut s'étendre sur des dizaines de pages. Les Large Language Models (LLMs) traditionnels exigeraient que ces documents soient fragmentés, risquant ainsi de manquer des dépendances cruciales entre une clause à la page 1 et une définition à la page 30. Le Longformer permet d'effectuer une Named Entity Recognition (NER) et une classification sur l'ensemble du document en une seule fois, garantissant que le contexte global influence l'interprétation de termes spécifiques.

Question-Réponse (QA) sur de longs textes#

Les systèmes de Question Answering standards peinent souvent lorsque la réponse à une question nécessite de synthétiser des informations réparties dans un article long. En conservant le texte intégral en mémoire, les modèles basés sur le Longformer peuvent effectuer un raisonnement à sauts multiples (multi-hop), en connectant des faits trouvés dans différents paragraphes pour générer une réponse complète. C'est un point critique pour les systèmes de support technique automatisés et les outils de recherche académique.

Différencier les termes clés#

  • Longformer vs Transformer : Le Transformer standard utilise une attention complète $N^2$, ce qui le rend précis mais coûteux en calculs pour les entrées longues. Le Longformer utilise une attention creuse (sparse) $N$, échangeant une quantité négligeable de capacité théorique contre d'immenses gains d'efficacité, permettant des entrées de 4 096 jetons ou plus.
  • Longformer vs Transformer-XL : Bien que tous deux gèrent de longues séquences, le Transformer-XL s'appuie sur un mécanisme de récurrence (mise en cache des états précédents) pour se souvenir des segments passés. Le Longformer traite la séquence longue de manière native en une seule fois, ce qui simplifie l'entraînement parallèle sur des plateformes telles que l'Ultralytics Platform.
  • Longformer vs BigBird : Ce sont des architectures très similaires développées à peu près à la même époque. Toutes deux utilisent des mécanismes d'attention creuse pour atteindre une mise à l'échelle linéaire. BigBird introduit un composant d'attention aléatoire spécifique en plus des fenêtres glissantes.

Concepts d'implémentation#

Bien que le Longformer soit une architecture plutôt qu'une fonction spécifique, il est crucial de comprendre comment préparer les données pour les modèles à contexte long. Dans les frameworks modernes tels que PyTorch, cela implique souvent la gestion d'embeddings qui dépassent les limites standard.

L'exemple suivant démontre la création d'un tenseur d'entrée fictif pour un scénario à contexte long, en le contrastant avec la taille typique utilisée dans les modèles de détection standard comme YOLO26.

import torch

# Standard BERT-like models typically cap at 512 tokens
standard_input = torch.randint(0, 30000, (1, 512))

# Longformer architectures can handle significantly larger inputs (e.g., 4096)
# This allows the model to "see" the entire sequence at once.
long_context_input = torch.randint(0, 30000, (1, 4096))

print(f"Standard Input Shape: {standard_input.shape}")
print(f"Long Context Input Shape: {long_context_input.shape}")

# In computer vision, a similar concept applies when processing high-res images
# without downsampling, preserving fine-grained details.

Pertinence pour la vision par ordinateur#

Bien qu'initialement conçu pour le texte, les principes du Longformer ont influencé le Computer Vision. Le concept de limitation de l'attention à un voisinage local est analogue aux opérations localisées dans les tâches visuelles. Les Vision Transformers (ViT) font face à des problèmes de mise à l'échelle similaires avec des images haute résolution car le nombre de pixels (ou de patchs) peut être énorme. Des techniques dérivées de l'attention creuse du Longformer sont utilisées pour améliorer l'efficacité de l'classification d'images et de la détection d'objets, aidant des modèles comme YOLO26 à maintenir des vitesses élevées tout en traitant des données visuelles détaillées.

Pour en savoir plus sur les spécificités architecturales, le document original sur le Longformer par AllenAI fournit des benchmarks approfondis et des justifications théoriques. De plus, l'entraînement efficace de si grands modèles bénéficie souvent de techniques telles que la précision mixte et des algorithmes d'optimisation avancés.

Explore solutions

Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble le futur de l'IA !

Commence ton aventure avec le futur de l'apprentissage automatique