YOLO Vision 2026:
Назад к глоссарию Ultralytics

Longformer

Изучи архитектуру Longformer для эффективной обработки длинных последовательностей данных. Узнай, как разреженное внимание (sparse attention) преодолевает ограничения памяти для NLP и компьютерного зрения.

Longformer — это специализированный тип архитектуры Deep Learning, разработанный для эффективной обработки длинных последовательностей данных и преодоления ограничений традиционных моделей. Первоначально созданный для решения проблем стандартных Transformers, которые обычно испытывают трудности с последовательностями длиннее 512 токенов из-за ограничений памяти, Longformer использует модифицированный attention mechanism. Снижая вычислительную сложность с квадратичной до линейной, эта архитектура позволяет системам искусственного интеллекта анализировать целые документы, длинные стенограммы или сложные генетические последовательности за один проход без усечения входных данных.

Проблема «узкого места» внимания#

Чтобы понять значение Longformer, важно рассмотреть ограничения предшественников, таких как BERT и ранние модели GPT-3. Стандартные трансформеры используют операцию «саморазделания внимания» («self-attention»), при которой каждый токен (слово или часть слова) соотносится с каждым другим токеном в последовательности. Это создает квадратичные вычислительные затраты: удвоение длины последовательности вчетверо увеличивает объем памяти, требуемый на GPU. Следовательно, большинство стандартных моделей налагают строгий лимит на размер входных данных, часто заставляя специалистов по работе с данными разбивать документы на более мелкие, несвязанные сегменты, что приводит к потере контекста.

Longformer решает эту проблему путем внедрения разреженного внимания (Sparse Attention). Вместо полных связей «все со всеми» он использует комбинацию локального внимания в окне и глобального внимания:

  • Sliding Window Attention: Каждый токен соотносится только со своими ближайшими соседями. Это позволяет улавливать локальный контекст и синтаксическую структуру, подобно тому, как Convolutional Neural Network (CNN) обрабатывает изображения.
  • Dilated Sliding Window: Чтобы увеличить receptive field без увеличения объема вычислений, в окно можно внедрить зазоры, позволяющие модели заглядывать «дальше» в текст.
  • Global Attention: Определенные заранее выбранные токены (такие как токен классификации [CLS]) соотносятся со всеми другими токенами в последовательности, и все токены соотносятся с ними. Это гарантирует, что модель сохраняет понимание всего ввода на высоком уровне для таких задач, как text summarization.

Реальные приложения#

Возможность обрабатывать тысячи токенов одновременно открывает новые возможности для Natural Language Processing (NLP) и смежных областей.

Анализ юридических и медицинских документов#

В таких отраслях, как юриспруденция и здравоохранение, документы редко бывают короткими. Юридический контракт или история болезни пациента могут занимать десятки страниц. Традиционные Large Language Models (LLMs) требуют фрагментации таких документов, что потенциально может привести к потере важнейших зависимостей между пунктом на странице 1 и определением на странице 30. Longformer позволяет выполнять Named Entity Recognition (NER) и классификацию по всему документу одновременно, гарантируя, что глобальный контекст влияет на интерпретацию конкретных терминов.

Ответы на вопросы по длинным текстам (Long-Form Question Answering, QA)#

Стандартные системы Question Answering часто испытывают трудности, когда для ответа на вопрос требуется синтезировать информацию, распределенную по длинной статье. Храня весь текст в памяти, модели на базе Longformer могут выполнять многоэтапные рассуждения (multi-hop reasoning), соединяя факты, найденные в разных абзацах, для формирования исчерпывающего ответа. Это критически важно для систем автоматизированной техподдержки и инструментов академических исследований.

Разграничение ключевых терминов#

  • Longformer против Transformer: Стандартный Transformer использует полное внимание $N^2$, что делает его точным, но вычислительно затратным для длинных входных данных. Longformer использует разреженное внимание $N$, жертвуя незначительной долей теоретической емкости ради огромного прироста эффективности, что позволяет использовать входы размером 4096 токенов и более.
  • Longformer против Transformer-XL: Хотя обе модели работают с длинными последовательностями, Transformer-XL опирается на механизм рекуррентности (кэширование предыдущих состояний) для запоминания прошлых сегментов. Longformer обрабатывает длинную последовательность изначально за один проход, что упрощает параллельное обучение на таких платформах, как Ultralytics Platform.
  • Longformer против BigBird: Это очень похожие архитектуры, разработанные примерно в одно и то же время. Обе используют механизмы разреженного внимания для достижения линейного масштабирования. BigBird в дополнение к скользящим окнам вводит специальный компонент случайного внимания.

Концепции реализации#

Хотя Longformer представляет собой архитектуру, а не конкретную функцию, понимание того, как подготавливать данные для моделей с длинным контекстом, имеет решающее значение. В современных фреймворках, таких как PyTorch, это часто связано с управлением embeddings, которые превышают стандартные лимиты.

Следующий пример демонстрирует создание фиктивного тензора входных данных для сценария с длинным контекстом, противопоставляя его типичному размеру, используемому в стандартных моделях обнаружения, таких как YOLO26.

import torch

# Standard BERT-like models typically cap at 512 tokens
standard_input = torch.randint(0, 30000, (1, 512))

# Longformer architectures can handle significantly larger inputs (e.g., 4096)
# This allows the model to "see" the entire sequence at once.
long_context_input = torch.randint(0, 30000, (1, 4096))

print(f"Standard Input Shape: {standard_input.shape}")
print(f"Long Context Input Shape: {long_context_input.shape}")

# In computer vision, a similar concept applies when processing high-res images
# without downsampling, preserving fine-grained details.

Значение для компьютерного зрения#

Хотя изначально Longformer был разработан для текста, принципы, лежащие в его основе, повлияли на Computer Vision. Концепция ограничения внимания локальной окрестностью аналогична локализованным операциям в визуальных задачах. Модели Vision Transformers (ViT) сталкиваются с аналогичными проблемами масштабирования при работе с изображениями высокого разрешения, поскольку количество пикселей (или патчей) может быть огромным. Методы, заимствованные из разреженного внимания Longformer, используются для повышения эффективности image classification и object detection, помогая таким моделям, как YOLO26, поддерживать высокую скорость при обработке детальных визуальных данных.

Для дальнейшего изучения особенностей архитектуры в original Longformer paper от AllenAI приведены подробные бенчмарки и теоретические обоснования. Кроме того, эффективное обучение столь крупных моделей часто выигрывает от применения таких методов, как mixed precision и современные optimization algorithms.

Explore solutions

Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения