Transformer
Изучи архитектуру Transformer и механизм self-attention. Узнай, как они обеспечивают работу таких моделей ИИ, как RT-DETR и Ultralytics YOLO26, повышая точность.
Transformer — это архитектура глубокого обучения, использующая механизм, называемый self-attention, для обработки последовательных входных данных, например естественного языка или визуальных признаков. Впервые представленный исследователями Google в знаковой статье Attention Is All You Need, Transformer произвёл революцию в области искусственного интеллекта (AI), устранив ограничения последовательной обработки, характерные для более ранних рекуррентных нейронных сетей (RNNs). Вместо этого Transformers одновременно анализируют целые последовательности данных, обеспечивая масштабную параллелизацию и значительно ускоряя обучение на современном оборудовании, таком как GPUs.
Как работают Transformers#
Ключевым нововведением Transformer является механизм self-attention. Он позволяет модели оценивать важность различных частей входных данных относительно друг друга. Например, в предложении модель может определить, что слово "bank" связано со словом "money" сильнее, чем со словом "river", исходя из окружающего контекста.
Эта архитектура обычно состоит из двух основных компонентов:
- Энкодер: преобразует входные данные в информативное числовое представление, или эмбеддинг.
- Декодер: использует выход энкодера для формирования итогового результата, например переведённого предложения или предсказанной ограничивающей рамки.
В области компьютерного зрения (CV) модели обычно используют вариант под названием трансформер для компьютерного зрения (ViT). Вместо обработки текстовых токенов изображение разбивается на фрагменты фиксированного размера, например 16x16 пикселей. Эти фрагменты преобразуются в плоский формат и рассматриваются как последовательность, благодаря чему модель эффективнее улавливает "глобальный контекст" — взаимосвязи между удалёнными частями изображения — по сравнению со стандартной свёрточной нейронной сетью (CNN).
Transformers и связанные понятия#
Важно отличать архитектуру Transformer от связанных с ней терминов:
- Механизм внимания: это общее понятие, описывающее фокусировку на определённых частях данных. Transformer — это конкретная архитектура, полностью построенная на слоях внимания, тогда как другие модели могут использовать внимание лишь как небольшое дополнительное средство.
- Большая языковая модель (LLM): такие термины, как "GPT", относятся к конкретным моделям, обученным на огромных объёмах текста. Почти все современные LLM используют архитектуру Transformer в качестве базового механизма.
Практические применения#
Универсальность Transformers привела к их внедрению в различных отраслях:
-
Медицинская визуализация: в сфере AI в здравоохранении Transformers применяются для сложных задач, таких как анализ медицинских изображений. Их способность понимать глобальные пространственные взаимосвязи помогает обнаруживать малозаметные аномалии на МРТ- или КТ-сканах высокого разрешения, которые CNN, ориентированные на локальные признаки, могут пропустить.
-
Автономные системы: для автономных транспортных средств критически важно понимать траектории пешеходов и других транспортных средств. Transformers отлично справляются с анализом видео, отслеживая объекты в последовательных кадрах и прогнозируя их будущие перемещения для безопасной навигации.
Обнаружение объектов с помощью Transformers#
Хотя CNN традиционно доминировали в обнаружении объектов, модели на базе Transformer, такие как трансформер обнаружения объектов в реальном времени (RT-DETR), стали мощной альтернативой. RT-DETR сочетает скорость бэкбонов CNN с точностью декодирующих голов Transformer.
Однако чистые модели Transformer могут требовать значительных вычислительных ресурсов. Для многих периферийных приложений высокооптимизированные гибридные модели, такие как YOLO26, которые объединяют эффективные механизмы внимания с быстрым свёрточным вычислением, обеспечивают более удачный баланс скорости и точности. Ты можешь легко управлять обучением и развёртыванием этих моделей через Ultralytics Platform, которая упрощает рабочий процесс от аннотирования датасета до экспорта модели.
Пример на Python: использование RT-DETR#
Следующий пример показывает, как выполнять инференс с использованием модели на базе Transformer в пакете ultralytics. Этот код загружает предварительно обученную модель RT-DETR и обнаруживает объекты на изображении.
from ultralytics import RTDETR
# Load a pre-trained Real-Time Detection Transformer (RT-DETR) model
model = RTDETR("rtdetr-l.pt")
# Run inference on an image URL
# The model uses self-attention to identify objects with high accuracy
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results with bounding boxes
results[0].show()Для дальнейшего изучения математических основ документация PyTorch по слоям Transformer содержит подробное техническое объяснение, а руководство IBM по Transformers предлагает обзор с точки зрения бизнеса.









