YOLO Vision 2026:
Назад к глоссарию Ultralytics

Vision Transformer (ViT)

Исследуй мощь Vision Transformer (ViT). Узнай, как механизмы self-attention и разбиение на патчи революционизируют компьютерное зрение, выходя за рамки CNN, вместе с Ultralytics.

Vision Transformer (ViT) — это архитектура глубокого обучения, которая адаптирует механизмы самовнимания (self-attention), изначально разработанные для Natural Language Processing (NLP), для решения визуальных задач. В отличие от традиционной Convolutional Neural Network (CNN), которая обрабатывает изображения через иерархию локальных сеток пикселей, ViT рассматривает изображение как последовательность дискретных патчей. Этот подход популяризировал знаковый исследовательский труд "An Image is Worth 16x16 Words", который продемонстрировал, что чистые архитектуры трансформеров способны достигать передовой производительности в computer vision (CV) без использования сверточных слоев. Задействуя глобальное внимание, ViT способны улавливать долгосрочные зависимости по всему изображению начиная с самого первого слоя.

Как работают Vision Transformers#

Фундаментальная инновация ViT заключается в том, как модель структурирует входные данные. Чтобы сделать изображение совместимым со стандартным Transformer, модель разбивает визуальную информацию на последовательность векторов, имитируя то, как языковая модель обрабатывает предложение из слов.

  1. Токенизация патчей: Входное изображение делится на сетку квадратов фиксированного размера, обычно 16х16 пикселей. Каждый квадрат сглаживается в вектор, фактически превращаясь в визуальный token.

  2. Линейная проекция: Эти плоские патчи пропускаются через обучаемый линейный слой для создания плотных embeddings. Этот шаг сопоставляет исходные значения пикселей с многомерным пространством, которое модель может обрабатывать.

  3. Позиционное кодирование: Поскольку архитектура обрабатывает последовательности параллельно и не имеет встроенного понимания порядка или пространства, к эмбеддингам патчей добавляются обучаемые positional encodings. Это позволяет модели сохранять пространственную информацию о том, какому месту в исходном изображении принадлежит каждый патч.

  4. Механизм самовнимания: Последовательность поступает в энкодер Transformer, где self-attention позволяет каждому патчу взаимодействовать с любым другим патчем одновременно. Это позволяет сети изучать глобальный контекст, понимая, как пиксель в левом верхнем углу связан с пикселем в правом нижнем.

  5. Классификационная голова: Для таких задач, как image classification, перед последовательностью часто добавляется специальный «класс-токен». Конечное выходное состояние этого токена служит совокупным представлением изображения, которое затем передается в классификатор, такой как multilayer perceptron (MLP).

Vision Transformers против CNN#

Хотя обе архитектуры нацелены на понимание визуальных данных, они существенно различаются своей операционной философией. CNN обладают сильным «индуктивным смещением», известным как инвариантность к сдвигу, что означает их изначальное предположение о важности локальных признаков (таких как края и текстуры) независимо от их положения. Это делает CNN крайне эффективными в плане данных и результативными на меньших datasets.

И наоборот, у Vision Transformers меньше смещения, специфичного для изображений. Им приходится изучать пространственные отношения с нуля, используя огромные объемы training data, такие как датасеты JFT-300M или полный ImageNet. Хотя это делает обучение более ресурсоемким, это позволяет ViT масштабироваться удивительно хорошо: при достаточном количестве данных и compute power они могут превосходить CNN за счет улавливания сложных глобальных структур, которые локальные свертки могут упустить.

Реальные приложения#

Способность понимать глобальный контекст делает ViT особенно полезными для сложных, критически важных сред.

  • Анализ медицинских изображений: В healthcare AI ViT применяются для анализа сканирований высокого разрешения, таких как МРТ или гистопатологические слайды. Например, при tumor detection ViT может сопоставлять тонкие текстурные аномалии в ткани с более широкими структурными изменениями по всему слайду, выявляя злокачественные паттерны, которые локальная обработка может не заметить.
  • Спутниковые снимки и дистанционное зондирование: ViT превосходно справляются с satellite image analysis, где связи между объектами простираются на большие расстояния. Например, сопоставление зоны вырубки лесов с удаленной лесовозной дорогой требует понимания «общей картины» ландшафта — задачи, в которой глобальное внимание ViT превосходит ограниченное рецептивное поле стандартных CNN.

Использование Transformers вместе с Ultralytics#

Библиотека ultralytics поддерживает архитектуры на базе Transformer, наиболее заметной из которых является RT-DETR (Real-Time Detection Transformer). В то время как флагманская YOLO26 часто предпочитается за баланс скорости и точности на граничных устройствах (edge devices), RT-DETR предлагает мощную альтернативу для сценариев, где приоритетом является глобальный контекст.

Следующий пример на Python демонстрирует, как загрузить предварительно обученную модель на базе Transformer и запустить инференс:

from ultralytics import RTDETR

# Load a pre-trained RT-DETR model (Vision Transformer-based)
model = RTDETR("rtdetr-l.pt")

# Run inference on an image source
# The model uses self-attention to detect objects globally
results = model("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

Взгляд в будущее#

Исследования стремительно развиваются, чтобы снизить высокие вычислительные затраты ViT. Такие методы, как FlashAttention, делают эти модели быстрее и эффективнее с точки зрения памяти. Кроме того, становятся популярными гибридные архитектуры, объединяющие эффективность CNN и внимание трансформеров. Для команд, стремящихся управлять этими продвинутыми рабочими процессами, Ultralytics Platform предлагает унифицированную среду для аннотирования данных, обучения сложных моделей через облако и их развертывания на различных эндпоинтах.

Explore solutions

Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения