Inference Engine
Узнай, как механизм инференса оптимизирует модели машинного обучения, такие как Ultralytics YOLO26, для развёртывания в реальном времени. Изучи советы по повышению производительности Edge AI уже сегодня.
Механизм инференса — это специализированный программный компонент, предназначенный для выполнения обученных моделей машинного обучения и формирования прогнозов на основе новых данных. В отличие от этапа обучения, сосредоточенного на выявлении закономерностей с помощью ресурсоёмких вычислительных процессов, таких как обратное распространение ошибки, механизм инференса оптимизирован исключительно для операционного этапа, известного как развёртывание модели. Его основная цель — выполнять вычисления максимально эффективно, минимизируя задержку инференса и увеличивая пропускную способность на целевом оборудовании, будь то масштабируемый облачный сервер или работа com батареей устройство пограничного ИИ. Устраняя накладные расходы, необходимые для обучения, такие механизмы позволяют сложным нейронным сетям работать в приложениях реального времени.
Как механизмы инференса оптимизируют производительность#
Переход от среды обучения к механизму инференса обычно включает несколько этапов оптимизации для упрощения структуры модели. Поскольку модели больше не нужно обучаться, механизм может отбросить данные, необходимые для обновления градиентов, фактически зафиксировав веса модели. Распространённые методы, используемые механизмами инференса, включают объединение слоёв, при котором несколько операций объединяются в один этап для сокращения обращений к памяти, и квантизацию модели, которая преобразует веса из высокоточных форматов с плавающей запятой в целочисленные форматы с более низкой точностью (например, INT8).
Эти оптимизации позволяют передовым архитектурам, таким как Ultralytics YOLO26, работать с невероятно высокой скоростью без существенной потери точности. Разные механизмы часто адаптированы к конкретным аппаратным экосистемам, чтобы обеспечить максимальную производительность:
- NVIDIA TensorRT: обеспечивает высокопроизводительный инференс на GPU NVIDIA, используя аппаратно-специфичные ядра и оптимизируя граф сети.
- Intel OpenVINO: оптимизирует производительность глубокого обучения на архитектурах Intel, включая CPU и интегрированную графику, что делает его идеальным для периферийных вычислений.
- ONNX Runtime: кроссплатформенный ускоритель, поддерживающий модели в формате ONNX и обеспечивающий связь между различными фреймворками и аппаратными бэкендами.
Практические применения#
Механизмы инференса — незаметные движущие силы многих современных удобных AI-технологий, позволяющие системам компьютерного зрения мгновенно реагировать на окружающую обстановку.
-
Автономные транспортные средства: в беспилотных автомобилях модели обнаружения объектов должны за миллисекунды распознавать пешеходов, дорожные знаки и другие транспортные средства. Механизм инференса, работающий локально на оборудовании автомобиля, обеспечивает обработку со скоростью инференса в реальном времени, поскольку зависимость от облачного подключения привела бы к опасным задержкам.
-
Интеллектуальное производство: на заводах используются камеры промышленного Интернета вещей для проверки продукции на сборочных линиях. Механизм инференса обрабатывает видеопотоки для выполнения обнаружения аномалий, мгновенно отмечая дефекты. Эта автоматизация сокращает отходы и обеспечивает строгий контроль качества, не замедляя производство.
Механизм инференса и фреймворк обучения#
Важно различать программное обеспечение, используемое для создания модели, и механизм, используемый для её запуска. Фреймворк обучения (например, PyTorch или TensorFlow) предоставляет инструменты для проектирования архитектур, вычисления функции потерь и обновления параметров с помощью обучения с учителем. Он ставит во главу угла гибкость и возможности отладки.
В отличие от него, механизм инференса получает готовый артефакт от фреймворка обучения и отдаёт приоритет скорости выполнения и эффективности использования памяти. Хотя инференс можно выполнять внутри фреймворка обучения, такой подход редко бывает столь же эффективным, как специализированный механизм, особенно при развёртывании на мобильных телефонах или встраиваемых устройствах с помощью таких инструментов, как TensorFlow Lite или Apple Core ML.
Использование механизма инференса с Ultralytics YOLO26#
Пакет ultralytics абстрагирует значительную часть сложности, связанной с механизмами инференса, позволяя пользователям беспрепятственно выполнять прогнозирование. Внутри он обрабатывает предварительную обработку изображений и выполнение модели. Для пользователей, которым нужно масштабирование, Ultralytics Platform упрощает обучение и экспорт моделей в оптимизированные форматы, совместимые с различными механизмами инференса.
В следующем примере показано, как загрузить предварительно обученную модель YOLO26 и выполнить инференс на изображении:
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on an image from a URL
# The 'predict' method acts as the interface to the inference process
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()








