YOLO Vision 2026:
Назад к глоссарию Ultralytics

Speculative Decoding

Узнай, как спекулятивное декодирование ускоряет инференс ИИ в 2-3 раза. Узнай, как этот метод оптимизирует LLM и Ultralytics YOLO26 для более быстрого и эффективного вывода.

Спекулятивное декодирование — это передовой метод оптимизации, используемый преимущественно в больших языковых моделях (LLM) и других задачах последовательной генерации для значительного ускорения процесса инференса без потери качества вывода. При традиционной авторегрессионной генерации модель создает по одному токену за раз, причем каждый шаг ожидает завершения предыдущего. Этот процесс может быть медленным, особенно на мощном оборудовании, где «узким местом» часто становится пропускная способность памяти, а не скорость вычислений. Спекулятивное декодирование решает эту проблему за счет использования небольшой и быстрой «черновой» модели, которая параллельно предсказывает последовательность будущих токенов, а затем проверяется за один проход более крупной и точной «целевой» моделью. Если черновик верный, система принимает сразу несколько токенов, эффективно совершая рывок вперед в процессе генерации.

Как работает спекулятивное декодирование#

Основной механизм основан на наблюдении, что многие токены в последовательности — например, служебные слова, такие как «и», «в», или очевидные завершения фраз — легко предсказать, и они не требуют всей вычислительной мощности массивной модели. Перекладывая эти простые предсказания на облегченную прокси-модель, система сокращает количество обращений к тяжелой модели.

Когда целевая модель проверяет составленную последовательность, она использует шаг параллельной верификации. Поскольку GPU высоко оптимизированы для пакетной обработки, проверка пяти составленных токенов одновременно занимает примерно столько же времени, сколько генерация одного токена. Если целевая модель согласна с черновиком, эти токены фиксируются. Если она в какой-то точке не согласна, последовательность усекается, вставляется правильный токен, и процесс повторяется. Этот метод гарантирует, что итоговый вывод математически идентичен тому, что целевая модель выдала бы самостоятельно, сохраняя accuracy и повышая скорость в 2–3 раза во многих сценариях.

Реальные приложения#

Этот метод меняет то, как отрасли внедряют генеративный ИИ, особенно там, где критически важна задержка.

  • Реальное время в дополнении кода: В интегрированных средах разработки (IDE) ИИ-ассистенты по написанию кода должны предоставлять подсказки мгновенно, пока разработчик печатает. Спекулятивное декодирование позволяет этим помощникам составлять черновики целых строк кода с использованием небольшой модели, в то время как крупная базовая модель проверяет синтаксис и логику в фоновом режиме. Это обеспечивает быстрый и плавный пользовательский опыт, который ощущается как набор текста в реальном времени, а не ожидание ответа от сервера.
  • Интерактивные чат-боты на периферийных устройствах: Запуск мощных LLM на смартфонах или ноутбуках представляет сложность из-за ограниченных аппаратных ресурсов. Используя спекулятивное декодирование, устройство может локально запускать квантованную крошечную модель для подготовки черновиков ответов, периодически запрашивая более крупную модель (облачную или более тяжелую локальную) для проверки. Такой гибридный подход обеспечивает высокое качество взаимодействия с virtual assistant с минимальной задержкой, делая edge AI более применимым для сложных задач.

Связь с другими концепциями#

Важно отличать спекулятивное декодирование от похожих стратегий оптимизации.

  • Model Quantization: Хотя квантование снижает точность весов модели (например, с FP16 до INT8) для экономии памяти и ускорения вычислений, оно безвозвратно изменяет модель и может незначительно ухудшить производительность. Спекулятивное декодирование, напротив, не меняет веса целевой модели и гарантирует то же распределение вывода.
  • Knowledge Distillation: Этот процесс предполагает обучение меньшей модели-студента имитировать большую модель-учитель. Модель-студент полностью заменяет учителя. При спекулятивном декодировании маленькая модель (драфтер) и большая модель (верификатор) работают в тандеме во время inference, а не заменяют друг друга.

Пример реализации#

Хотя спекулятивное декодирование часто встроено в фреймворки обслуживания, концепция проверки предсказаний является фундаментальной для эффективного ИИ. Ниже приведен концептуальный пример с использованием PyTorch, иллюстрирующий, как более крупная модель может оценивать или проверять последовательность потенциальных входных данных, подобно шагу проверки в спекулятивном декодировании.

import torch


def verify_candidate_sequence(model, input_ids, candidate_ids):
    """Simulates the verification step where a target model checks candidate tokens."""
    # Concatenate input with candidates for parallel processing
    full_sequence = torch.cat([input_ids, candidate_ids], dim=1)

    with torch.no_grad():
        logits = model(full_sequence)  # Single forward pass for all tokens

    # Get the model's actual predictions (greedy decoding for simplicity)
    predictions = torch.argmax(logits, dim=-1)

    # In a real scenario, we check if predictions match candidate_ids
    return predictions


# Example tensor setup (conceptual)
# input_ids = torch.tensor([[101, 2054, 2003]])
# candidate_ids = torch.tensor([[1037, 3024]])
# verify_candidate_sequence(my_model, input_ids, candidate_ids)

Влияние на будущее развитие ИИ#

По мере того как модели продолжают расти в размерах, разрыв между вычислительной мощностью и пропускной способностью памяти, часто называемый «стеной памяти», увеличивается. Спекулятивное декодирование помогает преодолеть этот разрыв, максимизируя арифметическую интенсивность каждого обращения к памяти. Эта эффективность критически важна для устойчивого развертывания generative AI в масштабных проектах, снижая как энергопотребление, так и операционные затраты.

В настоящее время исследователи изучают способы применения аналогичных спекулятивных принципов к задачам computer vision. Например, при video generation легковесная модель может создавать будущие кадры, которые затем уточняются высокоточной диффузионной моделью. Поскольку такие фреймворки, как PyTorch и TensorFlow, интегрируют эти оптимизации нативно, разработчики могут рассчитывать на меньшую inference latency для более широкого спектра модальностей — от текста до сложных визуальных данных, обрабатываемых продвинутыми архитектурами вроде Ultralytics YOLO26.

Для тех, кто управляет жизненным циклом таких моделей, использование таких инструментов, как Ultralytics Platform, гарантирует надежность базовых наборов данных и обучающих пайплайнов, создавая прочную основу для продвинутых методов инференса. Независимо от того, работаешь ли ты с large language models или передовым object detection, оптимизация конвейера инференса остается ключевым шагом при переходе от прототипа к продакшену.

Explore solutions

Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения