Steering Vectors
Узнай, как векторы управления позволяют в реальном времени контролировать нейронные сети без переобучения. Изучи активационное проектирование с помощью Ultralytics YOLO26.
Управляющие векторы представляют собой содержательные математические направления в пространстве скрытых активаций нейронной сети, которые соответствуют высокоуровневым концепциям, таким как «вежливость», «правдивость» или конкретные визуальные признаки. Искусственно внедряя эти векторы во внутренние состояния модели или вычитая их во время прямого прохода, разработчики могут предсказуемо контролировать и изменять поведение модели без обновления каких-либо базовых весов. Эта техника, в основе которой лежит инженерия активаций, обеспечивает бесплатный контроль во время инференса для систем глубокого обучения, начиная с больших языковых моделей и заканчивая визуальными архитектурами.
Как работают Steering Vectors#
Для создания управляющего вектора исследователи обычно используют метод, называемый Contrastive Activation Addition (CAA). Он заключается в пропуске через сеть набора контрастных пар данных — например, запроса с требованием к модели быть «полезной» и запроса с требованием быть «вредной». Разница в выходных данных функции активации между этими парами усредняется по нескольким выборкам для выделения конкретного геометрического направления, представляющего эту концепцию в тензорном пространстве.
Во время инференса в реальном времени этот вектор добавляется к скрытым состояниям на определенных слоях или вычитается из них с помощью простой операции сложения тензоров PyTorch. Масштабирование силы вектора позволяет специалистам точно настраивать интенсивность внедряемого поведения.
Отличие Steering Vectors от смежных концепций#
Понимание того, как управляющие векторы вписываются в более широкий контекст машинного обучения, требует их отграничения от схожих методологий:
- Векторы задач: В то время как векторы задач действуют в пространстве весов, изменяя реальные весы модели после обучения для объединения возможностей, управляющие векторы функционируют исключительно в пространстве активаций во время выполнения, оставляя исходные веса полностью нетронутыми.
- Инженерия репрезентаций (RepE): RepE — это всеобъемлющая методологическая основа для чтения внутренних когнитивных состояний и управления ими, активно исследуемая такими организациями, как Center for AI Safety. Управляющие векторы являются конкретными математическими инструментами, используемыми на этапе контроля RepE.
- Промпт-инженерия: Промптинг пытается направить поведение, изменяя входной текст или изображение пользователя. Управляющие векторы обходят «бутылочное горлышко» входных данных, напрямую манипулируя внутренней когнитивной обработкой модели.
- Дообучение: Традиционные методы выравнивания, такие как обучение с подкреплением на основе отзывов человека (RLHF), перманентно изменяют модель посредством градиентного спуска, требуя больших вычислительных затрат, которые часто управляются с помощью облачных инструментов, таких как Ultralytics Platform. Управляющие векторы полностью исключают эти накладные расходы на вычисления.
Реальные применения в ИИ#
Возможность динамически управлять моделями открыла значительные достижения в современных конвейерах искусственного интеллекта:
- Повышение безопасности ИИ: Выделяя управляющий вектор, связанный с «отказом» или «безобидностью», инженеры могут заставить модели отклонять вредоносные инструкции. При поддержке исследований выравнивания OpenAI и исследований интерпретируемости Anthropic управление конкретными признаками может радикально изменить диалоговую персону ИИ и обеспечить строгие защитные барьеры.
- Управление моделями рассуждений: Недавние исследования современных архитектур мышления показывают, что управляющие векторы могут модулировать внутренние цепочки рассуждений. Специалисты могут увеличивать склонность модели выражать неуверенность или возвращаться к исправлению ошибок во время решения сложных задач.
- Смягчение предвзятости ИИ: Извлекая вектор, представляющий определенную социальную предвзятость, разработчики могут вычесть это направление в процессе генерации. Это эффективно нейтрализует предвзятость и повышает справедливость без повторного обучения, одновременно снижая вероятность галлюцинаций в LLM.
- Управление системами компьютерного зрения: В моделях компьютерного зрения управляющие векторы могут применяться к картам признаков для искусственного повышения чувствительности сети к критически важным объектам. Например, модель обнаружения объектов может быть настроена на приоритизацию поиска пешеходов в неблагоприятных погодных условиях.
Применение Steering Vectors с PyTorch#
Ниже приведен готовый к запуску пример применения вмешательства в виде активационного управления к модели Ultralytics YOLO26 во время прямого прохода. Используя хуки прямого распространения PyTorch, ты можешь внедрять пользовательские векторы напрямую в скрытые слои.
import torch
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for state-of-the-art vision tasks
model = YOLO("yolo26n.pt")
# Define a hook function to steer the internal activations
def steer_activations_hook(module, input, output):
# Create a steering vector matching the output shape (for demonstration purposes)
# In practice, this vector is pre-computed via Contrastive Activation Addition (CAA)
steering_vector = torch.ones_like(output) * 0.1
# Add the steering vector to the model's hidden states to alter behavior at inference
return output + steering_vector
# Attach the hook to a middle layer (e.g., layer index 5) to inject the vector
handle = model.model.model[5].register_forward_hook(steer_activations_hook)
# Run inference on an image with the dynamically steered activations
results = model("https://ultralytics.com/images/bus.jpg")
# Remove the hook to restore the model to its original unsteered state
handle.remove()





