Steering Vectors
Entdecke, wie Steering Vectors die Echtzeitsteuerung neuronaler Netze ohne Umschulung ermöglichen. Lerne Aktivierungs-Engineering mit Ultralytics YOLO26.
Steuervektoren repräsentieren aussagekräftige, mathematische Richtungen im versteckten Aktivierungsraum eines neural network, die hochrangigen Konzepten wie „Höflichkeit“, „Wahrhaftigkeit“ oder spezifischen visuellen Merkmalen entsprechen. Indem Entwickler diese Vektoren während des Forward Passes künstlich in die internen Zustände des Modells einfügen oder von ihnen subtrahieren, können sie das Verhalten des Modells vorhersehbar steuern und verändern, ohne zugrundeliegende Gewichte zu aktualisieren. Diese Technik, die im Wesentlichen auf Activation Engineering beruht, bietet eine kostenlose Steuerung zur Inferenzzeit für deep learning-Systeme, die von large language models bis hin zu Vision-Architekturen reichen.
Wie Steering Vectors funktionieren#
Um einen Steuervektor zu erstellen, verwenden Forscher typischerweise eine Methode namens Contrastive Activation Addition (CAA). Dabei wird eine Reihe kontrastierender Datenpaare – wie etwa ein Prompt, der das Modell auffordert, „hilfreich“ zu sein, im Vergleich zu einem, der es auffordert, „schädlich“ zu sein – durch das Netzwerk geleitet. Die Differenz der Ausgaben der activation function zwischen diesen Paaren wird über mehrere Stichproben gemittelt, um die spezifische geometrische Richtung zu isolieren, die dieses Konzept im tensor space repräsentiert.
Während der real-time inference wird dieser Vektor mithilfe einer einfachen PyTorch tensor addition zu den versteckten Zuständen in bestimmten Schichten hinzugefügt oder von ihnen abgezogen. Durch die Skalierung der Stärke des Vektors können Praktiker die Intensität des injizierten Verhaltens feinabstimmen.
Unterscheidung von Steering Vectors zu verwandten Konzepten#
Um zu verstehen, wie Steuervektoren in die breitere machine learning-Landschaft passen, müssen sie von ähnlichen Methodiken unterschieden werden:
- Task Vectors: Während Task-Vektoren im Gewichtsraum arbeiten, indem sie die tatsächlichen model weights nach dem Training modifizieren, um Fägigkeiten zusammenzuführen, arbeiten Steuervektoren zur Laufzeit strikt im Aktivierungsraum, wodurch die ursprünglichen Gewichte völlig unangetastet bleiben.
- Representation Engineering (RepE): RepE ist der übergeordnete methodische Rahmen zum Lesen und Kontrollieren interner kognitiver Zustände, der von Organisationen wie dem Center for AI Safety intensiv erforscht wird. Steuervektoren sind die spezifischen mathematischen Werkzeuge, die innerhalb der Kontrollphase von RepE eingesetzt werden.
- Prompt Engineering: Prompting versucht, das Verhalten durch Modifizieren des Eingabetextes oder Bildes des Benutzers zu steuern. Steuervektoren umgehen den Eingabeengpass und manipulieren direkt die interne kognitive Verarbeitung des Modells.
- Fine-Tuning: Herkömmliche Ausrichtungsmethoden wie Reinforcement Learning from Human Feedback (RLHF) verändern das Modell dauerhaft mittels Gradientenabstieg, was einen hohen Rechenaufwand erfordert, der oft über Cloud-Tools wie die Ultralytics Platform verwaltet wird. Steuervektoren vermeiden diesen Rechenaufwand vollständig.
Reale Anwendungen in der KI#
Die Fähigkeit, Modelle dynamisch zu steuern, hat bedeutende Fortschritte in modernen artificial intelligence-Pipelines ermöglicht:
- Enhancing AI Safety: Durch die Isolierung des Steuervektors im Zusammenhang mit „Ablehnung“ oder „Harmlosigkeit“ können Ingenieure Modelle dazu bringen, böswillige Anweisungen abzulehnen. Unterstützt durch OpenAI's alignment research und die Interpretierbarkeitsstudien von Anthropic kann die Steuerung spezifischer Merkmale die Konversationspersona einer KI drastisch verändern und strenge Sicherheitsleitlinien gewährleisten.
- Controlling Reasoning Models: Jüngste Studien zu fortgeschrittenen Denkarchitekturen zeigen, dass Steuervektoren interne Argumentationsketten modulieren können. Praktiker können die Neigung eines Modells erhöhen, bei der komplexen Problemlösung Unsicherheit auszudrücken oder Schritte zurückzunehmen.
- Mitigating AI Bias: Durch das Extrahieren des Vektors, der eine bestimmte gesellschaftliche Verzerrung repräsentiert, können Entwickler diese Richtung während der Generierung subtrahieren. Dies neutralisiert die Verzerrung effektiv und verbessert die Fairness ohne Umschulung, während gleichzeitig die Wahrscheinlichkeit von hallucination in LLMs verringert wird.
- Steering Computer Vision Systems: In Visionsmodellen können Steuervektoren auf Feature-Maps angewendet werden, um die Empfindlichkeit des Netzwerks gegenüber kritischen Zielen künstlich zu erhöhen. Beispielsweise kann ein object detection-Modell so gesteuert werden, dass es dem Auffinden von Fußgängern unter widrigen Wetterbedingungen Priorität einräumt.
Anwendung von Steering Vectors mit PyTorch#
Unten ist ein ausführbares Beispiel für die Anwendung einer Aktivierungssteuerungsintervention auf ein Ultralytics YOLO26-Modell während eines Forward Passes. Durch die Nutzung von PyTorch forward hooks können Sie benutzerdefinierte Vektoren direkt in die versteckten Schichten einfügen.
import torch
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for state-of-the-art vision tasks
model = YOLO("yolo26n.pt")
# Define a hook function to steer the internal activations
def steer_activations_hook(module, input, output):
# Create a steering vector matching the output shape (for demonstration purposes)
# In practice, this vector is pre-computed via Contrastive Activation Addition (CAA)
steering_vector = torch.ones_like(output) * 0.1
# Add the steering vector to the model's hidden states to alter behavior at inference
return output + steering_vector
# Attach the hook to a middle layer (e.g., layer index 5) to inject the vector
handle = model.model.model[5].register_forward_hook(steer_activations_hook)
# Run inference on an image with the dynamically steered activations
results = model("https://ultralytics.com/images/bus.jpg")
# Remove the hook to restore the model to its original unsteered state
handle.remove()





