Steering Vectors
Descobre como os vetores de direção permitem o controlo em tempo real sobre redes neurais sem necessidade de re-treino. Aprende engenharia de ativação com o Ultralytics YOLO26.
Os vetores de direção representam direções matemáticas significativas dentro do espaço de ativação oculta de uma rede neural que correspondem a conceitos de alto nível, como "educação", "veracidade" ou características visuais específicas. Ao injetar ou subtrair artificialmente esses vetores dos estados internos do modelo durante a passagem direta, os desenvolvedores podem controlar e alterar de forma previsível o comportamento do modelo sem atualizar nenhum peso subjacente. Essa técnica, fundamentalmente enraizada na Engenharia de Ativação, fornece controle de tempo de inferência sem custo sobre sistemas de aprendizado de máquina que vão desde grandes modelos de linguagem até arquiteturas de visão.
Como Funcionam os Vetores de Direcionamento#
Para criar um vetor de direção, os pesquisadores normalmente usam um método chamado Contrastive Activation Addition (CAA). Isso envolve passar um conjunto de pares de dados contrastivos — como um prompt pedindo para o modelo ser "útil" versus um pedindo para ser "prejudicial" — através da rede. A diferença nas saídas da função de ativação entre esses pares é calculada como média em várias amostras para isolar a direção geométrica específica que representa esse conceito no espaço tensorial.
Durante a inferência em tempo real, esse vetor é adicionado ou subtraído dos estados ocultos em camadas específicas usando a simples adição de tensores do PyTorch. Dimensionar a força do vetor permite que os profissionais ajustem com precisão a intensidade do comportamento injetado.
Diferenciando Vetores de Direcionamento de Conceitos Relacionados#
Compreender como os vetores de direção se encaixam no panorama mais amplo do aprendizado de máquina requer distingui-los de metodologias semelhantes:
- Vetores de Tarefa: Enquanto os vetores de tarefa operam no espaço de pesos modificando os pesos do modelo reais pós-treinamento para mesclar capacidades, os vetores de direção operam estritamente no espaço de ativação em tempo de execução, deixando os pesos originais completamente intactos.
- Engenharia de Representação (RepE): A RepE é a estrutura metodológica abrangente de leitura e controle de estados cognitivos internos, amplamente pesquisada por organizações como o Center for AI Safety. Os vetores de direção são as ferramentas matemáticas específicas utilizadas na fase de controle da RepE.
- Engenharia de Prompt: O prompt tenta guiar o comportamento modificando o texto ou a imagem de entrada do usuário. Os vetores de direção ignoram o gargalo de entrada, manipulando diretamente o processamento cognitivo interno do modelo.
- Ajuste Fino: Os métodos de alinhamento tradicionais, como o Aprendizado por Reforço a partir de Feedback Humano (RLHF), alteram permanentemente o modelo por meio de descida de gradiente, exigindo computação pesada que geralmente é gerenciada por ferramentas em nuvem como a Ultralytics Platform. Os vetores de direção evitam totalmente essa sobrecarga computacional.
Aplicações no Mundo Real em IA#
A capacidade de direcionar modelos dinamicamente desbloqueou avanços significativos em pipelines modernos de inteligência artificial:
- Aprimorando a Segurança da IA: Ao isolar o vetor de direção associado à "recusa" ou "inofensividade", os engenheiros podem forçar os modelos a rejeitar instruções maliciosas. Apoiado pela pesquisa de alinhamento da OpenAI e pelos estudos de interpretabilidade da Anthropic, direcionar recursos específicos pode alterar drasticamente a persona conversacional de uma IA e garantir salvaguardas de segurança rígidas.
- Controlando Modelos de Raciocínio: Estudos recentes sobre arquiteturas de pensamento avançadas demonstram que os vetores de direção podem modular cadeias de raciocínio interno. Os profissionais podem aumentar a tendência de um modelo de expressar incerteza ou voltar atrás em erros durante a resolução de problemas complexos.
- Mitigando o Viés da IA: Ao extrair o vetor que representa um viés social específico, os desenvolvedores podem subtrair essa direção durante a geração. Isso neutraliza efetivamente o viés e melhora a justiça sem retreinamento, reduzindo simultaneamente a probabilidade de alucinação em LLMs.
- Direcionando Sistemas de Visão Computacional: Em modelos de visão, os vetores de direção podem ser aplicados a mapas de características para aumentar artificialmente a sensibilidade da rede a alvos críticos. Por exemplo, um modelo de detecção de objetos pode ser direcionado para priorizar a localização de pedestres em condições climáticas adversas.
Aplicando Vetores de Direcionamento com PyTorch#
Abaixo está um exemplo executável de aplicação de uma intervenção de direcionamento de ativação a um modelo Ultralytics YOLO26 durante uma passagem direta. Utilizando ganchos de encaminhamento do PyTorch, podes injetar vetores personalizados diretamente nas camadas ocultas.
import torch
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for state-of-the-art vision tasks
model = YOLO("yolo26n.pt")
# Define a hook function to steer the internal activations
def steer_activations_hook(module, input, output):
# Create a steering vector matching the output shape (for demonstration purposes)
# In practice, this vector is pre-computed via Contrastive Activation Addition (CAA)
steering_vector = torch.ones_like(output) * 0.1
# Add the steering vector to the model's hidden states to alter behavior at inference
return output + steering_vector
# Attach the hook to a middle layer (e.g., layer index 5) to inject the vector
handle = model.model.model[5].register_forward_hook(steer_activations_hook)
# Run inference on an image with the dynamically steered activations
results = model("https://ultralytics.com/images/bus.jpg")
# Remove the hook to restore the model to its original unsteered state
handle.remove()





