Task Vectors
태스크 벡터가 효율적인 모델 병합과 동작 제어를 어떻게 가능하게 하는지 배우세요. 제로샷 멀티태스킹을 위해 Ultralytics YOLO26 가중치를 조작하는 방법을 알아보세요.
태스크 벡터는 새로운 기능을 구현하기 위해 파인튜닝 과정에서 신경망의 가중치에 발생한 구체적인 변화를 나타냅니다. 기초 베이스 모델의 파라미터에서 파인튜닝된 모델의 파라미터를 빼는 방식으로, 연구원들은 특정 태스크에 대해 학습된 동작을 내포하는 가중치 공간의 방향성 벡터를 격리할 수 있습니다. 이 접근법을 통해 개발자는 추가적인 학습 연산 없이 모델 파라미터에 대한 간단한 산술 연산을 적용하여 모델의 동작을 유도, 수정 또는 병합할 수 있습니다.
태스크 벡터와 전이 학습의 차이점#
전이 학습 개념이 기존 지식을 적응시키기 위해 새로운 데이터셋에서 모델을 순차적으로 학습시키는 것을 포함하는 반면, 태스크 벡터는 학습 완료 후 모델의 구조적 가중치에 직접 작용합니다. 새로운 도메인을 학습하기 위해 그래디언트를 재학습하는 대신, 태스크 벡터를 이용한 가중치 공간 보간법을 활용하면 여러 독립적으로 학습된 모델의 가중치 차이를 선형적으로 결합할 수 있습니다. 이를 통해 제로샷 모델 병합이 가능해지며, 일반적인 학습 중 연산 오버헤드 없이 단일 모델이 여러 기능을 동시에 상속받을 수 있습니다.
실제 애플리케이션 사례#
딥러닝 모델을 대수적으로 조작할 수 있는 이러한 능력은 현대 AI 파이프라인 전반에 걸쳐 여러 영향력 있는 응용 사례를 이끌어냈습니다:
- 멀티태스크 모델 병합: 엔지니어는 객체 검출에 최적화된 태스크 벡터와 이미지 분할을 위해 학습된 또 다른 벡터를 결합할 수 있습니다. Ultralytics YOLO26 베이스 모델에 적용할 경우, 각 원래 파인튜닝의 강점을 보존하면서 두 가지 태스크를 동시에 훌륭하게 수행하는 이중 목적 아키텍처가 생성됩니다.
- 머신 언러닝 및 AI 안전성: 모델이 편향되거나 위험한 출력을 나타내는 경우, 연구원들은 해당 원치 않는 특정 동작을 나타내는 태스크 벡터를 계산할 수 있습니다. 모델의 가중치에서 이 벡터를 차감함으로써 해당 동작을 효과적으로 "제거"할 수 있으며, 이는 향상된 AI 안전성 및 견고한 AI 윤리 표준에 크게 기여합니다.
- 컴퓨터 비전에서의 도메인 적응: 주간에서 야간 실시간 추론으로의 전환 등 특정 환경에 맞게 모델을 적응시킬 때, 태스크 벡터를 사용하면 적응의 크기를 조절할 수 있습니다. 벡터의 일부(예: 0.5의 스케일링 팩터)를 적용하면 두 도메인 모두에서 우수한 성능을 발휘하는 균형 잡힌 모델을 얻을 수 있습니다.
PyTorch에서 태스크 벡터 활용하기#
태스크 벡터를 생성하고 적용하려면 PyTorch state dictionary에 접근하여 조작해야 합니다. 다음 예제는 미세 조정된 Ultralytics YOLO26 모델에서 태스크 벡터를 추출하고 특정 스케일링 팩터를 사용하여 베이스 모델에 다시 적용하는 방법을 보여줍니다.
from ultralytics import YOLO
# Load the state dictionaries for the base and fine-tuned models
base_weights = YOLO("yolo26n.pt").model.state_dict()
tuned_weights = YOLO("yolo26n-custom.pt").model.state_dict()
# Calculate the task vector (tuned weights minus base weights)
task_vector = {k: tuned_weights[k] - base_weights[k] for k in base_weights.keys()}
# Apply the task vector to the base model using a 0.5 scaling factor
for k in base_weights.keys():
base_weights[k] += 0.5 * task_vector[k]가중치 조작의 미래#
대규모 언어 모델 및 방대한 비전 트랜스포머와 같은 아키텍처의 파라미터 수가 증가함에 따라, 사소한 조정마다 재학습하는 것은 경제적으로 불가능해지고 있습니다. 태스크 벡터는 학습 후 모델 최적화를 위한 수학적으로 우수한 대안을 제공합니다. 전체 멀티기가바이트 모델 대신 경량의 태스크 벡터를 공유함으로써, AI 커뮤니티는 AI 분야의 오픈소스 협업을 가속화할 수 있습니다. 커스텀 태스크 벡터가 정제되면 Ultralytics 플랫폼을 활용하여 후속 모델 배포 및 모니터링 프로세스를 단순화하고, 최적화된 가중치가 프로덕션 수준의 엔드포인트에 직접 반영되도록 보장할 수 있습니다.






