Constitutional AI
Constitutional AI가 윤리 원칙을 사용해 모델을 인간의 가치에 맞추는 방식을 살펴보세요. Ultralytics YOLO26을 사용한 컴퓨터 비전에서 안전성 검사를 구현하는 방법을 알아보세요.
헌법적 AI는 개별 출력에 대한 광범위한 인간 피드백에만 의존하는 대신, 높은 수준의 원칙 집합인 "헌법"을 제공하여 인공지능 시스템이 인간의 가치에 부합하도록 학습시키는 방법입니다. 이 접근 방식은 기본적으로 "도움이 되기", "해를 끼치지 않기", "차별을 피하기"와 같이 미리 정의된 규칙 집합을 바탕으로 AI 모델이 자신의 동작을 비평하고 수정하도록 가르칩니다. 이러한 윤리 지침을 학습 과정에 직접 포함하면, 개발자는 수동 인간 피드백을 통한 강화 학습(RLHF)에 의존하는 시스템보다 더 안전하고 투명하며 확장하기 쉬운 시스템을 만들 수 있습니다.
헌법적 AI의 작동 메커니즘#
헌법적 AI의 핵심 혁신은 모델의 정렬을 자동화하는 2단계 학습 과정에 있습니다. 사람이 모든 올바른 응답에 레이블을 지정해야 하는 기존의 지도 학습과 달리, 헌법적 AI는 모델 자체를 사용하여 학습 데이터를 생성합니다.
-
지도 학습 단계: 모델이 프롬프트에 대한 응답을 생성한 다음, 헌법의 원칙에 따라 자신의 출력을 비평합니다. 그런 다음 규칙에 더 잘 부합하도록 응답을 수정합니다. 이렇게 개선된 데이터셋을 사용하여 모델을 파인튜닝하고, 모델이 지침을 본질적으로 따르도록 학습시킵니다.
-
강화 학습 단계: 흔히 AI 피드백을 통한 강화 학습(RLAIF)이라고 하는 이 단계에서는 인간 레이블러를 대체합니다. AI가 응답 쌍을 생성하고 헌법을 가장 잘 준수하는 응답을 선택합니다. 이 선호도 데이터로 보상 모델을 학습한 다음, 표준 강화 학습 기법을 통해 원하는 동작을 강화합니다.
컴퓨터 비전과의 관련성#
헌법적 AI는 Anthropic과 같은 조직이 개발한 대규모 언어 모델(LLM)의 맥락에서 시작되었지만, 그 원칙은 컴퓨터 비전(CV)을 비롯한 더 광범위한 머신 러닝 작업에도 점점 더 중요해지고 있습니다.
- 윤리적인 이미지 생성: 이미지 생성을 위한 생성형 AI 도구는 폭력적이거나 혐오적이거나 저작권을 침해하는 이미지를 생성하는 프롬프트를 거부하도록 "헌법에 따라" 학습시킬 수 있습니다. 이를 통해 모델 가중치 자체에 안전 제약 조건이 인코딩되어 유해한 시각 콘텐츠의 생성을 방지할 수 있습니다.
- 안전이 중요한 비전 시스템: 자율주행 차량에서는 "헌법적" 접근 방식을 통해 의사 결정을 위한 계층적 규칙을 정의할 수 있습니다. 예를 들어 "인간의 안전이 교통 효율성보다 우선한다"는 규칙은 복잡한 도로 장면을 분석할 때 모델을 안내하여 객체 감지 결과가 안전을 최우선으로 해석되도록 할 수 있습니다.
비전 AI에 정책 검사 구현하기#
완전한 헌법적 AI 학습에는 복잡한 피드백 루프가 포함되지만, 개발자는 추론 중에 "헌법적 검사" 개념을 적용하여 안전 정책에 따라 출력을 필터링할 수 있습니다. 다음 예제에서는 Ultralytics YOLO26을 사용하여 객체를 감지하고, 신뢰도가 낮은 감지를 필터링하는 안전 규칙을 적용하여 신뢰성 헌법을 모방하는 방법을 보여줍니다.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable Ultralytics release)
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Apply a "constitutional" safety check: Only accept high-confidence detections
for result in results:
# Filter boxes with confidence > 0.5 to ensure reliability
safe_boxes = [box for box in result.boxes if box.conf > 0.5]
print(f"Safety Check Passed: {len(safe_boxes)} reliable objects detected.")
# Further processing would only use 'safe_boxes'헌법적 AI와 기존 RLHF 비교#
헌법적 AI를 표준 인간 피드백을 통한 강화 학습(RLHF)과 구별하는 것이 중요합니다.
- 확장성: RLHF는 모델 출력을 평가하기 위해 막대한 양의 인간 노동을 필요로 하므로 비용이 많이 들고 느립니다. 헌법적 AI는 AI 에이전트를 사용하여 이를 자동화하므로 확장성이 매우 높습니다.
- 투명성: RLHF에서는 모델이 불투명한 "보상 신호"(점수)로부터 학습하므로 어떤 이유로 특정 동작이 선호되었는지 파악하기 어렵습니다. 헌법적 AI에서는 비평 단계에서 사용되는 사고 연쇄 프롬프트를 통해 추론을 명시하고 특정 문서화된 원칙까지 추적할 수 있습니다.
- 일관성: 인간 평가자는 일관성이 없거나 편향될 수 있습니다. 문서화된 헌법은 AI 윤리의 안정적인 기준선을 제공하여 정렬 과정의 주관성을 줄입니다.
정렬의 미래#
모델이 인공 일반 지능(AGI)을 향해 발전함에 따라 헌법적 AI와 같은 견고한 정렬 전략의 중요성이 커지고 있습니다. 이러한 방법은 NIST AI 안전 연구소와 같은 기관에서 마련하는 새로운 표준을 준수하는 데 필수적입니다.
Ultralytics Platform은 데이터 거버넌스와 모델 모니터링을 관리하는 도구를 제공하여 책임 있는 AI 시스템을 구축할 수 있도록 지원합니다. 조직은 이러한 윤리적 고려 사항을 데이터 수집부터 모델 배포까지 AI 개발 수명 주기에 통합함으로써 위험을 완화하고 기술이 사회에 긍정적으로 기여하도록 보장할 수 있습니다.









