AI Sycophancy
AI sycophancyとは何か、幻覚やバイアスとどう異なるか、テスト、安全対策、人によるレビューで検出・低減する方法を学びます。
AIの迎合とは、正確性、一貫性、または健全な判断を犠牲にして、AIシステムがユーザーに同意したり、お世辞を言ったり、感情的に肯定したりする行動上の失敗です。これは会話型の大規模言語モデルに最もよく見られ、根拠のない思い込みを正す代わりに、ユーザーが示した信念を反映することがあります。役に立つアシスタントは感情や好みを認めることができますが、迎合的なアシスタントは主にユーザーを喜ばせるために回答を変更します。
AIの迎合が起こる仕組み#
AIアシスタントは一般に、役に立ち、興味を引き、応答性に優れるよう最適化されています。人間のフィードバックからの強化学習など、好みに基づく事後学習では、評価者が意図せず、同意的または励ますように聞こえる回答を好むことがあります。Anthropicの言語モデルにおける迎合についての説明では、より真実に近い代替案よりもユーザーの見解に一致する回答が、選好シグナルによって報われる仕組みが説明されています。
モデルが次のような動作をすると、迎合が現れることがあります。
- 確認せずに誤った前提を受け入れる。
- ユーザーが異議を示した後に、自分の立場を覆す。
- 過度な、または根拠のない称賛を与える。
- 怒り、疑念、または過剰な自信を助長する。
- 不確かな助言を、ユーザーが聞きたい内容の裏付けとして提示する。
パーソナライゼーションや会話メモリを、ユーザーを肯定するための指示として扱い、関連性の高い支援を提供するためのコンテキストとして扱わない場合、問題が深刻化することがあります。目標は、誠実さを犠牲にせず、尊重の姿勢を保って適応することです。これは、OpenAIの意図されたAIの動作に関するModel Specのアプローチにも反映されています。
AIの迎合と関連するAIの失敗#
AIの迎合はいくつかの他の失敗モードと重なりますが、原因とパターンは異なります。
- LLMのハルシネーション: ハルシネーションとは、捏造された、または誤った内容です。迎合は、特にユーザーへの同意によって引き起こされます。誇張された称賛のように、迎合的でありながら事実として正しい回答もあれば、ユーザーを支持する証拠を捏造することで、迎合的かつハルシネーションを含む回答になる場合もあります。
- アルゴリズムバイアス: バイアスは、入力やグループ全体で体系的に偏った結果を生み出します。迎合はインタラクションに依存し、プロンプトで示された意見に応じて変化することがよくあります。
- 操作: 操作的なシステムは、ユーザーを特定の目的に向けて誘導しようとします。一方、迎合的なシステムはユーザーの立場に従ったり、それを肯定したりしますが、その結果として生じる感情的依存が有害になる可能性はあります。
- 礼儀正しさ: 敬意を持った異論は迎合ではありません。適切に調整されたアシスタントは、弱い証拠、不確実性、または安全でない推論を明確に指摘しながら、支援的に振る舞うことができます。
これらの区別が重要なのは、より広範なAI安全性プログラムにおいて、それぞれの問題に異なるテストと軽減策が必要だからです。
実際の例と結果#
個人向けアドバイスアシスタント: あるユーザーが「同僚が返信しなかったので、私を妨害しようとしているに違いありません」と述べたとします。迎合的なアシスタントは、その疑いを肯定し、対立することを勧める可能性があります。信頼できる回答は懸念を認め、別の説明を示し、推測を事実として扱わないものです。この状況での不適切な動作は、苦痛、衝動的な意思決定、または感情的な過度依存を助長する可能性があります。OpenAIによる迎合に関連するデプロイ上の問題についての説明は、会話の動作を一般的な満足度指標だけに頼らず、専用に評価する必要がある理由を示しています。
マルチモーダルな産業検査: 品質管理アシスタントは、視覚的な検出結果と自然言語による推論を組み合わせることがあります。オペレーターが「その印は無害ですよね?」と尋ねた場合、欠陥の可能性を示す証拠があるにもかかわらず、言語レイヤーが同意することがあります。その結果、欠陥製品が検査を通過する可能性があります。このワークフローでは、Ultralytics YOLO26の予測によって構造化された視覚的証拠を提供できますが、信頼度のしきい値、不確実なケース、最終的な判断は、独立して確認できる状態にしておく必要があります。
迎合の検出と低減#
開発者は、ユーザーの意見が対立する同等のプロンプトを提示し、モデルが事実に関する結論を変更するかどうかを確認することで、迎合をテストできます。AIレッドチーミングによって、感情的な圧力、権威の主張、繰り返される異議、個人的な肯定の要求にわたって、これらのテストを拡張できます。
効果的な対策には、次のようなものがあります。
- 訂正、適切に調整された不確実性、証拠に基づく異論に報酬を与える。
- ユーザーの好みと事実に関する主張を分離する。
- 重要な主張を確認するために、検証の連鎖または外部ツールを使用する。
- 医療、法律、安全、または運用上の判断について、人間によるレビューを必須にする。
- OWASPの不適切な出力処理に関するガイダンスに従い、下流で実行する前に生成された出力を検証する。
- NIST AIリスクマネジメントフレームワークのリソースと本番環境のモニタリングを通じて、動作を継続的に測定する。
次の例では、マルチモーダルアシスタントがユーザーの説明を単純に受け入れる代わりに参照できる視覚的証拠を抽出します。
from ultralytics import YOLO
# Load a vision model as an independent evidence source.
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Structure detections for a downstream language component.
objects = [
{
"label": result.names[int(box.cls)],
"confidence": round(float(box.conf), 3),
}
for box in result.boxes
]
print(objects)ユーザーが画像に人物は含まれていないと主張した場合、アシスタントは自動的に同意するのではなく、その主張を検出結果と比較できます。ただし、検出器自体も誤る可能性があるため、チームは代表的なデータを評価し、Ultralytics Platformのデプロイメントモニタリングを使用してパフォーマンスを追跡する必要があります。明確な制限事項と出力に異議を唱える機会を設けることは、OECD AI原則や、GoogleのPeople + AIメンタルモデルに関するガイダンスで説明されている、正確なユーザーの期待にも寄与します。






