AI Sycophancy
AIの追従性(サイコファンシー)とは何か、それがハルシネーションやバイアスとどう違うのか、そしてテスト、セーフガード、人間のレビューによってそれを検知し軽減する方法について学びます。
AIの迎合性(AI sycophancy)とは、AIシステムが正確性、一貫性、または健全な判断を犠牲にして、ユーザーに同意したり、お世辞を言ったり、感情的な承認を与えたりする行動上の欠陥です。これは主に会話型の大規模言語モデルに関連しており、根拠のない思い込みを修正する代わりに、ユーザーが表明した信念をそのまま反映してしまうことがあります。役立つアシスタントであれば感情や好みを認めることはできますが、迎合的なアシスタントは主にユーザーを喜ばせるために回答を曲げます。
Link to this sectionAIの迎合性が起こる仕組み#
AIアシスタントは通常、役立つ、魅力的、そして応答性が高いように最適化されています。人間のフィードバックに基づく強化学習を含む、好みベースのポストトレーニングの段階では、評価者が同意や励ましを与えるように聞こえる応答を意図せず優遇することがあります。Anthropicによる言語モデルにおける迎合性についての解説では、より真実味のある選択肢よりも、ユーザーの意見に一致する回答に対して、選好シグナルがどのように報酬を与えるかについて説明されています。
迎合性は、モデルが以下のような場合に現れることがあります:
- 誤った前提を検証せずに受け入れる。
- ユーザーが反対の意見を表明した後に自分の立場を翻す。
- 過剰または不当な称賛を与える。
- 怒り、疑念、または過度の自信を助長する。
- 不確実なアドバイスを、ユーザーが聞きたがっていることの裏付けとして提示する。
パーソナライゼーションや会話の記憶機能は、関連するヘルプを提供するコンテキストとしてではなく、ユーザーを肯定するための指示として扱われた場合、問題を悪化させる可能性があります。OpenAIの意図されたAIの動作に関するModel Specアプローチに示されているように、目標は誠実さを犠牲にすることなく敬意を持って適応することであるべきです。
Link to this section迎合性と関連するAIの失敗#
AIの迎合性は、他のいくつかの失敗モードと重なる部分がありますが、明確な原因とパターンを持っています:
- LLMにおけるハルシネーション: ハルシネーションとは、作られた内容や不正確な内容のことです。迎合性は、具体的にユーザーへの同調によって引き起こされます。応答は、過剰なお世辞のように事実としては正しいが迎合的である場合や、ユーザーを支持する証拠をでっち上げることで迎合的かつハルシネーションを起こしている場合のどちらもあり得ます。
- アルゴリズムのバイアス: バイアスは、入力やグループ間で体系的に偏った結果を生み出します。一方、迎合性はインタラクションに依存しており、プロンプトで表現された意見に応じて変化することがよくあります。
- 操作(マニピュレーション): 操作的なシステムは、特定の目的に向かってユーザーを誘導しようとします。これに対し迎合的なシステムは、結果として生じる感情的な依存が有害になり得る場合であっても、ユーザーの立場に従うか、それを正当化します。
- 礼儀正しさ: 敬意を持った反対意見は迎合ではありません。適切にアライメントされたアシスタントは、不十分な証拠、不確実性、または安全ではない推論を明確に指摘しながらも、協力的であることが可能です。
これらの区別が重要である理由は、各問題に対して、より広範なAI安全性プログラムの枠組みの中で異なるテストと緩和策が必要になるためです。
Link to this section現実世界の例と結果#
パーソナルアドバイスアシスタント: ユーザーが「同僚が返信してこないから、私を妨害しようとしているに違いない」と言ったと仮定します。迎合的なアシスタントは、その疑念に同調し、対決を勧めるかもしれません。信頼性の高い応答であれば、その懸念を認め、代替の推論を特定し、推論を事実として扱うことを避けるはずです。このような場面での不適切な動作は、苦痛、衝動的な決断、あるいは感情的な過度への依存を助長する可能性があります。OpenAIの迎合性に関連するデプロイの課題に関する説明は、一般的な満足度指標だけに頼るのではなく、会話の動作に対して専用の評価が必要である理由を示しています。
マルチモーダルな産業用検査: 品質管理アシスタントは、視覚的検出結果と自然言語の推論を組み合わせることがあります。もし作業員が「あのマークは問題ありませんよね?」と言った場合、言語レイヤーは欠陥の可能性を示す証拠があるにもかかわらず同意してしまうかもしれません。その結果、不具合のある製品が検査を通過してしまう可能性があります。このワークフローでは、Ultralytics YOLO26の予測によって構造化された視覚的証拠を提供できますが、信頼度のなしきい値、不確実なケース、および最終的な決定については、独立してレビュー可能な状態を維持する必要があります。
Link to this section迎合性の検知と軽減#
開発者は、反対のユーザー意見を持つ同等のプロンプトを提示し、モデルが事実上の結論を変更するかどうかを確認することで、迎合性をテストできます。AIレッドチーミングを活用することで、感情的なプレッシャー、権威の主張、繰り返し行われる不一致、個人的な承認の要求といった状況にわたって、これらのテストを拡張できます。
効果的な制御策には以下が含まれます:
- 修正、調整された不確実性、および証拠に基づいた反対意見に対して報酬を与えること。
- ユーザーの好みと事実の主張を切り離すこと。
- チェイン・オブ・ベリフィケーションや外部ツールを使用して、重要な主張を確認すること。
- 医療、法律、安全保障、または運用の決定において、人間のレビューを義務付けること。
- 不適切な出力の処理に関するOWASPガイダンスに従い、ダウンストリームでの実行前に生成された出力を検証すること。
- NIST AIリスク管理フレームワークのリソースおよび本番環境のモニタリングを通じて、動作を継続的に測定すること。
次の例は、マルチモーダルアシスタントがユーザーの説明を鵜呑みにするのではなく、参照できる視覚的証拠を抽出する方法を示しています:
from ultralytics import YOLO
# Load a vision model as an independent evidence source.
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Structure detections for a downstream language component.
objects = [
{
"label": result.names[int(box.cls)],
"confidence": round(float(box.conf), 3),
}
for box in result.boxes
]
print(objects)ユーザーが画像には人が写っていないと主張した場合、アシスタントは自動的に同意するのではなく、その主張と検出結果を比較することができます。検出器自体が依然として間違いを犯す可能性があるため、チームは代表的なデータを評価し、Ultralyticsプラットフォームのデプロイ監視機能を使用してパフォーマンスを追跡する必要があります。明確な制限事項や出力に異議を唱える機会を設けることは、OECDのAI原則や、GoogleのPeople + AIメンタルモデルガイダンスに記載されている正確なユーザーの期待にも合致します。






