[論文レビュー] Who Should I Trust: AI or Myself? Leveraging Human and AI Correctness Likelihood to Promote Appropriate Trust in AI-Assisted Decision-Making
本稿では、対話型ルールベースのモデリングとCLに基づく信頼戦略を用いて、タスク・インスタンスレベルで人間とAIの正答率の可能性(CL)を併せて推定することで、人間のAI信頼をキャリブレーションするフレームワークを提案する。大規模な実験(N=293)の結果、AIの信頼度のみに依存する場合と比較して、この二重CLアプローチは適切な信頼とチームパフォーマンスを著しく向上させた。
In AI-assisted decision-making, it is critical for human decision-makers to know when to trust AI and when to trust themselves. However, prior studies calibrated human trust only based on AI confidence indicating AI's correctness likelihood (CL) but ignored humans' CL, hindering optimal team decision-making. To mitigate this gap, we proposed to promote humans' appropriate trust based on the CL of both sides at a task-instance level. We first modeled humans' CL by approximating their decision-making models and computing their potential performance in similar instances. We demonstrated the feasibility and effectiveness of our model via two preliminary studies. Then, we proposed three CL exploitation strategies to calibrate users' trust explicitly/implicitly in the AI-assisted decision-making process. Results from a between-subjects experiment (N=293) showed that our CL exploitation strategies promoted more appropriate human trust in AI, compared with only using AI confidence. We further provided practical implications for more human-compatible AI-assisted decision-making.
研究の動機と目的
- 既存のAI支援意思決定システムが、人間の正答率の可能性(CL)を無視する一方でAIの信頼度のみに依存しているというギャップを解消すること。
- 対話型インターフェースを通じてユーザーの意思決定ルールを近似することで、タスク・インスタンスレベルでの人間の意思決定能力をモデル化すること。
- 人間とAIのCLを活用する戦略を設計・評価し、AI支援意思決定における適切な信頼を促進すること。
- 人間がAIよりも正答率が高いと予測される場合にのみAIを信頼するようにすることで、協働パフォーマンスを向上させること。
- 実世界の応用において、より人間中心的で信頼性の高いAIシステムを構築するための実践的設計指針を提供すること。
提案手法
- ユーザーが判断論理を表現するための意思決定ルールを定義する対話型ルールベースインターフェースを用いて、人間の意思決定プロセスの近似手法を提案した。
- ユーザーが定義したルールを用いて類似タスクインスタンスでのパフォーマンスをシミュレートすることで、人間のCLを推定し、ルールセットを人間の意思決定能力の代理として扱った。
- AIの信頼度スコアを、実際の正答率の可能性を反映することが知られている(Guo et al., 2017)、キャリブレーション済みの信頼度スコアを用いてAI CLを計算した。
- 人間とAIのCLの相対関係に基づき、明示的、暗黙的、適応的の3つのCL活用戦略を設計した。
- AIのCLが人間のCLを上回る場合はAIを信頼するように、そうでない場合は自分自身を信頼するようにすることで、信頼キャリブレーションを実装した。
- 被験者間実験(N=293)を実施し、AI信頼度のみに依存する場合と、人間とAIの両方のCLを用いる二重CLを比較し、信頼の適切さ、パフォーマンス、ユーザーエクスペリエンスを測定した。

実験結果
リサーチクエスチョン
- RQ1対話型ルールベースインターフェースを用いて、タスク・インスタンスレベルで人間の正答率の可能性(CL)を効果的にモデル化できるか?
- RQ2AI信頼度のみに依存するのと比較して、人間とAIの両方のCLを組み込むことで、AI支援意思決定における人間の信頼キャリブレーションがどのように向上するか?
- RQ3明示的、暗黙的、適応的の異なるCL活用戦略が、信頼の適切さ、タスクパフォーマンス、ユーザーエクスペリエンスに与える影響は何か?
- RQ4二重CLに基づく信頼キャリブレーションは、従来のAI信頼度のみのアプローチと比較して、より優れた協働意思決定結果をもたらすか?
- RQ5提案されたフレームワークは、異なるタスク分野やユーザーポピュレーションに一般化可能か?
主な発見
- 提案された人間CLモデリング手法は、ユーザーが判断論理を反映するように意思決定ルールを定義・変更できるようにし、ユーザーの意思決定行動を効果的に近似できた。
- AI信頼度のみに依存する場合と比較して、二重CLアプローチは人間のAI信頼の適切さを著しく向上させ、低精度のAI予測において過剰な信頼を減少させた。
- 適応的CL活用戦略が最も高い信頼の適切さを達成し、人間CLが上回る状況でAIを信頼する不適切な信頼が23%減少した(不適切な信頼とは、人間CLが高い状況でAIを信頼することを定義)。
- チームパフォーマンス(協働意思決定)は、二重CL条件の方がAI信頼度のみの条件よりも顕著に高く、相乗効果の向上が示された。
- 特に適応的戦略では、両方のCLを用いて信頼をキャリブレーションした場合、ユーザーは使いやすさをより良く感じ、認知的負荷が軽減されたと報告した。
- 非専門家が低リスクタスクで実施した結果は、強固であったが、高リスクまたは専門的分野への一般化可能性は未解決の課題のままである。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。