[論文レビュー] Beyond Recommender: An Exploratory Study of the Effects of Different AI Roles in AI-Assisted Decision Making
本研究では、AIの役割(推薦者、分析者、反対意見表明者)が、AIの性能水準が異なる状況下で人間の意思決定に与える影響を調査している。結果から、AIの正確性が高水準(90%)の際は推薦者役が優れたパフォーマンスを示すが、AI性能が低水準(65%)の際は分析者役が著しく優れており、タスクパフォーマンスが向上し、適切な依存度が確保され、ユーザー体験も向上することがわかった。
Artificial Intelligence (AI) is increasingly employed in various decision-making tasks, typically as a Recommender, providing recommendations that the AI deems correct. However, recent studies suggest this may diminish human analytical thinking and lead to humans' inappropriate reliance on AI, impairing the synergy in human-AI teams. In contrast, human advisors in group decision-making perform various roles, such as analyzing alternative options or criticizing decision-makers to encourage their critical thinking. This diversity of roles has not yet been empirically explored in AI assistance. In this paper, we examine three AI roles: Recommender, Analyzer, and Devil's Advocate, and evaluate their effects across two AI performance levels. Our results show each role's distinct strengths and limitations in task performance, reliance appropriateness, and user experience. Notably, the Recommender role is not always the most effective, especially if the AI performance level is low, the Analyzer role may be preferable. These insights offer valuable implications for designing AI assistants with adaptive functional roles according to different situations.
研究の動機と目的
- AIの推薦を超えた役割を果たすことで、人間とAIの意思決定連携が改善されるかどうかを調査すること。
- AIが単に推薦者として機能する場合に生じる過剰な依存と分析的思考の低下という問題に取り組むこと。
- AI性能水準が、人間とAIの協働における異なるAI役割の有効性に与える調節効果を検討すること。
- AI役割がAI支援意思決定におけるタスクパフォーマンス、依存の適切さ、ユーザー体験に与える影響を調査すること。
- 文脈、性能、ユーザーのニーズに基づいた適応的AI役割設計の実証的証拠を提供すること。
提案手法
- Prolificを通じて180名の参加者を募集し、ニュース記事をビジネス、エンターテインメント、政治のカテゴリに分類する制御されたユーザースタディを実施。
- 3つのAI役割を実装:推薦者(推薦+説明を提供)、分析者(各選択肢の長所と短所を提示)、反対意見表明者(ユーザーの初期選択に反論)。
- 2つのAI性能水準(低:65%、高:90%)を評価し、6つの実験条件(3役割×2性能水準)を設定。
- タスクパフォーマンス、依存の適切さ(意思決定後の自己認識と正解との整合性)、ユーザー体験(満足度、有用性、信頼性)を測定。
- 混合手法分析を実施:パフォーマンスと依存の適切さには定量的指標、ユーザー体験の洞察には定性的フィードバックを活用。
- AI役割と性能水準の間の交互作用を分析し、統計的検定により条件間の差を検証。

実験結果
リサーチクエスチョン
- RQ1異なるAIアシスタント役割は、AI支援意思決定における人間のタスクパフォーマンスにどのように影響するか?
- RQ2異なるAIアシスタント役割は、人間のAIへの依存の適切さにどのように影響するか?
- RQ3異なるAIアシスタント役割は、満足度、信頼性、有用性を含むユーザー体験にどのように影響するか?
- RQ4AI性能水準は、異なるAI役割の有効性にどのように調節効果を示すか?
- RQ5各AI役割に対するユーザー行動パターン(例:関与度、抵抗行動)の背後にある要因は何か?
主な発見
- AI性能が高水準(90%正確性)の際、推薦者役が最高のタスクパフォーマンスを示し、参加者の85%が正しいカテゴリを選択した。
- AI性能が低水準(65%正確性)の際、分析者役が推薦者役を著しく上回り、正しく分類された割合は78%に達したのに対し、推薦者役は69%であった。
- 分析者役は両方の性能水準でより適切な依存度を促進し、特にAIが不正確な際の過剰な依存を低減した。
- AI性能が低水準の際、ユーザーは分析者役に対してより高い満足度、有用性、信頼性を報告しており、信頼性が低い状況下での良好なユーザー体験を示している。
- 反対意見表明者役は、AI性能にかかわらず一貫して関与度が低く、抵抗感が強く、ユーザーがAIによる批判的挑戦を避けがちなことが示された。
- AI性能が高水準の際、ユーザーは分析者による根拠に基づく分析により多く関与しており、高品質なAIがより深い認知的処理を支援していることがうかがえる。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。