[論文レビュー] Towards Human-centered Explainable AI: A Survey of User Studies for Model Explanations
本論文は、説明可能AI(XAI)分野における97件のユーザーストゥディーを体系的レビューし、信頼、理解、使いやすさ、人間とAIの協働パフォーマンスといった評価次元を同定した。人間中心のアプローチに基づくXAIユーザーストゥディー設計の実用的で人的中心のガイドラインを提言するとともに、評価の厳密さと現実世界への適用可能性を高めるために、認知科学および社会科学の統合の必要性を強調している。
Explainable AI (XAI) is widely viewed as a sine qua non for ever-expanding AI research. A better understanding of the needs of XAI users, as well as human-centered evaluations of explainable models are both a necessity and a challenge. In this paper, we explore how HCI and AI researchers conduct user studies in XAI applications based on a systematic literature review. After identifying and thoroughly analyzing 97core papers with human-based XAI evaluations over the past five years, we categorize them along the measured characteristics of explanatory methods, namely trust, understanding, usability, and human-AI collaboration performance. Our research shows that XAI is spreading more rapidly in certain application domains, such as recommender systems than in others, but that user evaluations are still rather sparse and incorporate hardly any insights from cognitive or social sciences. Based on a comprehensive discussion of best practices, i.e., common models, design choices, and measures in user studies, we propose practical guidelines on designing and conducting user studies for XAI researchers and practitioners. Lastly, this survey also highlights several open research directions, particularly linking psychological science and human-centered XAI.
研究の動機と目的
- 最近のユーザーストゥディーを分析することで、説明可能AI(XAI)における標準化された人間中心の評価の欠如に対処すること。
- 信頼、理解、使いやすさ、協働パフォーマンスといった、XAIユーザーストゥディーで用いられる主な評価次元を特定・分類すること。
- モデル選定、タスク設計、測定技術といった、XAI研究者および実務家にとってのベストプラクティスを抽出すること。
- 現在のXAI評価において、認知科学および社会科学の知見が不十分に活用されていることの顕在化。
- より透明性が高く信頼性があり、人間と整合性を持つXAI評価のための実行可能なガイドラインを提言し、未解決の研究方向性を同定すること。
提案手法
- 最近5年間で発表された、ハイパーカード(HCI)および機械学習(ML)分野の主要会議(例:CHI、NeurIPS、AAAI)から選ばれた97本の主要論文を対象に、体系的文献レビューを実施した。
- 測定された特性(信頼、理解(主観的および客観的)、使いやすさ(作業負荷、満足度、有用性)、人間とAIの協働パフォーマンス)に基づき、ユーザーストゥディーを分類した。
- 代理タスク、説明タイプ、評価指標といった共通する設計選択を分析し、繰り返し現れるパターンとベストプラクティスを同定した。
- 模擬タスクと現実世界の意思決定状況との比較を通じて、代理タスクの妥当性を評価した。
- 予測情報の測定を用いて説明を事前スクリーニングするためのシミュレーテッド評価フレームワーク(SimEvals)を提言した。これにより、高コストな人間による試験への依存を低減できる。
- 大規模言語モデルを評価環境で人間の反応をシミュレートするのに活用したが、認知バイアスの再現に関する懸念を示した。
実験結果
リサーチクエスチョン
- RQ1最近のXAIユーザーストゥディーで支配的である評価次元は何か。また、それらはどのように測定されているか。
- RQ2異なる応用分野において、研究結果はどの程度一貫しており、説明の有効性に影響を与える要因は何か。
- RQ3現在のXAIユーザーストゥディーにおける代理タスクは、現実世界の意思決定パフォーマンスをどの程度正確に予測できるか。
- RQ4XAIユーザーストゥディーで一般的に見られる方法論的パターンと設計選択は何か。また、それらから導き出せるベストプラクティスは何か。
- RQ5認知科学および社会科学の知見は、どのようにXAI評価に統合され、妥当性と人間的関連性を向上させることができるか。
主な発見
- XAI評価プロジェクトの約20%しか人間被験者を含んでおらず、人間中心の検証における顕著なギャップが示された。
- 信頼と理解が最も頻繁に測定される次元であり、主観的理解はしばしばメンタルモデル構築タスクによって評価される。
- メンタルモデル構築などの代理タスクは、実際の意思決定タスクにおけるパフォーマンスを信頼性高く予測できないことが示され、評価と現実世界の使用との間には乖離が生じている可能性がある。
- 認知科学や社会科学の理論は、現在のXAIユーザーストゥディーにおいては限定的に統合されており、評価の妥当性を高める可能性を秘めているにもかかわらず、活用が不十分である。
- SimEvalsのようなシミュレーテッド評価フレームワークは、予測情報の測定を用いて説明を効果的に事前スクリーニングでき、人間による完全な試験に代わるコスト効率の高い代替手段を提供する。
- 大規模言語モデルは人間の反応をシミュレートする上で有望であるが、未モデル化された認知バイアスや文脈的ニュアンスを反映できないため、人間評価を代替することは現段階で不可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。