[論文レビュー] A Bayesian Account of Measures of Interpretability in Human-AI Interaction
本稿では、人間の信念更新に基づく一貫したモデルに、解読可能性、説明可能性、予測可能性の3つの主要な解釈可能性指標を統合する統一ベイズ枠組みを提案する。人間の心理状態を、真のモデルについての不確実性を含む複数のエージェントモデルに関する確率的信念としてモデル化することで、従来の解釈可能性指標の間の矛盾を解消し、ユーザースタディで観察された新しい行動的現象を説明する。
Existing approaches for the design of interpretable agent behavior consider different measures of interpretability in isolation. In this paper we posit that, in the design and deployment of human-aware agents in the real world, notions of interpretability are just some among many considerations; and the techniques developed in isolation lack two key properties to be useful when considered together: they need to be able to 1) deal with their mutually competing properties; and 2) an open world where the human is not just there to interpret behavior in one specific form. To this end, we consider three well-known instances of interpretable behavior studied in existing literature -- namely, explicability, legibility, and predictability -- and propose a revised model where all these behaviors can be meaningfully modeled together. We will highlight interesting consequences of this unified model and motivate, through results of a user study, why this revision is necessary.
研究の動機と目的
- 従来の解釈可能性指標(解読可能性、説明可能性、予測可能性)の間の統合の欠如に取り組むこと。
- 人間の観察者に関する心理モデルと信念構造に関する矛盾する仮定に起因する、これらの指標の根本的な不適合性を解消すること。
- 解釈可能性を、人間のエージェントモデルに関する信念の不確実性を考慮したベイズ推論プロセスとして理解する統一モデルを構築すること。
- ユーザースタディを通じたフレームワークの妥当性を検証し、従来のモデルでは捉えきれない行動を予測できることを示すこと。
- 将来的な計画立案とコミュニケーション戦略を可能にし、現実世界のヒューマン-AI協働において、複数の解釈可能性特性を同時に最適化できるようにすること。
提案手法
- 人間の観察者の信念状態を、真のモデルについての不確実性を表す「ノルマルモデル」(M⁰)を含む複数のエージェントモデルに関する確率分布としてモデル化する。
- 解読可能性、説明可能性、予測可能性の3つの解釈可能性指標を、観察されたエージェント行動に基づいて信念を更新する一貫したベイズ推論フレームワーク内で定式化する。
- 信念の「間違う可能性」(M⁰に対する非ゼロ事前確率)が、競合する解釈可能性特性の間の整合性を実現する重要なメカニズムであることを導入する。
- モデルの事後確率を解釈可能性の定義に用いる:真のモデルに対する事後信頼度が高いほど、解釈可能性が高くなる。
- 各解釈可能性指標を信念更新プロセスにおける異なる現象に対応付ける:解読可能性はモデル認識、説明可能性は期待との整合性、予測可能性は計画の予測を指す。
- 人間の認知的制限を反映する尤度関数を活用し、要約や簡略化された説明を用いることで解釈可能性を向上させる。
実験結果
リサーチクエスチョン
- RQ1解読可能性、説明可能性、予測可能性を、一貫した解釈可能性枠組みの下で意味的に統合することは可能か?
- RQ2人間がエージェントのモデルについて間違う可能性を抱く信念が、解釈可能性指標間の整合性を実現する上で果たす役割は何か?
- RQ3提示されたベイズ枠組みは、従来のモデルでは捉えきれない新たな行動的現象を予測できるか?
- RQ4既存の解釈可能性定式化における矛盾する仮定(例:単一仮説対複数仮説)が、それらの共存に与える影響は何か?
- RQ5コミュニケーションと説明を、複数の解釈可能性特性を同時に向上させる形で、フレームワークに形式的に統合する方法は何か?
主な発見
- 提示されたベイズ枠組みは、真のモデルについての不確実性を含む複数のエージェントモデルに関する人間の信念状態を確率分布としてモデル化することで、解読可能性、説明可能性、予測可能性を効果的に統合した。
- ノルマルモデル(M⁰)に対する非ゼロ事前確率の導入により、解釈可能性指標間の不適合性が解消され、かつては解読可能であった行動が不確実性下では説明不能または解読不能になる理由が説明された。
- ユーザースタディの結果、フレームワークは、エージェントが意図を示すことで、サブオプティマルな行動に対する許容度が上昇するといった、従来の孤立モデルでは捉えきれない新たな行動的特性を予測できた。
- 観察者が自らのモデルが誤っていると疑う場合、曖昧さに対する許容度が高くなるため、人間の観察者はエージェントが解読可能であると信じる場合、サブオプティマルな行動を受け入れる傾向があることが説明された。
- このモデルにより、観察者の現在の信念状態に応じて、解釈可能性特性を動的にバランスさせられるエージェントの設計が可能になった。これにより、1つの指標に最適化するのではなく、複数の指標を同時に最適化できる。
- 再定式化により、要約や因果的連鎖といった説明戦略を尤度関数に統合できるようになり、説明可能性を向上させつつ、予測可能性と解読可能性との整合性を維持できるようになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。