[論文レビュー] Bridging the Gap: Providing Post-Hoc Symbolic Explanations for Sequential Decision-Making Problems with Inscrutable Representations
本論文は、内部表現が透徹しない順序的意思決定エージェントに対して、ユーザーが指定した概念における対照的で後から生成される記号的説明を生成するフレームワークを提案する。エージェントの軌道から局所的な記号的動的モデル(例:PDDLに類似)を学習することで、ある行動シーケンスが他の代替シーケンスよりも好まれる理由を説明し、モンテズマのレインジングおよびソコバンの変種におけるユーザースタディを通じて高い説明的信頼性と有用性が検証された。
As increasingly complex AI systems are introduced into our daily lives, it becomes important for such systems to be capable of explaining the rationale for their decisions and allowing users to contest these decisions. A significant hurdle to allowing for such explanatory dialogue could be the vocabulary mismatch between the user and the AI system. This paper introduces methods for providing contrastive explanations in terms of user-specified concepts for sequential decision-making settings where the system's model of the task may be best represented as an inscrutable model. We do this by building partial symbolic models of a local approximation of the task that can be leveraged to answer the user queries. We test these methods on a popular Atari game (Montezuma's Revenge) and variants of Sokoban (a well-known planning benchmark) and report the results of user studies to evaluate whether people find explanations generated in this form useful.
研究の動機と目的
- 順序的意思決定の文脈において、AIシステムと人間ユーザーの間の語彙の不一致を解消すること。
- 人間が理解できる概念を用いて、ある行動が他の代替行動よりも好まれる理由という対照的説明をAIシステムが生成できることを可能にすること。
- エージェントの内部モデルの局所的な記号的近似を構築し、ユーザー指定の用語で事前条件と効果を捉えること。
- 説明の質を保証するため、忠実度のしきい値に基づく指標である説明的信頼性を導入すること。
- IRB承認を得たユーザースタディを通じて、実世界の順序的意思決定タスクにおけるこのような説明の有用性を評価すること。
提案手法
- エージェント実行中に収集した状態-行動-状態の軌道から、局所的な記号的動的モデル(例:PDDL風)を構築する。
- 学習された分類器を用いて、ユーザーが指定した概念をエージェントの内部表現にマッピングする。
- 学習された記号的モデルを用いて、代替行動シーケンスの事前条件と効果を分析することで、対照的クエリに答えを出す。
- 説明の信頼性を、モデルがエージェントの実際の行動にどの程度忠実であるかを確率的推定値として計算する。
- 現在の語彙が不十分な場合に、能動的に関連する新しい概念を取得するためのメタ順序的意思決定フレームワークを統合する。
- 確率的設定への拡張経路を含め、決定論的な順序的意思決定タスクに本手法を適用する。
実験結果
リサーチクエスチョン
- RQ1内部表現が透徹しないエージェントが行う順序的意思決定について、AIシステムはユーザーが指定した概念における対照的説明を生成できるか?
- RQ2ユーザースタディの結果から測定した場合、このような説明はユーザーの理解力と信頼性の向上にどの程度効果的か?
- RQ3説明的信頼性は、説明の質およびユーザーの信頼性の認識とどの程度相関しているか?
- RQ4ユーザーの語彙が不十分である場合に、システムはそれを検出し、関連する新しい概念の取得を誘導できるか?
- RQ5ユーザーの理解力と実用性の観点から、本手法は類似のサリエンシー基盤または特徴基盤の説明手法と比較してどの程度優れているか?
主な発見
- モンテズマのレインジングおよびソコバンの変種におけるユーザースタディでは、参加者が本手法を用いて生成された対照的説明が有用で理解しやすいと評価した。
- システムの説明的信頼性メトリクスは、低忠実度の説明を効果的にフィルタリングし、説明プロセスの信頼性を向上させた。
- 本手法は、エージェントの内部モデルが非記号的で不透明であっても、ユーザー定義の概念に基づいた説明を成功裏に生成した。
- 本フレームワークは、現在の概念セットが不十分であるケースを特定する可能性を示し、概念取得の構造的アプローチを可能にした。
- 信頼性しきい値の統合により、誤った説明のリスクが低減され、人間とAIの協働における信頼性が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。