[論文レビュー] Order Matters: Generating Progressive Explanations for Planning Tasks in Human-Robot Teaming
本稿では、人間の認知的好みを情報順序に沿ってモデル化するための段階的説明生成(PEG)フレームワークを提案する。このフレームワークは、逆強化学習(IRL)を用いた目的ベースのマルコフ決定過程(MDP)を用いる。本手法は人間の好みデータから報酬関数を学習し、認知的受容に沿って順序付けられた段階的説明が、認知的負荷を軽減し、タスクパフォーマンスを10.9%向上させ、NASA TLXで18.5%の負荷感低下を示した。
Prior work on generating explanations in a planning and decision-making context has focused on providing the rationale behind an AI agent's decision making. While these methods provide the right explanations from the explainer's perspective, they fail to heed the cognitive requirement of understanding an explanation from the explainee's (the human's) perspective. In this work, we set out to address this issue by first considering the influence of information order in an explanation, or the progressiveness of explanations. Intuitively, progression builds later concepts on previous ones and is known to contribute to better learning. In this work, we aim to investigate similar effects during explanation generation when an explanation is broken into multiple parts that are communicated sequentially. The challenge here lies in modeling the humans' preferences for information order in receiving such explanations to assist understanding. Given this sequential process, a formulation based on goal-based MDP for generating progressive explanations is presented. The reward function of this MDP is learned via inverse reinforcement learning based on explanations that are retrieved via human subject studies. We first evaluated our approach on a scavenger-hunt domain to demonstrate its effectively in capturing the humans' preferences. Upon analyzing the results, it revealed something more fundamental: the preferences arise strongly from both domain dependent and independence features. The correlation with domain independent features pushed us to verify this result further in an escape room domain. Results confirmed our hypothesis that the process of understanding an explanation was a dynamic process. The human preference that reflected this aspect corresponded exactly to the progression for knowledge assimilation hidden deeper in our cognitive process.
研究の動機と目的
- 説明者中心の説明生成のギャップに取り組むこと。これは、説明を受け手の認知的負荷と理解プロセスを考慮しない。
- 段階的説明における情報順序に関する人間の好みをモデル化すること。進行性の順序が理解を向上させることを認識する。
- 認知的負荷を最小限に抑えつつタスクパフォーマンスを最大化するように説明ステップの順序を学習する汎用的フレームワークを開発すること。
- ドメインに依存しない特徴(例:アクション距離、レーベンシュタイン距離)とドメインに依存する特徴(例:イベントの空間的位置)が、人間の説明順序に対する好みをどのように統合的に形成するかを検証すること。
- 進行的説明(認知的受容に沿って順序付けられた)が、客観的なタスク正確性と主観的な認知的負荷指標の両方で測定可能な向上をもたらすことを実証すること。
提案手法
- 段階的説明生成を、各状態が部分的説明を表し、アクションが次の説明ステップを追加することを意味する目的ベースのマルコフ決定過程(MDP)として定式化する。
- 人間の好みデータをMTurkを用いたクラウドソーシング研究で収集し、そのデータから報酬関数を学ぶために逆強化学習(IRL)を採用する。
- ドメインに依存しない特徴(例:アクション距離、レーベンシュタイン距離)とドメインに依存する特徴(例:x_min、y_min、x_max、y_max)の組み合わせを用いて、説明遷移の認知的コストを表現する。
- スカベンジャーハンティングドメインで21件の人工ラベル付き説明シーケンスを用いて報酬関数を学習し、エスケープルームドメインで87名の被験者を用いてテストする。
- 学習された報酬関数を用いて、認識される認知的負荷を最小限に抑えつつタスクパフォーマンスを最大化する段階的説明を生成する。
- 2つの異なるドメインで、主観的(NASA TLX)および客観的(タスク正確性)の指標を用いて、手法の妥当性を検証する。
実験結果
リサーチクエスチョン
- RQ1人間は段階的説明における情報順序に対して測定可能な好みを示しており、その好みは学習可能か?
- RQ2ドメインに依存しない特徴(例:アクション距離、レーベンシュタイン距離)とドメインに依存する特徴(例:イベントの空間的位置)が、人間の説明順序に対する好みにどの程度影響を及ぼすか?
- RQ3認知的受容に沿って順序付けられた進行的説明は、非進行的ベースラインと比較して、タスクパフォーマンスの向上と認知的負荷の低下をもたらすか?
- RQ4説明理解の認知的プロセスは動的であると想定され、その動的性質はIRLによって学習された特徴重みに反映されるか?
- RQ5提案されたフレームワークは、スカベンジャーハンティングおよびエスケープルームなど異なるドメインに一般化可能であり、説明品質の向上を一貫して維持できるか?
主な発見
- 提案されたPEG手法は、NASA TLXの全指標においてランダム、マンハッタン、およびベースライン手法を著しく上回り、加重TLXスコアで統計的に有意な改善(p < 0.05)を示した。
- エスケープルームドメインでは、タスク正確性がランダムの85.4%からPEGの96.3%に上昇し、10.9ポイントの向上を達成した。
- レーベンシュタイン距離とアクション距離の特徴が最も高い正規化重み(それぞれ0.46および0.44)を示し、認知的負荷の認識に強い影響を与えることが示された。
- プランコスト距離特徴の重みは低く(0.04)あり、エスケープルームドメインではプランコストの増加が認知的負荷の増加と相関しないことを示唆した。
- PEGによって生成された説明シーケンスは、ステップごとのアクション距離曲線が滑らかになっており、説明フローの進行性が視覚的に確認された。
- 結果は、人間の説明順序に対する好みが、ドメインに依存しない特徴とドメインに依存する特徴の両方によって形成されることを確認し、説明理解過程における認知的受容の動的性を裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。