Skip to main content
QUICK REVIEW

[論文レビュー] AvE: Assistance via Empowerment

Yuqing Du, Stas Tiomkin|arXiv (Cornell University)|Jun 26, 2020
Robot Manipulation and Learning参考文献 48被引用数 14
ひとこと要約

本稿では、人間の目的を前提としないアプローチとして、アシスタンス・バイ・エマワーパメント(AvE)を提案する。この方法は、エージェントが人間の環境制御可能性を高めるように学習することで、人間の自律性を向上させる。共有自律性ユーザースタディで評価した結果、目的推定ベースの手法に比べ、曖昧または誤って定義された目的を持つ状況で優れた性能を示し、わずかなタスク完了遅延を除き、人間の成功確率を顕著に向上させた。

ABSTRACT

One difficulty in using artificial agents for human-assistive applications lies in the challenge of accurately assisting with a person's goal(s). Existing methods tend to rely on inferring the human's goal, which is challenging when there are many potential goals or when the set of candidate goals is difficult to identify. We propose a new paradigm for assistance by instead increasing the human's ability to control their environment, and formalize this approach by augmenting reinforcement learning with human empowerment. This task-agnostic objective preserves the person's autonomy and ability to achieve any eventual state. We test our approach against assistance based on goal inference, highlighting scenarios where our method overcomes failure modes stemming from goal ambiguity or misspecification. As existing methods for estimating empowerment in continuous domains are computationally hard, precluding its use in real time learned assistance, we also propose an efficient empowerment-inspired proxy metric. Using this, we are able to successfully demonstrate our method in a shared autonomy user study for a challenging simulated teleoperation task with human-in-the-loop training.

研究の動機と目的

  • 目的が不明または曖昧な状況における人間支援の課題に取り組むこと。これは、従来の目的推定に基づく支援手法の有効性を損なう要因である。
  • 人間の意図や報酬関数についての仮定を避けることで、人間の自律性を維持すること。
  • エマワーパメントをタスクに依存しない目的として形式化し、人間が望む任意の状態に到達できる能力を高めること。
  • 連続領域における正確なエマワーパメント推定の計算的非実行性を克服し、リアルタイムでの人間を含むループ環境への適用を可能にする、計算効率の良い代理指標を開発すること。
  • シミュレーテッド遠隔操作タスクを含む、人間を含むループ環境における共有自律性ユーザースタディを通じて、手法の実証的妥当性を検証すること。

提案手法

  • 支援を強化学習に人間のエマワーパメント目的を追加することで形式化し、エージェントが人間の現在の状態から到達可能な未来状態の対数を最大化するように学習する。
  • 均一なノイズ仮定のもとで、到達可能な状態の多様性を推定することで、真のエマワーパメントを近似する効率的な、エマワーパメントにインspiredされた代理指標を導入する。
  • 連続領域における正確なエマワーパメント推定の計算的非実行性を回避し、リアルタイムでのデプロイメントを可能にする。
  • エージェントは、人間の将来の選択肢を増やす行動を優先するポリシーを学習し、事前の目的の知識なしに制御可能性を高める。
  • 動的システム(例:Lunar Lander)の遠隔操作を含む、シミュレーテッド共有自律性タスクにおけるユーザースタディを通じて、手法を評価する。
  • 人間の成功確率とタスク完了時間の両方を指標として、目的推定ベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1目的推定が曖昧さや誤って定義された目的のため失敗する状況において、エマワーパメントに基づく目的に依存しない支援手法が、人間の成功確率を向上させることができるか?
  • RQ2真の目的が不明または誤ってモデル化されている状況において、エマワーパメントに基づく支援と目的推定に基づく支援の性能はどのように比較されるか?
  • RQ3エマワーパメントの根幹的な直感を保ちつつ、リアルタイムでの学習と人間を含むループ環境へのデプロイメントを可能にする、効率的なエマワーパメントの代理指標を設計できるか?
  • RQ4人間のエマワーパメントを高めることで、共有自律性シナリオにおけるシステムの安定性と制御性が向上するか?
  • RQ5エマワーパメントに基づく支援と目的に情報に基づく支援の間には、人間の成功確率とタスク完了速度のトレードオフが生じるか?

主な発見

  • AvEは、目的が曖昧または誤って定義された状況において、人間の成功確率を顕著に向上させ、目的推定ベースラインを上回った。
  • 目的セットが正しく定義されており、かつ小さい場合には、目的推定手法が依然としてAvEを上回った。これは、耐障害性と速度の間のトレードオフを示している。
  • 提案されたエマワーパメントにインspiredされた代理指標は、真のエマワーパメントの正確な測定ではないものの、リアルタイムでの学習と人間を含むループユーザースタディにおける成功したデプロイメントを可能にした。
  • この手法は、共有自律性タスクにおいて自然にシステムの安定化をもたらし、人間の成功確率の向上に寄与した。
  • ユーザースタディの結果、AvEは人間の目的を事前に知らなくても効果的な支援を可能にし、一般化された支援フレームワークとしての可能性を検証した。
  • 結果から、特に高リスクまたは不確実性の高い環境では、人間の制御可能性を高める(=エマワーパメントを高める)ことが、目的推定の代替として堅牢である可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。