Skip to main content
QUICK REVIEW

[論文レビュー] Widening the Pipeline in Human-Guided Reinforcement Learning with Explanation and Context-Aware Data Augmentation

Lin Guan, Mudit Verma|arXiv (Cornell University)|Jun 26, 2020
Explainable Artificial Intelligence (XAI)参考文献 65被引用数 15
ひとこと要約

この論文では、人間の視覚的説明(たとえば、関連する画像領域を強調するサリエンシーマップ)を深層強化学習に統合することで、サンプル効率を向上させる、人間を含むループ型強化学習のための新規手法EXPANDを提案する。文脈に配慮したデータ拡張を用い、説明における無関係な領域にのみ摂動を加えることで、方策学習を強化し、ベースラインと比較して人間のフィードバック信号を30%以上削減するとともに、環境のサンプル効率が優れている。

ABSTRACT

Human explanation (e.g., in terms of feature importance) has been recently used to extend the communication channel between human and agent in interactive machine learning. Under this setting, human trainers provide not only the ground truth but also some form of explanation. However, this kind of human guidance was only investigated in supervised learning tasks, and it remains unclear how to best incorporate this type of human knowledge into deep reinforcement learning. In this paper, we present the first study of using human visual explanations in human-in-the-loop reinforcement learning (HRL). We focus on the task of learning from feedback, in which the human trainer not only gives binary evaluative "good" or "bad" feedback for queried state-action pairs, but also provides a visual explanation by annotating relevant features in images. We propose EXPAND (EXPlanation AugmeNted feeDback) to encourage the model to encode task-relevant features through a context-aware data augmentation that only perturbs irrelevant features in human salient information. We choose five tasks, namely Pixel-Taxi and four Atari games, to evaluate the performance and sample efficiency of this approach. We show that our method significantly outperforms methods leveraging human explanation that are adapted from supervised learning, and Human-in-the-loop RL baselines that only utilize evaluative feedback.

研究の動機と目的

  • 二値の評価的判断を超えた人間のフィードバックを統合することで、深層強化学習(DRL)の限られたサンプル効率を改善すること。
  • 人間の視覚的説明(たとえば、サリエンシーのアノテーション)をDRLに効果的に統合し、学習効率を向上させること。
  • オフザシェルのオブジェクト検出器とトラッカーを活用して、部分的に自動化されたサリエンシーのアノテーションを実現することで、説明の提供にかかる人間の負担を軽減すること。
  • 無関係な領域にのみ摂動を加えることで、人間の説明の情報量を高めるデータ拡張戦略を開発すること。
  • 合成的および人間を含むループ型の設定の両方で評価を行い、環境および人間のフィードバックのサンプル効率において優れた性能を示すこと。

提案手法

  • EXPANDは、エージェントが人間のトレーナーから二値の「良い」または「悪い」フィードバックと、状態画像上の視覚的サリエンシーのアノテーションを要求する人間を含むループ型RLフレームワークを採用する。
  • 文脈に配慮したデータ拡張モジュールを用い、人間の説明で特定された非サリエント領域にのみ摂動(例:ガウスノイズ)を適用することで、タスクに必要な特徴を保持する。
  • 二重損失機構を導入:同一状態の拡張されたビュー間での予測の一貫性を強制する不変性損失と、拡張された状態と元の状態の予測を比較するアドバンテージ損失。
  • サリエンシーマップは、事前学習済みのオブジェクト検出器とトラッカーを用いて、人間がアノテートしたオブジェクトから自動生成される。これにより、アノテーションの負担が軽減される。
  • エージェントは、二値のフィードバックと拡張された説明信号の両方を用いて、同時に最適化するように変更されたDQNアルゴリズムで訓練される。
  • 関連する特徴と関係のない特徴を明確に比較することで、ターゲット摂動を用いることで、低データ環境でも安定的かつ効果的な学習が可能となる。

実験結果

リサーチクエスチョン

  • RQ1二値のフィードバックのみと比較して、人間の視覚的説明は、深層強化学習におけるサンプル効率を著しく向上させることができるか?
  • RQ2文脈に配慮したデータ拡張は、RLにおける人間の説明の情報量をどのように高めることができるか?
  • RQ3オブジェクト検出とトラッキングを用いて、低負担で部分的に自動化された形で人間の視覚的説明を収集することは可能か?
  • RQ4データ拡張を用いて人間の説明を統合することは、標準的なデータ拡張手法を上回る性能を発揮するか?
  • RQ5提案手法は、学習性能を維持または向上させながら、人間のフィードバック信号の数を削減できるか?

主な発見

  • EXPANDは、Pixel-Taxiと4つのAtariゲームを含む5つのタスクにおいて、環境のサンプル効率においてDQN-Feedbackおよび説明適応型教師あり学習のベースラインを著しく上回った。
  • ベースライン手法と比較して、人間のフィードバック信号の必要数を30%以上削減した。これは、人間のフィードバック効率の向上を示している。
  • 人間を含むループ型ユーザースタディーにおいて、30分間のインタラクション内にDQN-Feedbackを上回る性能を達成し、人間トレーナーが平均して2,026組のフィードバック-説明ペアを提供した。
  • 文脈に無関係なデータ拡張(例:ランダムクロップやガウスぼかし)は、一部のタスクで性能を低下させた。これは、文脈に配慮した摂動が、文脈に無関係な摂動よりも効果的であることを示している。
  • アブレーションスタディーにより、拡張データを用いた不変性損失とアドバンテージ損失の両方を組み合わせた場合が最良の性能を示した。各損失成分を別々に用いる場合でも、ベースラインより顕著な改善が得られた。
  • オフザシェルのオブジェクト検出器とトラッカーの使用により、部分的に自動化されたサリエンシーのアノテーションが可能となり、1回のクエリあたりの人のアノテーション時間は平均で約5分であった。これは、人間の負担が低いことを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。