Skip to main content
QUICK REVIEW

[論文レビュー] Imitation Learning with Human Eye Gaze via Multi-Objective Prediction

Ravi Kumar Thakur, MD-Nazmus Samin Sunbeam|arXiv (Cornell University)|Feb 25, 2021
Gaze Tracking and Assistive Technology被引用数 4
ひとこと要約

本稿では、視覚的模倣学習におけるサンプル効率性と一般化性能を向上させるために、人間の行動と視線を同時に予測するマルチオブジェクティブな深層学習フレームワーク、Gaze-Regularized Imitation Learning (GRIL) を提案する。GRIL は、フォトリッチなマルチローター航空機ナビゲーションタスクにおいて、最先端の手法を上回り、未観測のシナリオに一般化し、人間の視覚的注意パターンを正確に予測する。

ABSTRACT

Approaches for teaching learning agents via human demonstrations have been widely studied and successfully applied to multiple domains. However, the majority of imitation learning work utilizes only behavioral information from the demonstrator, i.e. which actions were taken, and ignores other useful information. In particular, eye gaze information can give valuable insight towards where the demonstrator is allocating visual attention, and holds the potential to improve agent performance and generalization. In this work, we propose Gaze Regularized Imitation Learning (GRIL), a novel context-aware, imitation learning architecture that learns concurrently from both human demonstrations and eye gaze to solve tasks where visual attention provides important context. We apply GRIL to a visual navigation task, in which an unmanned quadrotor is trained to search for and navigate to a target vehicle in a photorealistic simulated environment. We show that GRIL outperforms several state-of-the-art gaze-based imitation learning algorithms, simultaneously learns to predict human visual attention, and generalizes to scenarios not present in the training data. Supplemental videos and code can be found at https://sites.google.com/view/gaze-regularized-il/.

研究の動機と目的

  • 人間の視線を文脈的情報として組み込むことで、模倣学習のサンプル効率性と一般化性能を向上させること。
  • 人間の行動と視線データを同時に学習できる文脈に配慮したエンドツーエンドのアーキテクチャを構築すること。
  • 自律マルチローター航空機ナビゲーションのような複雑で高次元の制御タスクにおいて、視線正則化の有効性を実証すること。
  • 訓練中に見られなかった新しいシナリオ(例えば移動するターゲットや新しい環境)への一般化を可能にすること。
  • 従来の視線拡張型模倣学習手法よりも単純でパラメータ効率の良い代替手法を提供すること。

提案手法

  • GRIL は、共有エンコーダーと2つの並列ヘッド(行動予測用と視線座標予測用)を備えたマルチオブジェクティブ学習アーキテクチャを採用する。
  • モデルは、RGB画像、制御命令、各タイムステップにおける視線座標を含む人間のデモンストレーションデータを用いて教師あり学習で訓練される。
  • 行動予測と視線予測の両方のMSE損失を組み合わせたマルチタスク損失関数を用い、同時に最適化を実現する。
  • 視線予測ヘッドは正則化子として機能し、タスクに関連する顕著な視覚的特徴にポリシーが注目するよう促す。
  • パラメータ数を削減し、訓練効率を向上させるために、視覚的特徴を抽出するための単一の共有バックボーンネットワークを採用する。
  • 本手法は、ターゲット車両への自律マルチローター航空機ナビゲーションを対象としたフォトリッチな AirSim シミュレータで評価されている。

実験結果

リサーチクエスチョン

  • RQ1人間の行動と視線の同時予測が、複雑な視覚的制御タスクにおける模倣学習のサンプル効率性を向上させることができるか?
  • RQ2視線正則化は、移動するターゲットや新しい環境といった未観測のシナリオへのポリシーの一般化をどのように向上させるか?
  • RQ3視線座標を直接予測するマルチオブジェクティブアーキテクチャは、視線ヒートマップや別個の視線ネットワークを必要とする手法を上回る性能を発揮するか?
  • RQ4GRIL は、ナビゲーション中に人間と同様の視覚的注意パターン(例:ターゲットへの注視、障害物への注視)を再現できるか?
  • RQ5視線予測損失は、高次元で連続的な制御設定におけるモデルのロバストネスと一般化性能にどのような影響を与えるか?

主な発見

  • GRIL は、マルチローター航空機ナビゲーションタスクにおいて、標準的な行動クラッシングおよび最先端の視線拡張型手法(AGIL および CGL)を顕著に上回る性能を示した。
  • GRIL は、移動するターゲットを含む新しいタスクに対しても効果的に一般化でき、訓練分布外のシナリオに対してもロバストであることが示された。
  • モデルは、人間のデモンストレーションで観察されたように、ターゲットへの注視、サッケード、障害物への注視といった人間の視覚的注意パターンを効果的に学習した。
  • CGL がヒートマップとKLダイバージェンスに依存するのに対し、GRIL はより少ないパラメータ数と単純な損失関数で優れた性能を達成した。
  • 視線予測ヘッドは効果的な正則化子として機能し、過学習とラデマッハープレックスキシティを低減させ、一般化性能を向上させた。
  • GRIL の共同最適化フレームワークにより、共有表現学習を通じてタスク関連の視覚的特徴にポリシーが集中するようになり、より効率的な学習が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。