Skip to main content
QUICK REVIEW

[論文レビュー] The Regretful Agent: Heuristic-Aided Navigation through Progress Estimation

Chih‐Yao Ma, Zuxuan Wu|arXiv (Cornell University)|Mar 5, 2019
Multimodal Machine Learning Applications参考文献 27被引用数 14
ひとこと要約

本論文は、ビジョンアンドランゲージナビゲーション(VLN)のための後悔付きエージェントを提案する。このエージェントは、ビームサーチの計算的負担を回避するため、学習可能な進行度モニタをヒューリスティックとして用い、グリーディ探索をガイドする。動的バックトラッキングを可能にするレジットモジュールと、進行度が低い状態の再訪問を減らすためのプログレスマーカーを導入し、テストサーバーで最先端の性能を達成した。成功確率が5%向上し、SPLが8%向上した。

ABSTRACT

As deep learning continues to make progress for challenging perception tasks, there is increased interest in combining vision, language, and decision-making. Specifically, the Vision and Language Navigation (VLN) task involves navigating to a goal purely from language instructions and visual information without explicit knowledge of the goal. Recent successful approaches have made in-roads in achieving good success rates for this task but rely on beam search, which thoroughly explores a large number of trajectories and is unrealistic for applications such as robotics. In this paper, inspired by the intuition of viewing the problem as search on a navigation graph, we propose to use a progress monitor developed in prior work as a learnable heuristic for search. We then propose two modules incorporated into an end-to-end architecture: 1) A learned mechanism to perform backtracking, which decides whether to continue moving forward or roll back to a previous state (Regret Module) and 2) A mechanism to help the agent decide which direction to go next by showing directions that are visited and their associated progress estimate (Progress Marker). Combined, the proposed approach significantly outperforms current state-of-the-art methods using greedy action selection, with 5% absolute improvement on the test server in success rates, and more importantly 8% on success rates normalized by the path length. Our code is available at https://github.com/chihyaoma/regretful-agent .

研究の動機と目的

  • ビジョンアンドランゲージナビゲーション(VLN)におけるビームサーチの非効率性を解消すること。これは、実世界のロボット工学において現実的ではない。
  • 学習可能なバックトラッキングと進行度推定を組み込むことで、グリーディ行動選択を効果的に可能にすること。
  • 過去の訪問履歴と進行度推定の記憶を活用することで、冗長な探索を減らし、成功確率と経路効率を向上させること。
  • ビームサーチを一切使用しないにもかかわらず、既存のグリーディ手法を上回るエンドツーエンドで訓練可能なアーキテクチャを開発すること。

提案手法

  • エージェントは、先行研究の学習可能な進行度モニタをヒューリスティックとして用い、ゴールに近いかどうかを推定する。値が高いほど進行度が良いことを示す。
  • レジットモジュールを導入し、視覚的および言語的履歴に基づいて、いつバックトラックすべきかを学習する。固定しきい値に代わるものである。
  • プログレスマーカー機構により、視覚的状態ベクトルに過去の進行度推定値を追加し、進行度が低い場所への再訪問を抑制する。
  • 行動選択のための密な教師信号として進行度モニタを提供し、模倣学習を用いてエンドツーエンドで訓練する。
  • バックトラック意思決定は微分可能であり、勾配降下法により最適なロールバックタイミングをネットワークが学習可能である。
  • 推論時にはグリーディデコードを用いるため、ビームサーチの指数的コストを回避しつつ、高い性能を維持する。

実験結果

リサーチクエスチョン

  • RQ1進行度推定に基づく学習可能なヒューリスティックは、ビジョンアンドランゲージタスクにおけるグリーディナビゲーションを改善できるか?
  • RQ2エージェントは、ドーンエンドに閉じ込められないように、いつバックトラックすべきかを学習できるか?
  • RQ3過去の訪問履歴とそれらの進行度推定値を記憶することで、冗長な探索を減らせるか?
  • RQ4進行度モニタをヒューリスティックとして用いることで、グリーディベースラインを上回る成功確率と経路効率が達成できるか?

主な発見

  • 提案されたエージェントは、ビームサーチを用いた最先端手法と比較して、テストサーバーで成功確率が5%絶対値で向上した。
  • SPL(Success-Precision-Length)は8%絶対値で向上した。これは、成功と経路効率の両方をバランスさせる指標である。
  • プログレスマーカーとレジットモジュールを用いることで、冗長な探索を学習的に回避する能力を有するため、グリーディベースラインを上回った。
  • アブレーションスタディの結果、レジットモジュールとプログレスマーカーの両方が性能向上に顕著な寄与をしていることが示された。
  • 進行度モニタを用いてバックトラックと再入をガイドすることで、曖昧な指示に対してもエージェントは成功してナビゲートできた。
  • 失敗事例では、稀ではあるが誤ったバックトラック意思決定が失敗を引き起こすことが判明しており、正確なレジット予測の重要性が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。