Skip to main content
QUICK REVIEW

[論文レビュー] Conditional Driving from Natural Language Instructions

Junha Roh, Chris Paxton|arXiv (Cornell University)|Oct 16, 2019
Multimodal Machine Learning Applications参考文献 28被引用数 10
ひとこと要約

本稿では、自然言語指令を解釈し、画像観測と条件付き模倣学習を用いて自律走行車を制御する階層的で言語に根ざしたドライブポリシーを提案する。ゲート付きアテンションと再帰的ネットワークを介して高レベルの言語推論と低レベルの連続的制御を統合することで、誤ったまたは遮断された指令でさえも、多様な環境において堅牢で安全なナビゲーションを実現する。CARLAシミュレーションにおいて、強力な一般化性能とリアルタイム相互作用性能を示している。

ABSTRACT

Widespread adoption of self-driving cars will depend not only on their safety but largely on their ability to interact with human users. Just like human drivers, self-driving cars will be expected to understand and safely follow natural-language directions that suddenly alter the pre-planned route according to user's preference or in presence of ambiguities, particularly in locations with poor or outdated map coverage. To this end, we propose a language-grounded driving agent implementing a hierarchical policy using recurrent layers and gated attention. The hierarchical approach enables us to reason both in terms of high-level language instructions describing long time horizons and low-level, complex, continuous state/action spaces required for real-time control of a self-driving car. We train our policy with conditional imitation learning from realistic language data collected from human drivers and navigators. Through quantitative and interactive experiments within the CARLA framework, we show that our model can successfully interpret language instructions and follow them safely, even when generalizing to previously unseen environments. Code and video are available at https://sites.google.com/view/language-grounded-driving.

研究の動機と目的

  • 自律走行車がリアルタイムで自然言語指令を解釈し、実行可能にする。これは、人間のドライバーとの相互作用を模倣することを目的とする。
  • 『T字路でまっすぐ進む』などの曖昧または誤った言語命令が与えられた場合でも、安全な行動を保証すること。
  • 未確認の環境に一般化し、ナビゲーション中に動的かつリアルタイムのユーザーの中断に対処できること。
  • 長時間スパンの言語指令を理由付けしながら、リアルタイム制御を維持するための階層的ポリシーを開発すること。

提案手法

  • モデルは、言語指令を部分的タスクにマッピングする高レベルポリシーと、連続的ステアリング/アクセル操作を生成する低レベルポリシーを持つ階層的アーキテクチャを採用する。
  • 条件付き模倣学習により、人間ドライバーとナビゲーターから収集した実世界の言語データを用いてポリシーを学習する。
  • 高レベルポリシーでは、ゲート付きアテンション機構を用い、言語的特徴と視覚的特徴の両方に条件づけた部分タスク予測を実現する。
  • 低レベルポリシーは、部分タスクの埋め込みと画像観測に条件づけられており、実行中の細かい制御を可能にする。
  • リアルタイムの指令切り替えをサポート:新しい命令が進行中の操作を中断し、現在の部分タスクを完了した後、切り替える。
  • 評価には、真値セグメンテーションマップとリアルタイムのユーザー相互作用プロトコルを備えたCARLAシミュレータを用い、耐障害性をテストする。

実験結果

リサーチクエスチョン

  • RQ1自律走行エージェントは、曖昧または誤った指令であっても、リアルタイムで自然言語指令を解釈し、従うことができるか?
  • RQ2視覚的および言語的入力を統合することで、誤った命令下でもナビゲーションの耐障害性と安全性がどのように向上するか?
  • RQ3階層的構造は、未確認の環境や長時間スパンの言語指令にどの程度一般化できるか?
  • RQ4アクティブな操作実行中にリアルタイムで中断を受けるユーザー入力を、モデルはどのように処理するか?

主な発見

  • 画像と言語の入力を用いた完全なモデル(H_ikh)は、誤った指令を含むテストシーケンスで94.6%の成功率を達成した。
  • 高レベルポリシーに画像観測を組み込むことで、画像なしベースラインと比較して誤差率が著しく低下し、誤った命令に対する性能が顕著に向上した。
  • ユーザーが矛盾した命令や不適切なタイミングの命令を発行しても、安全でタスク完了の両方を維持した。これは、リアルタイムの中断に対する耐障害性を示している。
  • アブレーションスタディの結果、部分タスク条件付きのゲート付きアテンションベースの低レベルポリシーは、固定レイヤー切り替えと同等の性能を示し、将来的な複雑なタスクに対しても柔軟性があることが示された。
  • モデルは新しい環境への一般化が効果的であり、CARLAにおける異なるマップレイアウトやナビゲーションシナリオにおいて、強力な転送性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。