Skip to main content
QUICK REVIEW

[論文レビュー] Deep Object-Centric Policies for Autonomous Driving

Dequan Wang, Coline Devin|arXiv (Cornell University)|Nov 13, 2018
Advanced Neural Network Applications参考文献 25被引用数 6
ひとこと要約

本論文は、学習可能なスパARSEなオブジェクト検出器を用いて、車両および歩行者を明示的に表現するオブジェクトセントリックな深層強化学習ポリシーを提案する。エンドツーエンドのポリシーに離散的でアテンションベースのオブジェクト表現を統合することで、複雑な都市環境におけるロバスト性が向上し、シミュレーションおよびリアルワールドの低データ環境において、衝突回避および走行距離の指標でオブジェクトに依存しないモデルを上回る性能を発揮する。

ABSTRACT

While learning visuomotor skills in an end-to-end manner is appealing, deep neural networks are often uninterpretable and fail in surprising ways. For robotics tasks, such as autonomous driving, models that explicitly represent objects may be more robust to new scenes and provide intuitive visualizations. We describe a taxonomy of "object-centric" models which leverage both object instances and end-to-end learning. In the Grand Theft Auto V simulator, we show that object-centric models outperform object-agnostic methods in scenes with other vehicles and pedestrians, even with an imperfect detector. We also demonstrate that our architectures perform well on real-world environments by evaluating on the Berkeley DeepDrive Video dataset, where an object-centric model outperforms object-agnostic models in the low-data regimes.

研究の動機と目的

  • エンドツーエンドの視覚的モーターポリシーの現実世界における自動運転における脆さを解消するため、明示的なオブジェクト表現を組み込む。
  • 推論時にレアまたは未観測のオブジェクトを処理する際の、包括的でピクセルレベルのアテンションやオブジェクトに依存しないモデルの限界を克服する。
  • 学習可能なアテンション機構を活用したオブジェクトセントリック表現により、サンプル効率とロバスト性を向上させ、低データ環境での性能を強化する。
  • スパARSEで離散的なオブジェクト表現に個々のオブジェクトに対するアテンションを適用した手法が、複雑な都市走行シナリオにおいて、密度の高いまたはグローバルな表現を上回ることを示す。
  • オブジェクトの選択にどの程度関連するかを可視化することで、ポリシーの意思決定を解釈可能にする。

提案手法

  • グローバル画像特徴と、検出されたオブジェクトからROIプールされた特徴を処理する2本のブランチからなる特徴抽出ネットワークを用いる。
  • 各検出オブジェクトのタスク固有の重要度スコアを、微分可能アテンション機構を用いて計算する学習可能なオブジェクトセレクタレイヤーを適用する。
  • グローバル特徴とオブジェクトレベル特徴を連結またはプーリングして、ポリシーのヘッド用のハイブリッド表現を形成する。
  • エキスパートのデモンストレーションから強化学習を用いて、エンドツーエンドで学習する。特に、不要なオブジェクトからのノイズを低減するため、スパARSEなオブジェクト選択に注力する。
  • オブジェクト検出器(例:MSCOCOで学習済み)を弱教師付きの事前知識として統合するが、検出結果が不完全であっても問題ない。
  • 一般化性能とデータ効率を評価するために、ポリシー内(GTAVでのシミュレーテッドドライブ)およびポリシー外(リアルワールドのBDDVデータセット)の両方の設定で評価する。

実験結果

リサーチクエスチョン

  • RQ1オブジェクトセントリック表現は、複雑な都市環境におけるエンドツーエンド走行ポリシーのロバスト性とサンプル効率を向上させることができるか?
  • RQ2密度の高い表現とスパARSEな表現の選択が、ポリシー性能と解釈可能性に与える影響は何か?
  • RQ3オブジェクト選択に学習可能なアテンション機構を用いることで、ヒューリスティックな手法(例:サイズベースの選択)を上回る性能が得られるか?
  • RQ4オブジェクトセントリックモデルは、不完全な検出結果と限られた学習データを伴うリアルワールドデータにどの程度一般化できるか?
  • RQ5走行距離、衝突頻度、干渉頻度という観点から、オブジェクトセントリックモデルはピクセルレベルのアテンションやグローバル表現ベースラインと比べてどの程度優れているか?

主な発見

  • 学習可能なアテンションを備えたスパARSEなオブジェクトセントリックモデルは、グランド・トゥルース・バージョンのGTAVシミュレータ上でのポリシー内評価において、オブジェクトに依存しないモデルやピクセルレベルのアテンションモデルを上回り、より長い走行距離と少ない衝突回数を達成した。
  • 都市環境において、スパARSEモデルはベースラインと比較して干渉回数を30%削減し、干渉までの平均走行距離を25%向上させた。
  • 事前学習済みの検出器(MSCOCO)からのオブジェクト検出結果を用いても、モデルは強い性能を維持しており、ノイズや不完全な検出に対してもロバストであることが示された。
  • リアルワールドのBerkeley DeepDrive Videoデータセットでは、特徴連結を用いたスパARSEなオブジェクトモデルが、データ量が5%~50%の低データ環境で最も低いパープレキシティを達成し、優れたデータ効率を示した。
  • すべての指標において、学習可能なセレクタはヒューリスティックなサイズベースのセレクタを上回り、アテンションとポリシーの共同最適化の利点を実証した。
  • モデルのアテンション機構は、歩行者や近隣の車両を適切に優先し、障害物に向かって加速するのではなく、慎重な行動(例:ブレーキング)を取ることを可能にした。これは、ベースラインの失敗事例の可視化からも裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。