Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Stress Testing with Reward Augmentation for Autonomous Vehicle Validation

Anthony Corso, Peter Du|arXiv (Cornell University)|Aug 2, 2019
Vehicle Dynamics and Control Systems参考文献 15被引用数 21
ひとこと要約

本稿では、自律走行車の検証における適応的ストレステスト(AST)の報酬拡張を提案し、責任感受性安全(RSS)原則と軌道の類似度測度を統合することで、AVが不適切に振る舞う場合や多様な障害モードを発見するように報酬関数を変更する。この手法により、回避不能な障害や反復的障害に限定されない、より広範かつ関連性の高い障害シナリオの特定が可能となり、ベースラインASTでは検出されなかった車両誘発衝突を含む障害の多様性が向上したことが実証された。

ABSTRACT

Determining possible failure scenarios is a critical step in the evaluation of autonomous vehicle systems. Real-world vehicle testing is commonly employed for autonomous vehicle validation, but the costs and time requirements are high. Consequently, simulation-driven methods such as Adaptive Stress Testing (AST) have been proposed to aid in validation. AST formulates the problem of finding the most likely failure scenarios as a Markov decision process, which can be solved using reinforcement learning. In practice, AST tends to find scenarios where failure is unavoidable and tends to repeatedly discover the same types of failures of a system. This work addresses these issues by encoding domain relevant information into the search procedure. With this modification, the AST method discovers a larger and more expressive subset of the failure space when compared to the original AST formulation. We show that our approach is able to identify useful failure scenarios of an autonomous vehicle policy.

研究の動機と目的

  • 自律走行車の検証におけるASTの限界、すなわち回避不能な障害や反復的障害シナリオしか特定できないという問題に対処すること。
  • 責任感受性安全(RSS)フレームワークからのドメイン固有の知識を統合することで、ASTの関連性を向上させること。
  • 報酬関数に軌道の類似度測度を導入することで、障害モードの多様性を高めること。
  • 意味のある、ポリシー関連の弱みを特定することで、シミュレーションベースのAVポリシー検証をより効果的にすること。
  • 報酬拡張により、標準ASTよりも情報量の多い障害ケースを発見できることを実証すること。

提案手法

  • AVが衝突の可能性に対して適切に対応しないシナリオをペナルティ化するRSSベースのルールをAST報酬関数に追加する。
  • 状態軌道の違いを測定することで、異なる障害モードの探索を促進する軌道類似度測度を導入する。
  • シミュレーション環境において、拡張報酬関数の下でポリシーを最適化するためにモンテカルロ木探索(MCTS)を用いる。
  • 車両、歩行者、AV間の距離が閾値(例:0.5m未塔)未塔の場合を障害状態として定義する。
  • 性能評価のため、2台の車両と2名の歩行者が関与する横断歩道シナリオに拡張報酬関数を適用する。
  • 定量的障害タイプ数の比較と視覚的軌道分析を用いて、汎用ASTとRSSおよび類似度報酬を組み合わせたASTの結果を比較する。

実験結果

リサーチクエスチョン

  • RQ1RSSによる報酬拡張は、自律走行車が不適切に反応する障害の検出能力をASTが向上させるか?
  • RQ2軌道類似度測度を組み込むことで、ASTが発見する障害モードの多様性は向上するか?
  • RQ3拡張AST手法は、ベースラインASTと比較して、関連性の高い、ポリシーを露呈する障害シナリオをどのように特定するか?
  • RQ4RSSと類似度報酬の組み合わせにより、標準ASTでは検出されなかった車両誘発障害が発見可能か?
  • RQ5報酬拡張は、単一で情報のない障害モードへの収束をどの程度軽減するか?

主な発見

  • 汎用AST報酬では、25件中25件すべてが、停止中のAVがその進行方向に歩行者が進入するための歩行者誘発障害であった。
  • RSS報酬拡張により、AVが適切にブレーキをかけなかった4件の車両/歩行者障害が発見され、不適切な行動が明確に特定された。
  • 軌道類似度(TD)報酬により、追従車両が近すぎる距離に接近した6件の車両/車両障害が発見され、ポリシーの欠陥が明らかになった。
  • TD報酬手法により、ベースラインASTでは検出されなかった、車両誘発障害および車両/車両障害モードを含む障害の多様性が向上した。
  • 結果から、報酬拡張により、標準ASTと比較してより表現力があり関連性の高い障害空間が得られることを示した。
  • 視覚的分析により、拡張AST手法が、より多様で現実的かつポリシーを露呈する障害パターンを持つ軌道を生成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。