Skip to main content
QUICK REVIEW

[論文レビュー] Verifying Learning-Based Robotic Navigation Systems

Guy Amir, Davide Corsi|arXiv (Cornell University)|May 26, 2022
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本稿では、ロボットナビゲーションのための最適な深層強化学習(DRL)ポリシーを選択する検証駆動型アプローチを提示している。商用DNN検証ツールを用いて、衝突や無限ループなどの危険な行動、および過度に慎重な経路などの非最適行動を検出する。この手法により、現実のロボットシステムにおける効果的なモデル選択が可能となり、勾配ベースの攻撃法を上回り、物理的ロボット上で実用的な安全性の向上を示した。

ABSTRACT

Deep reinforcement learning (DRL) has become a dominant deep-learning paradigm for tasks where complex policies are learned within reactive systems. Unfortunately, these policies are known to be susceptible to bugs. Despite significant progress in DNN verification, there has been little work demonstrating the use of modern verification tools on real-world, DRL-controlled systems. In this case study, we attempt to begin bridging this gap, and focus on the important task of mapless robotic navigation -- a classic robotics problem, in which a robot, usually controlled by a DRL agent, needs to efficiently and safely navigate through an unknown arena towards a target. We demonstrate how modern verification engines can be used for effective model selection, i.e., selecting the best available policy for the robot in question from a pool of candidate policies. Specifically, we use verification to detect and rule out policies that may demonstrate suboptimal behavior, such as collisions and infinite loops. We also apply verification to identify models with overly conservative behavior, thus allowing users to choose superior policies, which might be better at finding shorter paths to a target. To validate our work, we conducted extensive experiments on an actual robot, and confirmed that the suboptimal policies detected by our method were indeed flawed. We also demonstrate the superiority of our verification-driven approach over state-of-the-art, gradient attacks. Our work is the first to establish the usefulness of DNN verification in identifying and filtering out suboptimal DRL policies in real-world robots, and we believe that the methods presented here are applicable to a wide range of systems that incorporate deep-learning-based agents.

研究の動機と目的

  • 形式的DNN検証と現実のDRL制御ロボットシステムの間のギャップを埋めること。
  • 特にマルチステップで反応的な行動をとる状況において、学習ベースのロボットナビゲーションにおける形式的セーフティ保証の欠如に対処すること。
  • 非最適または危険なDRLポリシーを特定・フィルタリングすることで、効果的なモデル選択を可能にすること。
  • 複数のトレーニングイテレーションにわたるトレーニングの安定性とポリシー改善に関する知見を提供すること。
  • 形式的検証の実用的適用可能性を、シミュレーションを越えて現実のロボットプラットフォームに示すこと。

提案手法

  • 商用DNN検証エンジンを活用し、DRLポリシーの安全性およびライブネス特性を分析する。
  • 複数回のポリシー実行にわたって、衝突回避、経路長の最小化、無限ループの不在といった性質を形式的に検証する。
  • 検証を用いて、衝突などの危険な行動と、過度に慎重な経路などの非最適行動の両方を検出する。
  • 検証の結果をもとに、候補となるDRLポリシー群からのモデル選択を実施する。
  • 検証ベースのフィルタリングと勾配ベースの攻撃法を比較し、耐性と検出能力を評価する。
  • 検証結果が物理的ロボット上で実際に確認されることを確認するため、実機での実験による結果の検証を行う。

実験結果

リサーチクエスチョン

  • RQ1形式的DNN検証技術は、現実のDRLベースのロボットナビゲーションシステムにおいて、危険な行動および非最適行動を検出できるか?
  • RQ2検証に基づくモデル選択は、勾配ベースの攻撃手法と比較して、欠陥のあるポリシーを特定する上で効果的か?
  • RQ3形式的検証は、トレーニングイテレーションにわたるDRLトレーニングプロセスの安定性と改善度合いに関する洞察をどの程度提供できるか?
  • RQ4検証ツールは、マルチステップナビゲーションタスクにおいて無限ループや衝突を引き起こすポリシーを効果的に特定できるか?
  • RQ5形式的検証をDRLエージェントの現実世界でのデプロイパイプラインに統合することは、スケーラビリティと実用性の観点からどの程度可能か?

主な発見

  • 検証フレームワークによって非最適とマークされたポリシーは、物理的ロボット上で実世界のテストにおいて衝突や無限ループを示すことが確認された。
  • 検証ベースのアプローチは、過度に慎重な行動を示すポリシーを効果的に特定・フィルタリングし、より短く効率的なナビゲーション経路の選択を可能にした。
  • 特に明白でないライブネスおよびセーフティ違反を特定する点で、最新の勾配ベースの攻撃法を上回り、問題のあるポリシーを検出する能力に優れた。
  • 検証により、トレーニングイテレーションにわたるポリシー行動の有意義な差が明らかになり、トレーニングの安定性と収束に関する知見が得られた。
  • 本手法は、実世界でのデプロイにおいて実用的で信頼性があることが実証され、物理的ロボット実験および公開動画デモによって結果が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。