Skip to main content
QUICK REVIEW

[論文レビュー] Learn-to-Race Challenge 2022: Benchmarking Safe Learning and Cross-domain Generalisation in Autonomous Racing

Jonathan Francis, Bingqing Chen|arXiv (Cornell University)|May 5, 2022
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

本論文は、安全な学習とクロスドメイン一般化に注力した強化学習エージェントの評価を目的とした、L2R Task 2.0 シミュレーションフレームワークを用いた「Learn-to-Race 2022」バーチャルチャレンジを提示する。このチャレンジでは、88 以上の機関に所属する 46 チームから 733 件のモデル提出が寄せられ、ポリシー蒸留と分布に配慮した模倣学習が、安全制約下での未確認レーストラックへの一般化性能とロバストネスを顕著に向上させたことを示した。

ABSTRACT

We present the results of our autonomous racing virtual challenge, based on the newly-released Learn-to-Race (L2R) simulation framework, which seeks to encourage interdisciplinary research in autonomous driving and to help advance the state of the art on a realistic benchmark. Analogous to racing being used to test cutting-edge vehicles, we envision autonomous racing to serve as a particularly challenging proving ground for autonomous agents as: (i) they need to make sub-second, safety-critical decisions in a complex, fast-changing environment; and (ii) both perception and control must be robust to distribution shifts, novel road features, and unseen obstacles. Thus, the main goal of the challenge is to evaluate the joint safety, performance, and generalisation capabilities of reinforcement learning agents on multi-modal perception, through a two-stage process. In the first stage of the challenge, we evaluate an autonomous agent's ability to drive as fast as possible, while adhering to safety constraints. In the second stage, we additionally require the agent to adapt to an unseen racetrack through safe exploration. In this paper, we describe the new L2R Task 2.0 benchmark, with refined metrics and baseline approaches. We also provide an overview of deployment, evaluation, and rankings for the inaugural instance of the L2R Autonomous Racing Virtual Challenge (supported by Carnegie Mellon University, Arrival Ltd., AICrowd, Amazon Web Services, and Honda Research), which officially used the new L2R Task 2.0 benchmark and received over 20,100 views, 437 active participants, 46 teams, and 733 model submissions -- from 88+ unique institutions, in 58+ different countries. Finally, we release leaderboard results from the challenge and provide description of the two top-ranking approaches in cross-domain model transfer, across multiple sensor configurations and simulated races.

研究の動機と目的

  • 自律走行における安全で高パフォーマンスかつ一般化可能な強化学習エージェントを評価するための標準化されたベンチマークを確立すること。
  • 分布シフト、新規障害物、未確認のレーストラックといった条件下でのロバストな認識と制御の課題に対処すること。
  • 高精細でオープンソースのシミュレーション環境を提供することで、自律走行分野における学際的研究を促進すること。
  • マルチモーダルな認識と制御システムにおける、安全性、パフォーマンス、一般化能力の統合的評価を行うこと。
  • 二段階のコンペティション形式を採用することで、シミュレーションから実世界への移行(sim-to-real)と安全な強化学習の実証のためのプラットフォームとしての役割を果たすこと。

提案手法

  • チャレンジは、マルチモーダルセンサ入力を備えた高精細で物理ベースのレーシング環境を提供する、Learn-to-Race (L2R) Task 2.0 シミュレーションフレームワークを採用している。
  • 二段階の評価プロトコルを実装した:第 1 階段では安全制約下での高速走行が評価対象であり、第 2 階段では未確認のレーストラックへの適応が安全な探索を伴って要求された。
  • エージェントは、安全制約をコスト制限回帰器、ルールベースのエキスパート、または学習可能な安全評価器によって強制された強化学習で訓練された。
  • ベースライン手法には、分布に配慮した事前知識を用いた模倣学習が含まれ、これにより転移時のロバストネスが向上し、因果関係の混乱が軽減された。
  • スピード、安全遵守度、未確認のトラックおよびセンサ設定への一般化性能といった洗練された指標を用いて、モデルのパフォーマンスを評価した。
  • ROS を介した実世界の車両スタックとの統合をサポートしており、将来的なシミュレーションから実世界への移行の検証が可能である。

実験結果

リサーチクエスチョン

  • RQ1強化学習エージェントは、安全制約と高パフォーマンスを維持したまま、未確認のレーストラックへどれほど一般化できるか?
  • RQ2分布に配慮した模倣学習の事前知識は、クロスドメイン走行におけるロバストネス向上と負の転移の低減にどのような役割を果たすか?
  • RQ3ルールベースの手法や学習可能な評価器といった、さまざまな安全制約メカニズムは、サブ秒単位の安全に重要な意思決定をどれほど効果的に維持できるか?
  • RQ4ポリシー蒸留は、マルチモーダルセンシングに基づく自律走行において、一般化性能とパフォーマンスをどれほど向上させられるか?
  • RQ5L2R Task 2.0 ベンチマークは、自律走行におけるシミュレーションから実世界への移行を信頼できる代理指標として機能できるか?

主な発見

  • 本チャレンジには、58 か国以上の 88 以上の機関に所属する 46 チームが参加し、733 件のモデル提出がなされ、20,100 回以上の閲覧数を記録し、コミュニティの関心の高さがうかがえる。
  • 上位 2 つのアプローチは、ポリシー蒸留と分布に配慮した模倣学習を活用し、複数のセンサ設定において優れたクロスドメイン転移性能を達成した。
  • 分布に配慮した事前知識を用いて訓練されたエージェントは、標準的な IL ベースラインと比較して、ノイズ耐性が向上し、未確認のレーストラックへの一般化性能が優れていた。
  • 学習可能な評価器およびコスト制限回帰器によって実装された安全制約は、動的環境下での高速走行において、危険な失敗を効果的に防止した。
  • L2R Task 2.0 ベンチマークは、実世界の自律走行の複雑さ、すなわち分布シフトや新規障害物を的確に捉えており、きびしい評価プラットフォームとしての有効性を裏付けた。
  • L2R フレームワークと ROS の統合により、Roborace や Indy Autonomous Challenge で使用される実世界の自律走行プラットフォームにおけるアルゴリズムの将来的な検証が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。