[論文レビュー] Augmenting Reinforcement Learning with Transformer-based Scene Representation Learning for Decision-making of Autonomous Driving
本稿では、相互作用と意図認識に基づくシーン表現を統合するマルチステージTransformerと、自己教師付き学習を用いて将来の予測情報を現在の潜在状態に蒸留する順序付き潜在Transformer(SLT)を組み合わせた、自律走行の強化学習(RL)を向上させる新規フレームワーク、Scene-Rep Transformerを提案する。この手法は、複雑な都市部走行シナリオにおいて、サンプル効率と意思決定性能を顕著に向上させ、ベースラインRL手法に比べて高い成功確率、向上した安全性、より多様な走行行動を達成する。
Decision-making for urban autonomous driving is challenging due to the stochastic nature of interactive traffic participants and the complexity of road structures. Although reinforcement learning (RL)-based decision-making scheme is promising to handle urban driving scenarios, it suffers from low sample efficiency and poor adaptability. In this paper, we propose Scene-Rep Transformer to improve the RL decision-making capabilities with better scene representation encoding and sequential predictive latent distillation. Specifically, a multi-stage Transformer (MST) encoder is constructed to model not only the interaction awareness between the ego vehicle and its neighbors but also intention awareness between the agents and their candidate routes. A sequential latent Transformer (SLT) with self-supervised learning objectives is employed to distill the future predictive information into the latent scene representation, in order to reduce the exploration space and speed up training. The final decision-making module based on soft actor-critic (SAC) takes as input the refined latent scene representation from the Scene-Rep Transformer and outputs driving actions. The framework is validated in five challenging simulated urban scenarios with dense traffic, and its performance is manifested quantitatively by the substantial improvements in data efficiency and performance in terms of success rate, safety, and efficiency. The qualitative results reveal that our framework is able to extract the intentions of neighbor agents to help make decisions and deliver more diversified driving behaviors.
研究の動機と目的
- 都市部自律走行におけるRLベース意思決定の低サンプル効率と低い適応性を改善すること。
- 自車両者、周囲車両、候補ルートの間の相互作用をモデル化することで、シーン表現学習を向上させること。
- 将来の動的状態を現在の潜在状態に組み込むことで、探索空間を縮小し、学習を高速化すること。
- 意図認識に基づく表現を用いることで、より解釈可能で多様な走行行動を可能にすること。
- 密な交通状況を伴う挑戦的なシミュレート都市シナリオでフレームワークを検証すること。
提案手法
- マルチステージTransformer(MST)は、エージェントの軌道や候補ルートのウェイポイントなどの異種のシーン要素を統一された潜在表現にエンコードし、エージェント間の相互作用とルート意図を両方とも捉える。
- 順序付き潜在Transformer(SLT)は、自己教師付き学習を用いて、将来の潜在行動ペアの系列から現在の潜在ベクトルに特徴を蒸留し、予測知識を埋め込む。
- SLTはRL学習フェーズでのみ訓練され、推論に影響を与えないようにする。
- ソフトアクタクリティカル(SAC)エージェントは、洗練された潜在表現を入力として使用し、高品質な走行意思決定を生成する。
- 全フレームワークは、累積報酬とタスク成功確率を最大化するためにエンドツーエンドで訓練される。
- SLTにおける将来予測のハイパーパrameter $T_G$ は、異なるタスク長にわたる予測精度と学習安定性のバランスを取るために調整される。

実験結果
リサーチクエスチョン
- RQ1Transformerベースのシーン表現モデルは、エージェント相互作用やルート意図を含む異種の走行要素を効果的にエンコードできるか?
- RQ2現在の潜在状態に系列的な予測情報を蒸留することで、RLベース意思決定における探索空間が縮小され、学習効率が向上するか?
- RQ3複雑な都市部走行タスクにおいて、提案フレームワークはベースラインRL手法に比べ、成功確率、安全性、行動多様性の観点で優れているか?
- RQ4長期走行シナリオにおいて、予測蒸留の最適な将来予測ホライズン $T_G$ は何か?
- RQ5モデルは、レーン変更、攻撃的ターン、合流動作などの解釈可能な走行行動を学習できるか?
主な発見
- Scene-Rep Transformerは、PPOおよびDrQベースラインに比べて、高い性能に到達するための訓練サンプル数を著しく削減し、データ効率の向上を達成した。
- 遮断なし左折、二重合流、円形交差点など5つのシミュレート都市シナリオにおいて、高い成功確率を達成し、定性的な結果からより多様で安全な走行マニューバーが観察された。
- 自車両者には、左折時のレーン変更や合流時の複数回のレーン変更といった、保守的で攻撃的な両方の行動が学習されており、ポリシーの一般化能が優れていることが示された。
- 将来予測ホライズン $T_G = 10$ を有するSLTは、円形交差点-Cのような長時間タスクで最良のパフォーマンスを発揮し、複雑なシナリオにおける学習向上に長い予測ホライズンが寄与することを示した。
- 注目可視化により、モデルが候補ウェイポイントや相互作用ダイナミクスといった意図関連の手がかりに適応的に注目していることが確認され、解釈性が向上した。
- アブレーションスタディの結果、マルチステージTransformerとSLTの両方が性能向上に顕著に寄与しており、特にSLTが探索空間を縮小し、収束を加速していることが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。