Skip to main content
QUICK REVIEW

[論文レビュー] Locally Weighted Regression Pseudo-Rehearsal for Online Learning of Vehicle Dynamics

Grady Williams, Brian Goldfain|arXiv (Cornell University)|May 13, 2019
Domain Adaptation and Few-Shot Learning参考文献 25被引用数 9
ひとこと要約

本論文は、局所加重投影回帰疑似再現学習(LW-PR²)を提案する。これは、非定常な入力および目的出力分布下で、災難的忘却を防ぐために、増分的LWPRとニューラルネットワークの適応を組み合わせた、新しいオンライン学習手法である。オンラインで更新されるLWPRモデルから疑似サンプルを生成することで、非定常な入力と目的出力分布下でも、ニューラルネットワーク制御系の安定的かつリアルタイムな適応が可能となり、誤差の増大を最小限に抑えつつ、シミュレーションおよび実世界の自律走行テストの両方で高い性能を達成した。

ABSTRACT

We consider the problem of online adaptation of a neural network designed to represent vehicle dynamics. The neural network model is intended to be used by an MPC control law to autonomously control the vehicle. This problem is challenging because both the input and target distributions are non-stationary, and naive approaches to online adaptation result in catastrophic forgetting, which can in turn lead to controller failures. We present a novel online learning method, which combines the pseudo-rehearsal method with locally weighted projection regression. We demonstrate the effectiveness of the resulting Locally Weighted Projection Regression Pseudo-Rehearsal (LW-PR$^2$) method in simulation and on a large real world dataset collected with a 1/5 scale autonomous vehicle.

研究の動機と目的

  • 非定常な入力および目的出力分布下での車両動力学モデリングにおける、ニューラルネットワークのオンライン適応における災難的忘却を解消すること。
  • 自律走行車両のモデル予測制御(MPC)に用いられるニューラルネットワークモデルの、リアルタイムで安定した適応を可能にする手法を開発すること。
  • 状態と動力学の両方が時間とともに変化する動的環境において、標準的SGDおよび単純な再現学習手法に見られる限界を克服すること。
  • 環境的・機械的条件の変化を伴う、長期にわたる実際の自律走行シナリオにおいて、手法の妥当性を検証すること。

提案手法

  • MPC用のニューラルネットワークモデルと、増分的に更新されるLWPRモデルを維持し、正則化に用いる疑似サンプルを生成する。
  • 疑似サンプルは、ランダムまたは代表的な入力を現在のLWPRモデルに通して生成され、現在の動力学を反映した合成された目的出力が得られる。
  • ニューラルネットワークは、新規データと疑似サンプルの両方にバランスをとった制約付き勾配更新により学習され、システム同定データから逸脱するのを防ぐ。
  • LWPRモデルはリアルタイムで増分的に更新され、路面摩擦やバッテリー状態の変化など、目的出力分布の変化に適応する。
  • 制約付き最適化スキームにより、パラメータの更新を制限し、新規データに過剰に適合することで過去に学習した動力学を損なうのを防ぐ。
  • 過去のデータを保存せず、安全に継続的なオンライン学習が可能となるため、リアルタイムMPCアプリケーションに適している。

実験結果

リサーチクエスチョン

  • RQ1入力および目的出力分布が非定常な状況下で、疑似再現学習を車両動力学のオンライン学習に効果的に適用できるか。
  • RQ2長期間にわたる自律走行運用中に、ニューラルネットワークベースの車両動力学モデルで災難的忘却をどのように緩和できるか。
  • RQ3増分的に更新されるLWPRモデルが、オンラインニューラルネットワーク適応を安定化させる高品質な疑似サンプルを生成できるか。
  • RQ4本手法が、タイヤの摩耗、路面状態の変化、バッテリー状態の変化といった動的変化に対しても、信頼性のあるMPC制御を可能にするか。
  • RQ5実世界の自律走行シナリオにおいて、LW-PR²の性能は標準的SGDおよびベースライン再現学習手法と比べてどのように差がつくか。

主な発見

  • 長期にわたる実走行フィールドテストでは、LW-PR²は全時間データセットで合計MSE 2.11を達成し、ベースモデル(MSE: 3.18)を顕著に上回り、オフラインLWPRベースラインと同等の性能を示した。
  • リアルタイム自律走行中のLW-PR²の実性能はMSE 2.54であり、最高速度50 km/hの実世界条件下でも安定した制御を示した。
  • 4.5時間にわたる運用において、雨天路面と乾燥路面、バッテリー状態の変化といった変化する条件下でも、LW-PR²は災難的忘却を効果的に防止した。
  • SGDは孤立した検証セットでは同等の性能を示したが、MPCの文脈では不安定さが顕在化し、LW-PR²はMPC環境下でSGDを上回った。
  • 制約付き勾配更新により、状態空間の高誤差領域にさらされても、モデルが元のシステム同定データから逸脱しなかった。
  • 増分的LWPRによる疑似サンプリングの活用により、タイヤの摩耗や摩擦の変化といった動的変化に対しても効果的な適応が可能となり、長時間にわたる運用でも制御系の信頼性を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。