Skip to main content
QUICK REVIEW

[論文レビュー] Augmenting learning using symmetry in a biologically-inspired domain

Shruti Mishra, Abbas Abdolmaleki|arXiv (Cornell University)|Oct 1, 2019
Reinforcement Learning in Robotics参考文献 10被引用数 6
ひとこと要約

本稿では、四足歩行環境における強化学習を、鏡映像状態-行動ペアを用いた空間的対称性を活用することで拡張することを提案する。これにより、サンプル効率が著しく向上する。トレーニング中に軌道を鏡映像化することで、データが限られた状況下でもエージェントはより速く学習し、最小限のアーキテクチャ変更で優れたパフォーマンスを達成する。

ABSTRACT

Invariances to translation, rotation and other spatial transformations are a hallmark of the laws of motion, and have widespread use in the natural sciences to reduce the dimensionality of systems of equations. In supervised learning, such as in image classification tasks, rotation, translation and scale invariances are used to augment training datasets. In this work, we use data augmentation in a similar way, exploiting symmetry in the quadruped domain of the DeepMind control suite (Tassa et al. 2018) to add to the trajectories experienced by the actor in the actor-critic algorithm of Abdolmaleki et al. (2018). In a data-limited regime, the agent using a set of experiences augmented through symmetry is able to learn faster. Our approach can be used to inject knowledge of invariances in the domain and task to augment learning in robots, and more generally, to speed up learning in realistic robotics applications.

研究の動機と目的

  • 動物に似たボディに内在する空間的対称性を活用することで、ロボット歩行の強化学習におけるサンプル効率を向上させること。
  • 対称性に基づくデータ拡張が、限られた経験を持つ連続制御タスクにおける学習を加速できるかどうかを調査すること。
  • 物理的対称性に由来するインダクティブバイアスが、より自然で効率的な歩行ポリシーをどのように形成するかを探索すること。
  • 環境ダイナミクスを変更せずに、アクター・クリティックフレームワークにおけるポリシー最適化に鏡映像軌道が与える影響を評価すること。

提案手法

  • 四足歩行ドメインにおいて、冠状面を軸として反射対称性を適用し、状態-行動ペアの鏡像バージョンを生成する。
  • MPOアルゴリズム(Abdolmaleki et al., 2018)を拡張し、トレーニング中にリプレイバッファに鏡像軌道を組み込む。
  • Q関数が $ Q(s_{\text{mirrored}}, a_{\text{mirrored}}) = Q(s, a) $ を満たすように、対称的ポリシー制約を導入し、不変性を強制する。
  • 学習の安定化のため、KLダイバージェンス制約を維持しながら、元の状態および行動と鏡像状態および行動の両方を用いてポリシー改善を実行する。
  • 時系列差分学習中にQ関数のトレーニングを安定化させるために、250ステップの更新周期を持つターゲットネットワークを採用する。
  • 元のマルコフ決定過程や環境ダイナミクスを変更せずに、ポリシー最適化ループに鏡像経験を組み込む。

実験結果

リサーチクエスチョン

  • RQ1対称性に基づくデータ拡張は、四足歩行の連続制御タスクにおけるサンプル効率を向上させることができるか?
  • RQ2鏡像軌道を組み込むことで、アクター・クリティック強化学習エージェントの収束速度と最終的パフォーマンスにどのような影響を与えるか?
  • RQ3ポリシー空間における対称性の強制は、より自然で特徴的な歩行歩様を生成するか?
  • RQ4対称性の知識を、アーキテクチャの変更なしに、有効なポリシー探索空間を縮小するインダクティブバイアスとして利用できるか?
  • RQ5対称性拡張は、データが限られたトレーニング環境における学習の安定性と一般化性能にどのような影響を与えるか?

主な発見

  • 鏡像軌道を用いた拡張トレーニングは、標準トレーニングに比べて累積報酬が早期に高くなることが確認され、学習がより速いことが示された。
  • 複数のシードおよびウォーキング/ランニングタスクの両方で性能向上が一貫しており、初期化やタスクの変動に対して頑健であることが示された。
  • ハイパーパrameterを変更せずに学習速度が向上したため、対称性が効果的なインダクティブバイアスとして機能していると考えられる。
  • 鏡像データの使用は、特に低データ環境下で、より安定的かつ効率的なポリシー学習を実現した。
  • 対称的ポリシー制約により、生物学的歩行パターンに一致するより自然な歩様をエージェントが学習できた。
  • 本手法はMPOのような既存のアクター・クリティカルアルゴリズムと互換性があり、環境や報酬関数を変更せずに適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。