[論文レビュー] Generalization of Reinforcement Learning with Policy-Aware Adversarial Data Augmentation
本稿では、強化学習の一般化性能を向上させるために、方策勾配に基づいて敵対的軌道を生成する新しい手法、Policy-Aware Adversarial Data Augmentation with Mixup (PAADA+Mixup) を提案する。オリジナルデータと敵対的軌道を mixup を用いて統合することで、特に低訓練多様性設定下でも最先端の性能を達成した。
The generalization gap in reinforcement learning (RL) has been a significant obstacle that prevents the RL agent from learning general skills and adapting to varying environments. Increasing the generalization capacity of the RL systems can significantly improve their performance on real-world working environments. In this work, we propose a novel policy-aware adversarial data augmentation method to augment the standard policy learning method with automatically generated trajectory data. Different from the commonly used observation transformation based data augmentations, our proposed method adversarially generates new trajectory data based on the policy gradient objective and aims to more effectively increase the RL agent's generalization ability with the policy-aware data augmentation. Moreover, we further deploy a mixup step to integrate the original and generated data to enhance the generalization capacity while mitigating the over-deviation of the adversarial data. We conduct experiments on a number of RL tasks to investigate the generalization performance of the proposed method by comparing it with the standard baselines and the state-of-the-art mixreg approach. The results show our method can generalize well with limited training diversity, and achieve the state-of-the-art generalization test performance.
研究の動機と目的
- 多様な現実世界の環境における過学習とデータ記憶の問題によって引き起こされる、深層強化学習における持続的な一般化ギャップを解消すること。
- 従来の観測レベルのデータ拡張の限界を克服するため、強化学習方策の目的に整合した敵対的軌道を生成する方策に配慮したアプローチを開発すること。
- 敵対的データ拡張と mixup を統合することで一般化能力を強化し、両技術の長所を活かすこと。
- 特に挑戦的なゼロショット一般化設定下で、低データ多様性トレーニングレジームにおいて優れた性能を示すことを実証すること。
- 強化学習におけるデータ拡張の新しいパラダイムを確立し、方策最適化の目的に特化した敵対的軌道生成を導入すること。
提案手法
- 初期のソース軌道に対して勾配ベースの摂動を用いて、現在の方策の期待リターンを最小化することで、敵対的軌道を生成する。
- 訓練中にオリジナル軌道と敵対的軌道の寄与度を調整するため、制御された拡張度(ν)を適用する。
- オリジナルと敵対的軌道ステップを確率的かつ混合する mixup 操作を導入し、各観測ステップを ν 比例確率でどちらかのソースからサンプリングする。
- オリジナル軌道と mixup 拡張済み軌道の組み合わせを用いて強化学習方策を訓練することで、耐性と一般化性能を向上させる。
- 生成された敵対的データが意味的に意味があり、方策の学習目的と整合していることを保証するため、方策勾配に基づく最適化を用いる。
- 訓練環境の多様性が変化する状況下で性能を評価するため、複数の一般化設定(ξ = 1, 0.5, 0.25)を用いて Procgen ベンチマークに本手法を適用する。
実験結果
リサーチクエスチョン
- RQ1方策勾配に基づく敵対的軌道生成は、深層強化学習エージェントの一般化能力を向上させることができるか?
- RQ2敵対的データ拡張と mixup を統合することで、単独で使用する場合よりも優れた一般化性能が得られるか?
- RQ3本手法は、特に訓練環境の 25% のみが利用可能な低多様性トレーニングレジーム下でどのように性能を発揮するか?
- RQ4方策に配慮した敵対的データ拡張は、mixreg や他の最先端手法に比べ、多様な環境におけるゼロショット一般化で優れた性能を示せるか?
- RQ5拡張度(ν)の変化が、拡張トレーニングプロセスの性能と安定性に与える影響は何か?
主な発見
- PAADA+Mixup は Procgen ベンチマークで最先端の一般化性能を達成し、15 のテストケースのうち 12 で PPO や mixreg を上回った。
- 訓練環境がたった 25% の最も挑戦的な設定(ξ=0.25)では、PAADA+Mixup は平均正規化リターン 0.26 を達成し、mixreg(0.09)と PPO(0.03)を上回った。
- ξ=0.25 のクライマー環境では、PAADA(ν=0.5)が 3.64±0.62 の最高リターンを記録し、PAADA+Mixup(2.08±0.46)を上回った。これは、極端なデータ不足下では mixup が必ずしも有益ではない可能性を示している。
- ξ=0.25 のドッジボール環境では、PAADA+Mixup が 2.38±0.46 を達成し、mixreg(2.10±0.30)と PPO(1.12±0.18)を顕著に上回り、低データ多様性下での強力な一般化性能を示した。
- 4 つの Procgen ゲーム(クライマー、ドッジボール、フルーツボット、スターライダー)すべてにおいて、PAADA+Mixup が最高の平均正規化リターン(0.37±0.02)を達成し、一貫した一般化性能の向上を示した。
- アブレーションスタディにより、敵対的データ拡張と mixup の両方が性能向上に独立して寄与しており、その組み合わせが一般化能力のシナジー的向上をもたらすことが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。