Skip to main content
QUICK REVIEW

[論文レビュー] Action Guidance: Getting the Best of Sparse Rewards and Shaped Rewards for Real-time Strategy Games

Shengyi Huang, Santiago Ontañón|arXiv (Cornell University)|Oct 5, 2020
Reinforcement Learning in Robotics参考文献 30被引用数 5
ひとこと要約

本論文では、サンプル効率性を高めるための報酬形状と、真の目的最適化を保証するためのスパarsな報酬を組み合わせる、新しい強化学習手法であるアクションガイドランスを提案する。主エージェントをスパース報酬で訓練しながら、報酬形状で訓練された補助エージェントが探索をガイドすることで、報酬形状と同等のサンプル効率性を達成するとともに、主エージェントが最終的に真の目的を最適化することを保証する。この手法はμRTS環境で検証された。

ABSTRACT

Training agents using Reinforcement Learning in games with sparse rewards is a challenging problem, since large amounts of exploration are required to retrieve even the first reward. To tackle this problem, a common approach is to use reward shaping to help exploration. However, an important drawback of reward shaping is that agents sometimes learn to optimize the shaped reward instead of the true objective. In this paper, we present a novel technique that we call action guidance that successfully trains agents to eventually optimize the true objective in games with sparse rewards while maintaining most of the sample efficiency that comes with reward shaping. We evaluate our approach in a simplified real-time strategy (RTS) game simulator called $μ$RTS.

研究の動機と目的

  • リアルタイムストラテジー(RTS)ゲームにおける報酬のスパarsityに起因する探索の非効率性と信用割り当ての困難さに対処すること。
  • 報酬形状の欠点、すなわちエージェントが形状報酬を最適化してしまうことの是正。
  • 報酬形状のサンプル効率性を維持しつつ、主エージェントが真のスパース報酬を最適化する方法の開発。
  • 複数の難易度のタスクを含む、現実的ではあるが簡略化されたRTS環境μRTSにおいて、この手法の評価。

提案手法

  • 主エージェントは真の目的に一致させるために、スパース報酬関数 $ R_{\mathcal{M}} $ のみで訓練される。
  • 補助エージェントは報酬形状関数 $ R_{\mathcal{A}_i} $ で訓練され、初期学習段階でのサンプル効率的なガイダンスを提供する。
  • 学習中に、主エージェントは初期段階で高い確率で補助エージェントがサンプリングした行動に従い、徐々に独立性を高める。
  • 主エージェントと補助エージェントは、共有ロールアウトを用いてデータ効率を高めるオフポリシー方策勾配法で訓練される。
  • アクションガイドランスは、補助エージェントには報酬形状、主エージェントのガイダンスには模倣学習を組み合わせ、ハイブリッドな訓練制度を構築する。
  • 適応期間の長さやPLO(Positive Learning Optimization)の使用といったハイパーパramータは、ガイダンスとポリシーのバイアスのバランスを取るために調整される。

実験結果

リサーチクエスチョン

  • RQ1アクションガイドランスは、報酬形状と同等のサンプル効率性を達成するか、かつ主エージェントが真のスパース報酬を最適化することを保証できるか?
  • RQ2適応期間の長さが、主エージェントが効果的な行動を発見する能力に与える影響は何か?
  • RQ3PLOの使用は、アクションガイドランスのエージェントにおける学習の安定性と収束性を向上させるか?
  • RQ4形状報酬にアクセスできない状況でも、アクションガイドランスは人間が用いるような効率的で自然な戦略(例:ワーカー・ラッシュ、同時ユニット生産)を学習可能か?
  • RQ5補助エージェントも主エージェントのポリシーの恩恵を受ける場合、アクションガイドランスは協調的学習メカニズムとして有効か?

主な発見

  • アクションガイドランスは、μRTSの3つのタスクすべてにおいて、報酬形状とほぼ同等のサンプル効率性を達成し、優れたデータ効率性を示した。
  • アクションガイドランスで訓練された主エージェントは、形状報酬を一度も観測しなかったにもかかわらず、ゲームを最速で勝利するよう学習した。これは真の目的最適化が達成されたことを確認するものである。
  • DefeatRandomEnemyタスクでは、アクションガイドランスのエージェントは一貫してワーカー・ラッシュ戦略を学習したが、形状報酬で訓練されたエージェントは多様で非効率な行動を示した。
  • ProduceCombatUnitsタスクでは、長い適応期間を経た主エージェントは、戦闘ユニットの生産と資源収集を同時に実行する——エキスパートの行動と一致する——が、形状報酬エージェントは資源を完全に集めるまでユニット生産を遅らせる傾向があった。
  • PLOは、短い適応期間のアクションガイドランスにおいて収束の安定性を向上させたが、長い適応期間の設定では性能を低下させた。これはPLOの有効性が文脈依存であることを示している。
  • 混合ポリシーのバージョンでは、複数のタスクで優れた性能を示し、主エージェントと補助エージェント間の双方向的知識移転の可能性を示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。