Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning with Automated Auxiliary Loss Search

Tairan He, Yuge Zhang|arXiv (Cornell University)|Oct 12, 2022
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本論文は、強化学習における最適な表現を自動で発見するため、膨大な補助損失関数の空間を進化的探索によって探索する自動補助損失探索(A2LS)を提案する。A2LSは、画像ベース、ベクトルベース、部分的に観測可能な状況、さらにはアタリゲームを含む多様なタスクで最先端の性能を達成し、手作業で設計されたベースラインをはるかに上回る一般化性能とサンプル効率性を示している。

ABSTRACT

A good state representation is crucial to solving complicated reinforcement learning (RL) challenges. Many recent works focus on designing auxiliary losses for learning informative representations. Unfortunately, these handcrafted objectives rely heavily on expert knowledge and may be sub-optimal. In this paper, we propose a principled and universal method for learning better representations with auxiliary loss functions, named Automated Auxiliary Loss Search (A2LS), which automatically searches for top-performing auxiliary loss functions for RL. Specifically, based on the collected trajectory data, we define a general auxiliary loss space of size $7.5 imes 10^{20}$ and explore the space with an efficient evolutionary search strategy. Empirical results show that the discovered auxiliary loss (namely, A2-winner) significantly improves the performance on both high-dimensional (image) and low-dimensional (vector) unseen tasks with much higher efficiency, showing promising generalization ability to different settings and even different benchmark domains. We conduct a statistical analysis to reveal the relations between patterns of auxiliary losses and RL performance.

研究の動機と目的

  • 強化学習における補助損失の設計が熟練した直感に依存するため、最終的な強化学習性能と一致しない可能性があるという問題を解決すること。
  • 状態表現学習を向上させる高パフォーマンスな補助損失関数を自動で発見する汎用的で自動化された手法を開発すること。
  • 異なる観測モダリティ、ネットワークアーキテクチャ、ベンチマークドメインを含む多様な強化学習設定において、発見された損失の一般化能力を評価すること。
  • 全探索プロセスの分析を通じて、補助損失構造と強化学習性能との間の統計的パターンを特定すること。

提案手法

  • A2LSは補助損失探索を二段階最適化として定式化する:外側のループでは進化的アルゴリズムを用いて最適な補助損失を探索し、内側のループでは候補となる損失を用いて強化学習エージェントを訓練する。
  • 本手法は、軌道データから得られる多様な補助損失構成をカバーする、サイズ $7.5 \times 10^{20}$ の包括的な探索空間を定義する。
  • 進化的探索は、小さなシミュレーテッド環境群(DeepMind Control Suite)上で実行され、最良の性能を示す損失(A2-winner)が発見される。
  • 発見されたA2-winner損失は、高次元(画像)および低次元(ベクトル)の観測、部分的に観測可能な状況、離散的制御設定を含む未学習のタスクで評価される。
  • 全進化的探索プロセスの統計的分析が実施され、損失パターンと強化学習性能との相関関係が評価される。

実験結果

リサーチクエスチョン

  • RQ1自動化された手法が、強化学習において手作業で設計されたものよりも顕著に優れた補助損失関数を発見できるか?
  • RQ2発見された補助損失は、異なる観測モダリティ(例:画像対ベクトル)および強化学習環境に一般化できるか?
  • RQ3補助損失の構造的パターンのうち、強化学習性能の向上と相関するものは何か、そしてこれらは体系的に特定できるか?
  • RQ4A2-winner損失は、アタリを含む多様な強化学習ベンチマークにおいて、強力なベースラインと比較してどのように性能を発揮するか?

主な発見

  • 自動探索によって発見されたA2-winner損失は、高次元(画像)および低次元(ベクトル)の強化学習タスクにおいて、サンプル効率性と最終的なパフォーマンスを顕著に向上させる。
  • 本手法は、未学習の環境に対しても効果的に一般化でき、連続的制御における異なるロボット、部分的に観測可能な状況、さらにはアタリ2600ゲームの離散的制御ドメインにも適応可能である。
  • A2-winner損失は、内部的好奇心、予測に基づく損失、標準的な補助目的といった強力なベースラインを、すべての評価ベンチマークで上回る。
  • 統計的分析により、時間的整合性と複数ステップ予測パターンを重視する損失関数が、高い強化学習性能と強く相関していることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。