[論文レビュー] Meta-Gradient Reinforcement Learning with an Objective Discovered Online
本論文は FRODO を提案する。オンラインメタ勾配フレームワークで、RL 目的自体を発見・更新し、オンライン適応とタスク間での学習効率の向上を実現する。Atari などのゲームを含むタスクに適用可能。
Deep reinforcement learning includes a broad family of algorithms that parameterise an internal representation, such as a value function or policy, by a deep neural network. Each algorithm optimises its parameters with respect to an objective, such as Q-learning or policy gradient, that defines its semantics. In this work, we propose an algorithm based on meta-gradient descent that discovers its own objective, flexibly parameterised by a deep neural network, solely from interactive experience with its environment. Over time, this allows the agent to learn how to learn increasingly effectively. Furthermore, because the objective is discovered online, it can adapt to changes over time. We demonstrate that the algorithm discovers how to address several important issues in RL, such as bootstrapping, non-stationarity, and off-policy learning. On the Atari Learning Environment, the meta-gradient algorithm adapts over time to learn with greater efficiency, eventually outperforming the median score of a strong actor-critic baseline.
研究の動機と目的
- オンラインメタ勾配降下を用いて、手作業で設計する代わりに RL 目的の学習を動機づける。
- 経験から学習される RL 更新ターゲットをパラメータ化するメタネットワークを開発する。
- ブートストラップ、非定常性、オフポリシー学習に対処するために、目的のオンライン適応を可能にする。
- 複雑な環境でオンライン目的発見が固定ベースラインを上回ることを示す。
提案手法
- RL 更新ターゲット G を、軌跡をスカラーターゲットへ写像するメタネットワーク g_eta でパラメータ化する。
- エージェントパラメータ theta の M 個の内部更新を通して逆伝搬させ、eta を最適化するためにメタ勾配降下を適用する。
- 検証軌跡上の外部損失 L_outer を用いて eta のメタ勾配を計算する。
- このフレームワークを FRODO (Flexible Reinforcement Objective Discovered Online) として実装し、予測、価値ベースの制御、アクター-クリティック設定に適用する。
- 大規模実験では、時間自己整合性へ G_eta を正則化する整合性損失を組み込み、オフポリシー補正には VTrace を用いる。
実験結果
リサーチクエスチョン
- RQ1オンラインメタ勾配アプローチは、手作業で設計された目的なしに有用な RL 更新ターゲットを発見できるか。
- RQ2RL におけるブートストラップと非定常性に対処するためのオンライン目的発見はどう機能するか。
- RQ3多様なタスクで、更新ターゲットのオンライン発見は強力な actor-critic ベースラインより改善をもたらすか。
- RQ4メタ勾配において、目的を学習されたターゲットとして表現することと、学習された損失として表現することの効果は何か。
主な発見
- おもちゃ領域では、学習されたターゲットがブートストラッピングと非定常性の処理を可能にし、固定の先読みベースラインを上回る。
- 57 本の Atari ゲームで、十分な訓練後にメタ勾配アルゴリズムは強力な actor-critic ベースラインの中央値スコアを上回る。
- 学習されたターゲットはゲームを跨いで VTrace ターゲットと異なり、異なるオンライン目的の発見を示している。
- ターゲットを表現する(損失ではなく)方が、損失を表現するよりオンライン学習を安定させる。
- 控えめな整合性損失(自己整合性への正則化)は学習を大幅に高速化し性能を向上させる一方、過度の正則化は結果に害を及ぼす。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。