Skip to main content
QUICK REVIEW

[論文レビュー] Factored Adaptation for Non-Stationary Reinforcement Learning

Fan Feng, Biwei Huang|UvA-DARE (University of Amsterdam)|Mar 30, 2022
Mental Health Research Topics被引用数 5
ひとこと要約

本稿では、時間的に変化するダイナミクスと報酬を分離された潜在的要因と因果構造を用いてモデル化する、非定常強化学習のための要因分解適応フレームワークFANS-RLを提案する。要因分解MDPと時間発展する変化要因を同時に学習することで、FANS-RLは、連続制御およびロボット操作ベンチマークにおいて、帰属報酬、表現のコンパクト性、耐性性能の面で、先行手法を上回る優れた性能を達成する。

ABSTRACT

Dealing with non-stationarity in environments (e.g., in the transition dynamics) and objectives (e.g., in the reward functions) is a challenging problem that is crucial in real-world applications of reinforcement learning (RL). While most current approaches model the changes as a single shared embedding vector, we leverage insights from the recent causality literature to model non-stationarity in terms of individual latent change factors, and causal graphs across different environments. In particular, we propose Factored Adaptation for Non-Stationary RL (FANS-RL), a factored adaption approach that learns jointly both the causal structure in terms of a factored MDP, and a factored representation of the individual time-varying change factors. We prove that under standard assumptions, we can completely recover the causal graph representing the factored transition and reward function, as well as a partial structure between the individual change factors and the state components. Through our general framework, we can consider general non-stationary scenarios with different function types and changing frequency, including changes across episodes and within episodes. Experimental results demonstrate that FANS-RL outperforms existing approaches in terms of return, compactness of the latent state representation, and robustness to varying degrees of non-stationarity.

研究の動機と目的

  • 現実世界の強化学習における非定常性の課題に取り組むこと、すなわち、環境のダイナミクスと報酬関数が時間とともに変化すること。
  • 共有埋め込みではなく、分離された時間発展する潜在的要因として変化をモデル化することにより、適応効率を向上させること。
  • 標準的な同定可能性仮定の下で、遷移関数と報酬関数における因果構造の回復を可能にすること。
  • 時間的変化の頻度が異なる、エピソード内およびエピソード間の変化を両方対応できる統合フレームワークを構築すること。
  • 最先端手法と比較して、帰属報酬、潜在的表現のコンパクト性、耐性性能の面で向上を示すこと。

提案手法

  • 時間発展する潜在的変化要因をモデル化したマコフ過程としての、要因分解非定常MDP(FN-MDP)を形式化する。
  • 状態遷移と報酬の因果グラフを同定し、変化要因と状態部品間の部分的構造を回復する因果構造学習フレームワークを導入する。
  • FN-MDP学習とポリシー適応を交互に実行する、共同モデル推定とポリシー最適化フレームワークであるFANS-RLを提案する。
  • LSTMを用いた時系列モデリングと変分推論による潜在的要因推定を実装した、推論・ダイナミクス・デコーダーの3つのネットワークを備えたFN-VAEというニューラルアーキテクチャを採用する。
  • 再構成、予測、KL、スパarsity、滑らかさの項を含むマルチコンponent損失関数を用い、トレーニング安定性のための適応的重み付けを実施する。
  • AdaRLフレームワークを非定常設定に適応させ、変化要因の低次元かつ時間発展する表現を学習することで、迅速なポリシー適応を実現する。

実験結果

リサーチクエスチョン

  • RQ1標準的な仮定の下で、非定常MDPにおける遷移関数と報酬関数の因果構造を同定できるか?
  • RQ2非定常環境において、個々の変化要因と状態部品の間の部分的因果構造を回復できるか?
  • RQ3共有埋め込みアプローチと比較して、非定常性を分離された潜在的変化要因としてモデル化することで、ポリシー性能と表現のコンパクト性が向上するか?
  • RQ4提案されたフレームワークは、エピソード内およびエピソード間で発生する離散的・連続的変化を両方処理できるか?
  • RQ5FANS-RLは、ダイナミクスと報酬関数における非定常性の度合いが異なる状況において、どの程度耐性を示すか?

主な発見

  • FANS-RLは、Half-Cheetah、Sawyer-Reaching、Sawyer-Peg、Minitaurを含む、すべての評価ベンチマークで最先端手法を上回る高い累積報酬を達成する。
  • FANS-RLで学習された潜在的状態表現は、他の手法と比較して次元が低く、40次元にまでコンパクト化されている。
  • FANS-RLは非定常性に対して優れた耐性を示し、ダイナミクスと報酬に高周波数または複雑な変化が加わっても、高い性能を維持する。
  • 標準的な同定可能性仮定の下で、遷移関数と報酬関数の因果構造を正しく回復できており、変化要因についても部分的構造の回復に成功している。
  • FN-VAEアーキテクチャは、FN-MDPとポリシー適応の有効な共同学習を可能にし、メタテストシナリオにおいてTRIOやVariBADを上回る性能を示した。
  • アブレーションスタディの結果、変化要因の分離モデル化が、共有埋め込みアプローチと比較して、より優れた一般化性能とより速い適応を実現することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。