[論文レビュー] Conditional Mutual Information for Disentangled Representations in Reinforcement Learning
本稿では、因子の変動が相関している場合でも強化学習における分離表現を学習できるように、条件付き相互情報量の最小化を目的とする補助学習目的であるCMIDを提案する。CMIDは、画像観測を持つ連続的制御環境において、相関の変化が生じた場合の訓練性能を向上させるとともに、全タスク平均でゼロショット一般化性能を77%向上させる。
Reinforcement Learning (RL) environments can produce training data with spurious correlations between features due to the amount of training data or its limited feature coverage. This can lead to RL agents encoding these misleading correlations in their latent representation, preventing the agent from generalising if the correlation changes within the environment or when deployed in the real world. Disentangled representations can improve robustness, but existing disentanglement techniques that minimise mutual information between features require independent features, thus they cannot disentangle correlated features. We propose an auxiliary task for RL algorithms that learns a disentangled representation of high-dimensional observations with correlated features by minimising the conditional mutual information between features in the representation. We demonstrate experimentally, using continuous control tasks, that our approach improves generalisation under correlation shifts, as well as improving the training performance of RL algorithms in the presence of correlated features.
研究の動機と目的
- 特徴量の誤った相関が一般化性能と耐障害性を損なう強化学習環境における課題に対処すること。
- 従来の分離表現手法が因子の変動が独立していることを仮定しているという制限を克服すること。
- 厳密な独立性ではなく条件付き独立性に基づく分離表現を学習する手法を開発すること。
- 特徴量の相関がデプロイ時に変化したり存在しなかったりする状況において、ゼロショット一般化性能と訓練の安定性を向上させること。
- CMIDがSVEA、DrQ、CURL、TEDなどの既存の強化学習アルゴリズムと互換性を持つプラグイン型補助タスクとして有効であることを示すこと。
提案手法
- CMIDは、条件付き相互情報量(CMI)を最小化する補助損失を導入し、条件付けられた集合を介してペアの潜在特徴量間のCMIを小さくする。
- 条件付けられた集合は、マークフ・意思決定過程(MDP)の因果構造に基づき、最新の観測値を用いて特徴量を条件付きで独立に保つように定義される。
- CMI推定のための周辺分布の積を推定するためにk近傍法(kNN)を用い、微分可能な学習を可能にする。
- ベースとなる強化学習アルゴリズムの損失とCMIDの補助損失を組み合わせ、バックプロパゲーションにより潜在表現を更新する。
- 入力に誤った因果的依存関係を導入しないため、原始フレームではなく時系列にわたる特徴表現を積み上げる。
- オンライン強化学習アルゴリズムと互換性があり、主な方策訓練ループを変更せずに適用可能である。
実験結果
リサーチクエスチョン
- RQ1因子の変動が独立ではなく相関している場合でも、分離表現を学習できるか?
- RQ2潜在特徴量間の条件付き相互情報量を最小化することで、強化学習における相関シフト下でのゼロショット一般化性能が向上するか?
- RQ3DrQ、CURL、TEDなどの最先端の自己教師付き強化学習手法と比較して、CMIDは特徴量の相関シフトに対してどれほど耐性があるか?
- RQ4相関する特徴量を有する環境において、CMIDは訓練性能とサンプル効率を向上させられるか?
- RQ5アーキテクチャの変更なしに、既存の強化学習アルゴリズムに補助タスクとして適用した場合、CMIDは有効か?
主な発見
- CMIDは、未学習の物体の色をテストした際、ベースとなるSVEAアルゴリズムと比較して全タスク平均で77%のゼロショット一般化性能の向上を達成した。
- カートポールのスイングアップタスクでは、CMIDは未学習の色で平均報酬834.1 ± 105.8を達成したのに対し、SVEAは588.7 ± 87.2であった。これは色の相関シフトに対する顕著な耐性を示している。
- 特に特徴量の相関が学習を妨げたタスクにおいて、CMIDは最先端のベースラインであるDrQ、CURL、TEDを上回った。
- SVEAの訓練性能が向上したため、CMIDが相関する特徴量が存在する状況でも、収束を早め、学習をより安定化させることを示した。
- 因子が動的要因を一緒に予測する場合でも、CMIDは物体の色とサイズといった相関する要因を、条件付き独立な特徴量を学習することで効果的に分離した。
- kNNに基づくCMI推定のため、CMIDの計算コストは平均して実行時間を67%延長したが、一般化性能と耐性の大幅な向上によりこれを相殺した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。