Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Bottleneck for Robust Self-Supervised Exploration

Chenjia Bai, Lingxiao Wang|arXiv (Cornell University)|Oct 20, 2021
Reinforcement Learning in Robotics参考文献 58被引用数 13
ひとこと要約

本論文は、情報ボトルネック原理を用いてノイズをフィルタリングする動的関連特徴を学習する自己教師付き探索手法であるDynamic Bottleneck (DB)を提案する。次状態との相互情報量を最大化し、関係のない状態-行動依存性を最小化することで、情報量の増加に基づく内在的ノベルティ(DBボーナス)を測定する。この手法は、報酬が疎でノイズの多いAtari環境において、最先端の手法を上回る性能を示す。

ABSTRACT

Exploration methods based on pseudo-count of transitions or curiosity of dynamics have achieved promising results in solving reinforcement learning with sparse rewards. However, such methods are usually sensitive to environmental dynamics-irrelevant information, e.g., white-noise. To handle such dynamics-irrelevant information, we propose a Dynamic Bottleneck (DB) model, which attains a dynamics-relevant representation based on the information-bottleneck principle. Based on the DB model, we further propose DB-bonus, which encourages the agent to explore state-action pairs with high information gain. We establish theoretical connections between the proposed DB-bonus, the upper confidence bound (UCB) for linear case, and the visiting count for tabular case. We evaluate the proposed method on Atari suits with dynamics-irrelevant noises. Our experiments show that exploration with DB bonus outperforms several state-of-the-art exploration methods in noisy environments.

研究の動機と目的

  • カメラノイズやランダムな動きなどの動的関連のないノイズが存在する環境において、既存の内在的好奇心および擬似カウント手法の不安定性を解消すること。
  • 情報ボトルネック原理を適用することで、動的関連特徴のみを捉える表現学習手法の開発。
  • 動的関連表現における情報量の増加に基づいて、状態-行動のノベルティを測定する新しい内在的ボーナス「DBボーナス」の設計。
  • 線形MDPにおけるUCBと、表形式MDPにおける訪問回数との間の理論的関連を確立すること。
  • 特に報酬が疎な状況(例:Montezuma’s Revenge)において、ノイズのある動的環境下での自己教師付き探索におけるDBボーナスのロバスト性と有効性の評価。

提案手法

  • DBモデルは、状態-行動ペア $ (S_t, A_t) $ の潜在表現 $ Z_t $ を、情報ボトルネック原理を用いて学習する。具体的には、表現と次状態との間の相互情報量 $ I(Z_t; S_{t+1}) $ を最大化する。
  • 入力と表現との間の相互情報量 $ I([S_t, A_t]; Z_t) $ を最小化することで、動的関連のない特徴を圧縮する。
  • 対照的学習を用いて $ I(Z_t; S_{t+1}) $ の下界を最適化し、分離可能で動的関連の特徴を学習する。
  • DBボーナスは、学習済みDB表現に対する状態-行動ペアの情報量の増加として計算され、不確実性の高い遷移の探索を促進する。
  • 表現の分離性(相互情報量の最小化)と予測性能(相互情報量の最大化)の二重目的を用いて、エンドツーエンドで学習する。
  • 理論的に、DBボーナスと線形MDPにおけるUCB、表形式MDPにおける訪問回数との関連を示し、証明可能に効率的な探索と整合していることを示す。

実験結果

リサーチクエスチョン

  • RQ1情報ボトルネック原理に基づく表現学習手法は、強化学習における動的関連のないノイズを効果的にフィルタリングできるか?
  • RQ2理論的根拠と実験的性能の両面で、提案されたDBボーナスはUCBや訪問回数と比べてどのように異なるか?
  • RQ3ノイズを注入した環境において、DBボーナスは既存の好奇心および擬似カウント手法よりもロバストな探索を実現するか?
  • RQ4報酬が疎な複雑な環境(例:Montezuma’s Revenge)において、DBモデルは意味的で分離可能な表現を学習できるか?
  • RQ5ノイズやスタックするアクションの条件下で、DBボーナスはエントロピーに基づく探索手法と比べてどのように性能を発揮するか?

主な発見

  • 動的関連のないノイズを注入したRandom-Box Atari環境において、DBボーナスは複数の最先端探索手法を上回り、ノイズに対して高いロバスト性を示した。
  • Montezuma’s Revengeの第一の部屋の半分を、自己教師付き学習下でDBボーナスがクリアしたが、すべてのベースラインはスコアがゼロであった。
  • t-SNE可視化により、DB表現は意味的でクラスタリングされた構造(例:ジャンプ、下降、脱出)を形成している一方、元の状態はそのようなクラスタリングを示さない。
  • スタックするアクションが存在する環境でも、本手法は優れた性能を示し、アクションの摂動に対して耐性があることが示された。
  • エントロピーに基づく手法(例:RE3)とは異なり、ノイズによって状態エントロピーが上昇してもDBボーナスは効果を保ち続けるため、ノイズ耐性が優れていることが明らかになった。
  • Gopherでのスパイク解析により、高DBボーナスのイベントはレアで高インパクトな遷移(例:ゴーファーが穴を掘る)に対応しており、高報酬獲得に不可欠な遷移であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。