Skip to main content
QUICK REVIEW

[論文レビュー] Exploration and preference satisfaction trade-off in reward-free learning

Noor Sajid, Panagiotis Tigas|arXiv (Cornell University)|Jun 8, 2021
Reinforcement Learning in Robotics参考文献 56被引用数 11
ひとこと要約

この論文では、共役事前分布を用いて状態および結果の好みを推論することで、探索と好み満足のバランスをとる、報酬なしの好み学習メカニズム「Pepper」を紹介する。環境との相互作用から外在的報酬なしに好みを学習することで、変動しやすい環境では適応的かつ柔軟に探索し、安定した環境では利用する。シミュレートされた環境において、好奇心と目的志向的行動の自己調節的トレードオフが実現されている。

ABSTRACT

Biological agents have meaningful interactions with their environment despite the absence of immediate reward signals. In such instances, the agent can learn preferred modes of behaviour that lead to predictable states -- necessary for survival. In this paper, we pursue the notion that this learnt behaviour can be a consequence of reward-free preference learning that ensures an appropriate trade-off between exploration and preference satisfaction. For this, we introduce a model-based Bayesian agent equipped with a preference learning mechanism (pepper) using conjugate priors. These conjugate priors are used to augment the expected free energy planner for learning preferences over states (or outcomes) across time. Importantly, our approach enables the agent to learn preferences that encourage adaptive behaviour at test time. We illustrate this in the OpenAI Gym FrozenLake and the 3D mini-world environments -- with and without volatility. Given a constant environment, these agents learn confident (i.e., precise) preferences and act to satisfy them. Conversely, in a volatile setting, perpetual preference uncertainty maintains exploratory behaviour. Our experiments suggest that learnable (reward-free) preferences entail a trade-off between exploration and preference satisfaction. Pepper offers a straightforward framework suitable for designing adaptive agents when reward functions cannot be predefined as in real environments.

研究の動機と目的

  • 外在的報酬信号が事前に定義されていない状況でも、適応的好みを学習できる報酬フリーなフレームワークの開発。
  • 動的環境における探索(内発的動機)と好み満足(恒常的動機)のトレードオフのモデル化。
  • 環境との相互作用に基づいて、好みを自律的かつ更新可能に発展・学習できる仕組みを実現する。ベイズ推論を用いる。
  • 外在的報酬が存在しない状況でも、好み学習が適応的行動を駆動できることを示すこと。
  • アクティブインファレンスやディープ強化学習フレームワークと互換性がある、柔軟でモデルベースのメカニズムの提供。

提案手法

  • Pepperは、エージェントと環境の相互作用から得られるデータを用いて、共役事前分布を用いて状態または結果に関する好みを学習する。短い探索エピソード後に信念を更新する。
  • この手法は、期待自由エネルギー(EFE)計画目的関数と統合され、内発的興味と好みに基づく行動のバランスを取る。
  • 2段階のプロセスを採用する:まず、エージェントが環境と相互作用し、観測および隠れ状態の履歴を収集する。次に、共役事前分布を用いたベイズ推論により、事前好みを更新する。
  • 生成モデルは事前に学習され、テスト時の計画段階で好み学習が行われる。これにより、エージェントは学習済みの好みに基づいて行動できる。
  • 共役事前分布により、効率的かつアモアタイズド( amortized )な好み学習が可能となり、経験依存的学習を反映するシナプス可塑性に類似した更新が実現される。
  • このフレームワークは、ディープアクティブインファレンスエージェントと互換性があり、MaxEnt や Dreamer などの他のベイズ強化学習手法にも適応可能である。

実験結果

リサーチクエスチョン

  • RQ1外在的報酬信号にアクセスできない状況で、エージェントがどのように探索と好み満足のバランスをとれるか。
  • RQ2共役事前分布がベイズフレームワーク内での効率的かつ適応的好み学習を可能にする役割は何か。
  • RQ3環境の変動性が、報酬なしエージェントにおける探索的行動と利用的行動の出現に与える影響は何か。
  • RQ4好み学習が、異なる環境条件下で明確で安定した行動戦略を生み出すことができるか。
  • RQ5報酬なしメカニズムが、シミュレートされた環境において、適応的かつ自己証明的行動をどれほど生み出せるか。

主な発見

  • 安定した環境では、Pepperを用いたエージェントは正確で自信のある好みを発展させ、時間とともに探索を減少させた。
  • 変動しやすい環境では、好みに関する持続的な不確実性が維持され、早期の利用を防ぐ探索的行動が継続した。
  • 変動しやすい環境設定では、状態および報酬分布のエントロピーが高く保たれ、持続的な不確実性と継続的探索が示された。
  • 状態好み学習(式5)を用いたエージェントは、明確な軌道を示し、しばしば好ましい状態(例:グレーの壁)に近づき、その周辺に留まる傾向を示した(可視化された軌道で確認)。
  • 共役事前分布の使用により、経験依存的可塑性が効率的に実現され、蓄積された観測を反映するシナプスに類似した更新が可能となった。
  • 蓄積されたディリクレ分布パラメータ(好みを表す)を除去した場合、一貫して探索的行動が観察された。これは、好みの不確実性が探索を維持する役割を果たしていることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。