Skip to main content
QUICK REVIEW

[論文レビュー] Modeling Human Exploration Through Resource-Rational Reinforcement Learning

Marcel Binz, Eric Schulz|arXiv (Cornell University)|Jan 27, 2022
Reinforcement Learning in Robotics被引用数 8
ひとこと要約

本論文は、リソースリソースに最適化された強化学習(RR-RL²)を提案する。これは、性能を犠牲にして記述長(ビット)を最小化することで、探索を最適化するメタ学習アルゴリズムである。この手法は、トムソンサンプリングやUCBといった標準的手法よりも、人間の行動をモデル化する際に優れている。また、記述長の操作によって、発達的および臨床的変化を反映した探索行動を捉えており、人工エージェントにおける人間らしき探索行動を生物学的に妥当な枠組みで提示している。

ABSTRACT

Equipping artificial agents with useful exploration mechanisms remains a challenge to this day. Humans, on the other hand, seem to manage the trade-off between exploration and exploitation effortlessly. In the present article, we put forward the hypothesis that they accomplish this by making optimal use of limited computational resources. We study this hypothesis by meta-learning reinforcement learning algorithms that sacrifice performance for a shorter description length (defined as the number of bits required to implement the given algorithm). The emerging class of models captures human exploration behavior better than previously considered approaches, such as Boltzmann exploration, upper confidence bound algorithms, and Thompson sampling. We additionally demonstrate that changing the description length in our class of models produces the intended effects: reducing description length captures the behavior of brain-lesioned patients while increasing it mirrors cognitive development during adolescence.

研究の動機と目的

  • 人間の探索行動が、限られた計算リソースを最適に使うことによって生じるのかを調査すること。
  • 性能を犠牲にして、アルゴリズムの記述長(記述に必要なビット数)を短くすることで、認知リソース制約を反映した強化学習フレームワークを開発すること。
  • モデルにおける記述長の操作が、発達および脳損傷に伴う人間の探索行動の変化を再現できるかを検証すること。
  • 標準的なバンディットモデルを超えて一般化できる、統一的で生物学的に妥当な人間の探索行動の説明を提供すること。

提案手法

  • アルゴリズムの実装に必要なビット数(記述長)の制約の下でパフォーマンスを最適化することで、強化学習ポリシーをメタ学習する。
  • 最小記述長(MDL)原理にインspiredされた情報理論的正則化を用い、期待リターンとアルゴリズムの複雑さのバランスを取る。
  • メタ強化学習を用いてモデルを訓練し、事前分布が与えられたバンディットタスクの分布全体でポリシーを最適化する。
  • ポリシーを再帰的ニューラルネットワークとして表現し、その記述長を重みとアーキテクチャを符号化するのに必要なビット数で測定する。
  • 記述長の制約を調整することで、認知リソース制限を模倣し、人間および患者の行動と比較可能にする。
  • 本モデルを用いて、2腕バンディットタスクにおける人間の意思決定に関する3つの心理的研究のデータを再分析する。

実験結果

リサーチクエスチョン

  • RQ1人間の探索行動は、トムソンサンプリングやUCBといった標準的ヒューリスティクスよりも、リソースリソースに最適化された強化学習モデルによってよりよく説明できるか?
  • RQ2RR-RL²のアルゴリズムの記述長を短縮することで、前頭前皮質損傷患者に観察された探索パターンが再現できるか?
  • RQ3RR-RL²の記述長を延ばすことで、思春期に見られるランダム探索から指向的探索へのシフトが再現できるか?
  • RQ41つのメタ学習アルゴリズムが、多様な認知的文脈における人間の探索行動の定性的および定量的側面を捉えることができるか?

主な発見

  • RR-RL²は、2腕バンディットタスクにおける人間の選択を、定性的および定量的に、トムソンサンプリング、UCB、およびそれらの混合モデルを上回って説明できた。
  • RR-RL²の記述長を短縮することで、前頭前皮質損傷患者に観察された探索パターンと整合するものが得られ、戦略的探索の喪失を示唆した。
  • RR-RL²の記述長を延ばすことで、思春期発達に伴うランダム探索から指向的探索へのシフトを再現でき、認知コントロールの向上を示唆した。
  • モデルの性能は、さまざまなタスク構造に対して頑健であり、低記述長のアルゴリズムが強力な正則化子として機能し、一般化を促進することを示した。
  • モデルの予測は、3つの心理的研究からの実証データと整合しており、本モデルが現実の人間行動を捉える能力を検証した。
  • このフレームワークは、最小記述長が生物学的制約にとどまらず、強固でドメインに依存しない探索戦略を可能にする機能的特徴である可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。