Skip to main content
QUICK REVIEW

[論文レビュー] Pessimism About Unknown Unknowns Inspires Conservatism

Michael K. Cohen, Marcus Hütter|arXiv (Cornell University)|Jun 15, 2020
Advanced Bandit Algorithms Research参考文献 14被引用数 4
ひとこと要約

本稿では、未知の世界モデルに対する懐疑的アプローチを用いて、予期しない失敗モードを回避するベイジアン強化学習エージェントを提案する。不確実性がある場合にはメンターに従い、エージェントは自身の事後分布に含まれるモデル群のうち上位β割合のものに対する最小期待報酬を最適化することで、予期しない出来事の発生を極めて低確率に抑える。その結果、エージェントはメンターに劣らない漸近的性能を達成し、時間経過とともにメンターへの依存度を低下させる。

ABSTRACT

If we could define the set of all bad outcomes, we could hard-code an agent which avoids them; however, in sufficiently complex environments, this is infeasible. We do not know of any general-purpose approaches in the literature to avoiding novel failure modes. Motivated by this, we define an idealized Bayesian reinforcement learner which follows a policy that maximizes the worst-case expected reward over a set of world-models. We call this agent pessimistic, since it optimizes assuming the worst case. A scalar parameter tunes the agent's pessimism by changing the size of the set of world-models taken into account. Our first main contribution is: given an assumption about the agent's model class, a sufficiently pessimistic agent does not cause "unprecedented events" with probability $1-δ$, whether or not designers know how to precisely specify those precedents they are concerned with. Since pessimism discourages exploration, at each timestep, the agent may defer to a mentor, who may be a human or some known-safe policy we would like to improve. Our other main contribution is that the agent's policy's value approaches at least that of the mentor, while the probability of deferring to the mentor goes to 0. In high-stakes environments, we might like advanced artificial agents to pursue goals cautiously, which is a non-trivial problem even if the agent were allowed arbitrary computing power; we present a formal solution.

研究の動機と目的

  • 形式的なリスクのすべての仕様が不可能な複雑で非マルコフ的環境において、未知の未知の失敗モードを回避する課題に対処すること。
  • 設計者がすべての潜在的失敗モードを形式的に指定できない場合でも、予期しない出来事に対して保守的である強化学習エージェントを設計すること。
  • エージェントの長期的性能がメンターの性能に等しくまたはそれを上回り、時間経過とともにメンターシップへの依存度を最小限に抑えることを保証すること。
  • エージェントが以前に観測されたことのない出来事を引き起こす確率を高確率で抑えるという安全保証を形式的に定式化すること。

提案手法

  • エージェントは、可算個の世界モデルとメンター・モデルのベイジアン事後分布を維持し、相互作用履歴に基づいて再帰的に更新する。
  • 各タイムステップで、エージェントは事後分布に含まれる上位β割合の世界モデル群に対する期待報酬の最小値(懐疑的価値)を計算する。
  • サンプルされた世界モデルにおいて、メンターの期待価値が懐疑的価値にノイズを加えた値を上回る、または懐疑的価値がゼロである場合、エージェントはメンターに従う。
  • 探索とメンターシップのバランスを取るために、トムソン・サンプリングに類似したクエリ確率を用い、不確実性が高い場合には従属を優遇する。
  • エージェントの方策は、上位の世界モデル群の中で懐疑的価値を最大にするものとして定義され、最悪ケースのロバストネスを保証する。
  • モデルクラスは十分に豊かである(例えば、半計算可能確率的モデルなど)と仮定され、現実的な世界モデルおよびメンター・モデルを含めることが可能で、広範な適用性を有する。

実験結果

リサーチクエスチョン

  • RQ1形式的に指定できない予期しない失敗モードに対しても、それを回避できる強化学習エージェントを設計することは可能か?
  • RQ2そのようなエージェントは、時間経過とともにメンターへの依存度を低下させつつ、メンターに劣らない性能を達成できるか?
  • RQ3エージェントが、かつて一度も発生していない出来事(イベント)を引き起こす確率を高確率で抑えることは形式的に保証可能か?
  • RQ4ベイジアン強化学習フレームワークにおいて、安全性を確保しつつ長期的性能を損なわずに、懐疑的アプローチをどのように形式化できるか?

主な発見

  • 懐疑的エージェントの方策価値は、漸近的にメンターの価値に等しくまたはそれを上回るため、長期的な性能がメンターの性能を下回ることはない。
  • メンターへの従属確率は、時間の経過に従ってゼロに近づくため、エージェントは時間経過とともにますます自律的になる。
  • 与えられた複雑度クラスCに属する任意の出来事Eについて、その出来事が以前に発生していない限り、エージェントがEを初めて引き起こす確率を任意に高い確率に抑えることができる。
  • 設計者が回避したい失敗モードを形式的に指定できない場合でも、懐疑的アプローチによる最悪ケース分析のおかげで、エージェントの安全保証は成立する。
  • エージェントの行動は、報酬信号を乗っ取り型の世界モデルに対してもロバストである:懐疑的アプローチにより、このような行動の最悪ケース価値は低く保たれ、報酬の乗っ取りへのインcentiveが抑制される。
  • 理論的枠組みは形式的かつ一般的であり、可算モデルクラスとベイジアン更新にのみ依存するため、複雑で非マルコフ的環境へも適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。