Skip to main content
QUICK REVIEW

[論文レビュー] On the Computability of AIXI

Jan Leike, Marcus Hütter|arXiv (Cornell University)|Oct 19, 2015
Computability, Logic, AI Algorithms参考文献 22被引用数 3
ひとこと要約

この論文は、AIXIが行動選択における決定不能な同点解消と無限ホライズン価値関数の定義により、極限計算不能であることを確立している。著者らは再帰的価値関数を導入し、$\epsilon$-最適方策に注目することで、期待報酬を最大化する極限計算可能なAIXIの変種を構築した。

ABSTRACT

How could we solve the machine learning and the artificial intelligence problem if we had infinite computation? Solomonoff induction and the reinforcement learning agent AIXI are proposed answers to this question. Both are known to be incomputable. In this paper, we quantify this using the arithmetical hierarchy, and prove upper and corresponding lower bounds for incomputability. We show that AIXI is not limit computable, thus it cannot be approximated using finite computation. Our main result is a limit-computable ε-optimal version of AIXI with infinite horizon that maximizes expected rewards.

研究の動機と目的

  • AIXIの算術階層における不計算不能性の正確なレベルを特定すること。
  • AIXIの無限ホライズン価値関数と行動選択における同点解消が極限計算不能性を引き起こす根本的問題を扱うこと。
  • 無限ホライズン下で期待報酬を最大化する、計算可能で、$\epsilon$-最適なAIXIのバージョンを開発すること。
  • 提案された再帰的価値関数が、環境が終了する可能性がある場合でも期待報酬を正しく計算できることを証明すること。

提案手法

  • 算術階層を用いてAIXIおよび関連エージェントの計算可能性を分類し、$\Sigma^0_4$-ハードおよび$\Sigma^0_3$-ハードのレベルを特定する。
  • 反復的定義を避けるために、価値関数$W^\pi_\nu$の再帰的定義を導入する。
  • 反復的価値関数$V^\pi_\nu$を、下から半計算可能であり、極限計算可能性を可能にする$W^\pi_\nu$に置き換える。
  • 再帰的価値関数をAIXIおよびAINUに適用し、$\epsilon$-最適方策が極限計算可能($\Sigma^0_2$)であることを示す。
  • ホライズン$m$における単調性を保証することで、再帰的価値関数が期待報酬を正しく計算できることを示す。
  • 下から半計算可能な関数は極限に関して閉じていることを利用し、$\epsilon$-最適方策のためのいつでも利用可能なアルゴリズムの構築を可能にする。

実験結果

リサーチクエスチョン

  • RQ1AIXIの算術階層内での不計算不能性の正確なレベルは何か?
  • RQ2AIXIの標準的反復的価値関数はなぜ極限計算不能であり、これを是正できるか?
  • RQ3無限ホライズン下で期待報酬を最大化する、極限計算可能で$\epsilon$-最適なAIXIのバージョンを構築できるか?
  • RQ4再帰的価値関数$W^\pi_\nu$は、環境が終了する可能性がある場合でも期待報酬を正しく計算できるか?
  • RQ5一般の半計算可能環境における最適および$\epsilon$-最適方策の計算のハードネス境界は何か?

主な発見

  • AIXIは極限計算不能であり、最適方策では$\Sigma^0_4$-ハード、$\epsilon$-最適方策では$\Sigma^0_3$-ハードである。
  • 反復的価値関数$V^\pi_\nu$は、永遠に生存することを条件としているが、これは決定不能であるため、極限計算不能である。
  • 再帰的価値関数$W^\pi_\nu$は$\Sigma^0_2$-計算可能であり、無限ホライズンにおける$\epsilon$-期待報酬を正しく計算する。
  • $\epsilon$-最適方策を再帰的価値関数に基づいて構築した場合、極限計算可能($\Sigma^0_2$)となり、任意の通常のチューリングマシンによって近似可能である。
  • 特定の汎用チューリングマシンに対して、$\epsilon$-最適な再帰的AIXIは$\Sigma^0_1$-ハードであり、停止問題と同程度の難易度である。
  • 再帰的AIXIエージェントは高速に収束する:$\epsilon(t)$-最適方策の価値は$t \to \infty$のとき最適値に収束する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。