QUICK REVIEW
[論文レビュー] Asymptotically Optimal Agents
Tor Lattimore, Marcus Hütter|arXiv (Cornell University)|Jul 27, 2011
Computability, Logic, AI Algorithms参考文献 7被引用数 9
ひとこと要約
本稿は、決定的で計算可能な環境における漸近的に最適なエージェントの存在を調査し、漸近的最適性の強い形と弱い形を定義する。計算可能でない弱い意味での漸近的最適なエージェントが、幾何的割引関数など特定の割引関数に対して存在することを示し、探索と活用のバランスを取るための特化した探索スケジュールによって、探索と活用の両方を実現している。
ABSTRACT
Artificial general intelligence aims to create agents capable of learning to solve arbitrary interesting problems. We define two versions of asymptotic optimality and prove that no agent can satisfy the strong version while in some cases, depending on discounting, there does exist a non-computable weak asymptotically optimal agent.
研究の動機と目的
- 逐次意思決定設定における漸近的最適性の2つの定義—強いものと弱いもの—を形式化・分析すること。
- さまざまな割引関数の下で、決定的で計算可能な環境のクラスにおいて、漸近的に最適なエージェントが存在するかどうかを特定すること。
- 長期的最適性を達成するにあたり、探索の役割を調査すること。特に、エージェントが真の環境を学習するが、漸近的性能を犠牲にしないかを検討すること。
- AIXI やベイジアンエージェントに関する先行研究を拡張し、このクラスにおいて静的ベイジアンエージェントでさえ、弱い意味での漸近的最適性が達成できないことを示すこと。
- 弱い意味での漸近的最適な方策が計算可能な環境に認められるかどうかに基づいて、割引関数を分類すること。
提案手法
- 強い漸近的最適性は、エージェントが極限において探索を停止し、最適に行動することを要件とする。弱い漸近的最適性は、持続的だが徐々に減少する探索を許容する。
- 計算可能な探索スケジュールを用いる非計算可能エージェントを構築し、真の環境を学習するのに十分な探索を保証するとともに、長期的最適性を維持する。
- 割引関数を用いてエージェントの将来志向的行動をモデル化し、主な洞察は、割引関数の選択が弱い意味での漸近的最適性の達成可能性を決定することにある。
- エージェントが計算可能な環境の事前分布に基づき、候補となる環境の集合を維持し、信念を更新するモデルベース強化学習フレームワークを用いる。
- バンディットアルゴリズム(例:UCB)やε-greedy探索の技術を適応し、真の環境を学習するのに十分な頻度で探索を行うが、性能損失を避けるために十分に頻度を減らすようにする。
- 反例環境を構築する証明戦略を用い、いかなるエージェントも十分に探索しないか、長期的パフォーマンスを犠牲にするかのどちらかに陥ることを強制する。
実験結果
リサーチクエスチョン
- RQ1計算可能なエージェントは、決定的で計算可能な環境のクラスにおいて、強く漸近的に最適になれるか?
- RQ2どの割引関数に対して、決定的で計算可能な環境のクラスにおいて弱い意味での漸近的最適エージェントが存在するか?
- RQ3幾何的割引関数の下で、非計算可能で弱い意味での漸近的最適なエージェントを構築することは可能か?
- RQ4AIXI が弱い意味での漸近的最適性を達成できない理由は何か? そして、探索成分を追加することでこの失敗を是正できるか?
- RQ5弱い意味での漸近的最適性の結果は、確率的で計算可能な環境に拡張可能か?
主な発見
- いかなる割引関数に対しても、計算可能なエージェントは決定的で計算可能な環境のクラスにおいて強く漸近的に最適にはなれない。
- 幾何的およびその他の和が収束する割引関数に対して、非計算可能な弱い意味での漸近的最適エージェントが存在し、弱い意味での漸近的最適性が原理的に達成可能であることを示している。
- 弱い意味での漸近的最適エージェントの存在は、割引関数に強く依存する。一部の関数に対しては、非計算可能なエージェントですら弱い意味での漸近的最適性を達成できない。
- AIXI が弱い意味での漸近的最適性を達成できない理由は、最終的に探索を停止してしまうことに起因し、その結果、一部の状況では真の環境を学習できない。
- 提案されたエージェントは、探索の頻度を徐々に減らしつつも、真の環境を同定するのに十分な深さを保証することで、探索と活用のバランスを保っている。
- これらの結果は、計算可能な環境のクラスにおいて、静的ベイジアンエージェントですら弱い意味での漸近的最適性が達成できないことを示唆し、一般環境におけるベイジアン学習の仮定に疑問を呈する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。