[論文レビュー] An Approximation of the Universal Intelligence Measure
本稿では、普遍的知能尺度(UIM)の実用的近似として、アルゴリズム的知能指数(AIQ)を提案する。AIQは、単純なユニバーサルチューリングマシン(Brainfuck)からランダムにプログラムをサンプリングし、それらの環境で人工エージェントのパフォーマンスを測定することで、エージェントの知能を評価する。AIQは理論的期待と整合的であり、人間中心的でない連続的知能尺度の実現可能性を示している。
The Universal Intelligence Measure is a recently proposed formal definition of intelligence. It is mathematically specified, extremely general, and captures the essence of many informal definitions of intelligence. It is based on Hutter's Universal Artificial Intelligence theory, an extension of Ray Solomonoff's pioneering work on universal induction. Since the Universal Intelligence Measure is only asymptotically computable, building a practical intelligence test from it is not straightforward. This paper studies the practical issues involved in developing a real-world UIM-based performance metric. Based on our investigation, we develop a prototype implementation which we use to evaluate a number of different artificial agents.
研究の動機と目的
- 理論的に理想的な普遍的知能尺度(UIM)に基づく、計算上で実行可能で人間中心的でない知能尺度の開発を目的とする。
- UIMの漸近的非可解性に対処するため、ユニバーサルチューリングマシンからのプログラムサンプリングを用いて、実用的な近似を構築することを目的とする。
- 得られたAIQ尺度が、多様な環境において人工エージェントの順序付けを妥当かつ一貫して行うかを評価することを目的とする。
- 基準マシンやプログラムサンプリング戦略の変化に対して、知能尺度がどの程度頑健であるかを調査することを目的とする。
提案手法
- AIQは、Brainfuckに基づくユニバーサルチューリングマシンからランダムにプログラムをサンプリングし、それぞれを計算可能環境とみなすことによってUIMを近似する。
- エージェントのパフォーマンスは、強化学習フレームワーク内で累積期待報酬を測定することで、これらのサンプル環境で評価される。
- 知能スコアは、パフォーマンスの重み付き平均として計算され、重みはプログラム長(コルモゴロフ複雑度の代理)に基づき、より単純な環境を優遇する。
- アルゴリズム的複雑度の明示的計算を避けるために、プログラム長をヒューリスティックな近似として用いる。
- ソロモンoffのユニバーサル・プライオリティおよびヒューターのAIXI理論を、プログラム環境空間の有限かつサンプリングされた部分集合に適用する。
- AIQは、単純な反応型および学習型エージェントを含むさまざまなエージェントに対して実装・テストされ、知能差の感度を検証する。
実験結果
リサーチクエスチョン
- RQ1理論的に非実行可能な普遍的知能尺度は、ユニバーサルチューリングマシンからのプログラムサンプリングを用いて、実用的に意味的に近似可能か?
- RQ2得られたAIQ尺度は、より知能の高いエージェントがより高いスコアを達成するなど、一貫的かつ直感的なエージェント順位付けを生じるか?
- RQ3AIQは基準マシンの選択にどの程度敏感であり、微小な変更に対しても頑健であるか?
- RQ4AIQは、連続性や人間中心的でない性質といった、UIMの理論的性質をどの程度反映しているか?
主な発見
- AIQは、理論的期待と整合的であり、人間中心的でない連続的知能スコアを効果的に生成し、より能力の高いエージェントがより高いスコアを達成する。
- アルゴリズム的複雑度の明示的計算を避けるために、プログラム長をコルモゴロフ複雑度の代理として用いることで、計算上の実行可能性が著しく向上した。
- AIQは、Brainfuck基準マシンの微小な変種に対して、質的整合性を示しており、基準マシンの選択に対して頑健であることが示唆された。
- AIQは、単純な反応型エージェントとより能力の高い学習型エージェントを区別でき、知能差の感度が妥当であることを検証した。
- 従来のCテストのような方法とは異なり、サンプルプログラムを直接実行することで、ブルートフォースなプログラム探索の非実行性を回避し、より長いプログラムに対してもスケーラブルである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。