QUICK REVIEW
[論文レビュー] Tests of Machine Intelligence
Shane Legg, Marcus Hütter|ArXiv.org|Dec 22, 2007
Computability, Logic, AI Algorithms参考文献 18被引用数 5
ひとこと要約
本論文は、チューリングテストを超えた機械知能の代替的テストおよび定義の包括的かつ体系的なサーベイを初めて提示する。11のアプローチ(圧縮テスト、心理測定的アプローチ、汎用知能測定法など)を評価し、アルゴリズム的複雑性と強化学習に基づく形式的・客観的・根本的な枠組みとしての汎用知能を提唱する。これは、多様な環境や認知的能力にわたる機械知能の測定に数学的に厳密な基準を提供する。
ABSTRACT
Although the definition and measurement of intelligence is clearly of fundamental importance to the field of artificial intelligence, no general survey of definitions and tests of machine intelligence exists. Indeed few researchers are even aware of alternatives to the Turing test and its many derivatives. In this paper we fill this gap by providing a short survey of the many tests of machine intelligence that have been proposed.
研究の動機と目的
- 機械知能のテストおよび定義に関する包括的サーベイが不足していることによる、AI分野における理論的・実践的進展の阻害を是正すること。
- チューリングテストの優位性を疑問視し、その限界(たとえば、だましの脆弱性、人間中心的バイアス、形式的根拠の欠如)を特定すること。
- 特に汎用知能を含む代替的フレームワークを提唱・評価すること。これらは形式的・客観的であり、単純なエージェントからスーパーアイテイジジェントに至るまでの知能測定が可能である。
- 有効性、普遍性、実用性、形式的定義の基準に基づいて、既存のテストを比較分析するための基盤を提供すること。
- 将来的な理論的・応用的研究を導くために、明確に定義され、数学的に根拠を持つ知能測定基準への研究の基盤的転換を提唱すること。
提案手法
- チューリングテスト、圧縮テスト、言語的複雑性、競合ゲーム、心理測定的アプローチを含む、11の異なる機械知能テストおよび定義のサーベイ。
- アルゴリズム的確率と普遍的事前分布を用いて、すべての計算可能環境におけるエージェントのパフォーマンスを統合する、形式的測定としての汎用知能(Υ)を導入。
- アルゴリズム的確率(コルモゴロフ複雑度)で重み付けされたすべての環境におけるパフォーマンスの集約として、汎用知能測定値Υを定義。
- レヴィンのKt複雑度を用いて、計算可能な環境で汎用知能を近似する実用的アプローチとしてC-Testを提唱。
- 有効性、客観性、普遍性、実用性などの13の基準に沿って各テストを評価し、標準化されたスコアリングシステムを用いて横断的比較を可能にする。
- 理論的ベンチマークとしてAIXIエージェントを用いる:最大の汎用知能を持つエージェントであり、強化学習設定において強力な最適性特性を示すことが証明済み。
実験結果
リサーチクエスチョン
- RQ1チューリングテストが機械知能の測定基準として根本的に欠陥を抱えている点は何か?なぜそれが基盤的基準として不十分なのか?
- RQ2機械知能を形式的・客観的・人間中心的でない方法で定義・測定することは可能か?
- RQ3圧縮、言語的複雑性、あるいは競合ゲームといった代替的テストが、有効かつ一般化可能な知能測定基準としてどれほど機能するか?
- RQ4単純な適応的エージェントからスーパーアイテイジジェントに至るまでカバーできる汎用知能測定基準を構築することは可能か?
- RQ5有効性、普遍性、実用性、形式的定義といった主要次元において、異なるテストどうしがどのように比較できるか?
主な発見
- チューリングテストは、ルックアップテーブルによるだましに脆弱であり、一般知能よりも人間らしい行動に偏るため、知能測定基準として根本的に欠陥を抱えている。
- 汎用知能(Υ)は、アルゴリズム的確率とコルモゴロフ複雑度を用いて形式的に定義されており、普遍的・客観的・根本的であるため、最も包括的かつ理論的に整合性のある測定基準である。
- C-Testは、レヴィンのKt複雑度を用いて汎用知能の計算可能な近似を提供する。これにより、理論的厳密性を保ちつつ、現実世界での評価が可能になる。
- サーベイされたテストの中で、汎用知能とC-Testのみが完全な形式的定義、客観性、普遍性を達成しており、他の大多数のテストは評価基準の50%以上で失敗している。
- AIXIエージェントは、理論的に汎用知能を最大化するエージェントであり、汎用知能が形式的に明確に定義されているだけでなく、強化学習設定において強力な最適性特性を有することを示している。
- 本サーベイは、数十年にわたる研究にもかかわらず、広く受け入れられ、形式的かつ一般化可能な機械知能のテストが現在存在しないことを明らかにしている。これはAI研究における深刻なギャップを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。