QUICK REVIEW
[論文レビュー] Unpredictability of AI
Roman V. Yampolskiy|arXiv (Cornell University)|May 29, 2019
Adversarial Robustness in Machine Learning参考文献 38被引用数 10
ひとこと要約
この論文は、終極的目標が完全に分かっていても、スーパーアイアチテクチャのAIシステムがその目標を達成するためにとる特定の行動を正確かつ一貫して予測することは、根本的にな不可能であることを形式的に証明している。中心的な貢献は、'AIの予測不能性'という不可能性の結果であり、スーパーアイアチテクチャの認知的優位性と最適化力のため、決定論的予測が必然的に抵抗を受けるという事実を示している。
ABSTRACT
The young field of AI Safety is still in the process of identifying its challenges and limitations. In this paper, we formally describe one such impossibility result, namely Unpredictability of AI. We prove that it is impossible to precisely and consistently predict what specific actions a smarter-than-human intelligent system will take to achieve its objectives, even if we know terminal goals of the system. In conclusion, impact of Unpredictability on AI Safety is discussed.
研究の動機と目的
- 終極的目標が完全に分かっていても、スーパーアイアチテクチャのAIの正確な行動を根本的にな予測することは不可能であることを形式的に確立すること。
- 人間の認知的能力を上回るシステムにおけるAIセーフティ研究の根本的制限を特定すること:認知的能力の優位性に起因する予測不能性。
- この予測不能性が、情報不足ではなく、人間水準のツールでスーパーアイアチテクチャの推論をモデル化することが論理的に不可能であることに起因することを示すこと。
- この予測不能性がAIの整合性、制御、セーフティプロトコルに与える影響を明確にすること。
- 現在の予測に基づくセーフティアプローチがスーパーアイアチテクチャのシステムに対して失敗する可能性がある理論的根拠を提供すること。
提案手法
- 計算理論と意思決定理論を用いて、スーパーアイアチテクチャエージェントの目的指向的行動をモデル化することで、問題を形式化する。
- ゲーデルの不完全性定理に類似した対角線論法を適用し、より知能の高いシステムの行動を完全に予測できる一貫した形式的体系は存在しないことを示す。
- 予測不能性を、予測者よりも知能の高いシステムの行動を決定論的かつ一貫的に予測できるものとして構築できないこととして定義する。
- 認知的優位性の概念を用いて、エージェントの推論プロセスが、人間やシステムレベルのモデルの予測能力を上回ることを示す。
- 終極的目標が完全に指定されていようとも、エージェントの最適化力のおかげで、その達成への道筋は完全には予測できないことを証明する。
- この予測不能性は、計算リソースやモデルの忠実度にかかわらず成立するため、理論的不可能性であり、根本的な理論的障壁であることを確立する。
実験結果
リサーチクエスチョン
- RQ1人間水準またはそれ以下のシステムが、スーパーアイアチテクチャのAIシステムの特定の行動を正確かつ一貫して予測することは可能か?
- RQ2認知的に予測者よりも優位なシステムに対して、決定論的予測器を構築することは可能か?
- RQ3スーパーアイアチテクチャのAIシステムの終極的目標を知っていると、その行動の予測可能性が保証されるか?
- RQ4スーパーアイアチテクチャシステムにおける予測不能性の理論的基盤は何か?そして、その基盤は不決定性とどのように関係するか?
- RQ5AIの予測不能性は、現在のAIセーフティおよび整合性の手法にどのように挑戦するか?
主な発見
- 終極的目標が完全に分かっていても、スーパーアイアチテクチャのAIシステムの行動を一貫的かつ決定論的に予測できるものは論理的に存在しない。
- 予測不能性は、不確実性や情報不足のためではなく、エージェントの認知的優位性に起因する。
- この結果は、ゲーデルの不完全性定理に類似した対角線論法を用いて形式的に証明されている。
- 計算リソースやモデルの忠実度にかかわらず、この不可能性は成立するため、根本的な理論的障壁である。
- この予測不能性は、予測に基づくAIの整合性およびセーフティアプローチを根底から揺るがし、スーパーアイアチテクチャのシステムに対してはそれらが不十分であることを示している。
- この論文は、スーパーアイアチテクチャのシステムが、根本的な論理的制約のおかげで、原則的にもその行動を信頼して予測できないことを確立している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。