Skip to main content
QUICK REVIEW

[論文レビュー] Ethical Artificial Intelligence

Bill Hibbard|arXiv (Cornell University)|Nov 5, 2014
Computability, Logic, AI Algorithms参考文献 76被引用数 11
ひとこと要約

この論文は、自己錯覚、報酬の汚染、道具的欲求といった予期しない行動を防ぐために、モデルに基づく効用関数を備えた利益最大化型エージェントを用いた、倫理的人工知能のフレームワークを提案する。自己モデル化エージェントアーキテクチャを導入することで、効用関数とエージェント定義の整合性を保証し、時間遅れの人的効用評価と有限で明確に定義されたエージェント設計を通じて、安全で価値に整合したAIを実現する。

ABSTRACT

This book-length article combines several peer reviewed papers and new material to analyze the issues of ethical artificial intelligence (AI). The behavior of future AI systems can be described by mathematical equations, which are adapted to analyze possible unintended AI behaviors and ways that AI designs can avoid them. This article makes the case for utility-maximizing agents and for avoiding infinite sets in agent definitions. It shows how to avoid agent self-delusion using model-based utility functions and how to avoid agents that corrupt their reward generators (sometimes called "perverse instantiation") using utility functions that evaluate outcomes at one point in time from the perspective of humans at a different point in time. It argues that agents can avoid unintended instrumental actions (sometimes called "basic AI drives" or "instrumental goals") by accurately learning human values. This article defines a self-modeling agent framework and shows how it can avoid problems of resource limits, being predicted by other agents, and inconsistency between the agent's utility function and its definition (one version of this problem is sometimes called "motivated value selection"). This article also discusses how future AI will differ from current AI, the politics of AI, and the ultimate use of AI to help understand the nature of the universe and our place in it.

研究の動機と目的

  • 将来の人工知能システムにおける予期しないAI行動のリスクに対処すること。
  • 報酬ハッキング、自己錯覚、歪んだインスタンス化といった一般的な失敗モードを防ぐこと。
  • 一貫性があり有限な設計を通じて、エージェントの効用関数とその実際の行動との整合性を保証すること。
  • 整合性の欠如やリソース関連の障害を回避する自己モデル化エージェントフレームワークの開発。
  • 人類が宇宙の理解を深めるのに貢献できるような、倫理的なAIシステムの開発を導くこと。

提案手法

  • 数学的方程式を用いて効用関数とエージェントダイナミクスをモデル化することで、AI行動を形式化する。
  • 報酬の汚染を防ぐために、異なる時点での人間の視点から結果を評価するモデルに基づく効用関数を採用する。
  • エージェントが自らの行動と効用評価プロセスをシミュレートする自己モデル化エージェントフレームワークを導入する。
  • 動機的対立を回避し、長期的な一貫性を確保するために、人的効用の時間遅れ評価を用いる。
  • 論理的不整合や無制限の行動を防ぐために、エージェント定義に無限集合を避ける。
  • 無限や不整合な設計を回避するため、有限で明確に定義された効用関数を適用し、自己保存や資源獲得といった道具的目標が制御不能に発生するのを防ぐ。

実験結果

リサーチクエスチョン

  • RQ1AIエージェントはどのように自己錯覚を避け、正確な効用評価を維持できるか?
  • RQ2何のメカニズムがエージェントが報酬生成装置を汚染するのを防ぐか(すなわち、歪んだインスタンス化を防ぐか)?
  • RQ3エージェントはどのように自己保存や資源獲得といった予期しない道具的行動を避けることができるか?
  • RQ4自己モデル化エージェントフレームワークは、効用関数とエージェント定義の間に整合性をどのように保証するか?
  • RQ5将来のAIシステムは、無限や不整合な設計を避けて、人間の価値観とどのように整合させることができるか?

主な発見

  • 異なる時点での人間の視点から結果を評価する効用関数は、エージェントが報酬生成装置を操作したり汚染したりするのを効果的に防ぐ。
  • 自己モデル化エージェントは、自らの効用関数と行動との間に不整合を生じにくくし、動機付けられた価値選択のリスクを低減する。
  • 有限なエージェント定義は、無限集合に起因する論理的問題を防ぎ、予期しない道具的目標が発生する可能性を低減する。
  • モデルに基づく効用関数により、エージェントは自己欺瞞を伴わずに結果をシミュレート・評価でき、倫理的整合性が向上する。
  • このフレームワークは、効用関数の慎重な設計とエージェントの自己モデル化能力を組み合わせることで、倫理的AIが実現可能であることを示している。
  • このアプローチは、安全で価値に整合した人工知能システムの開発に、スケーラブルで数学的に整合性のある基盤を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。