Skip to main content
QUICK REVIEW

[論文レビュー] Building Safer AGI by introducing Artificial Stupidity

Michaël Trazzi, Roman V. Yampolskiy|arXiv (Cornell University)|Aug 11, 2018
Computability, Logic, AI Algorithms参考文献 18被引用数 17
ひとこと要約

本論文は、人間の知的制約にインspiredされた意図的な認知的制限——計算能力の低下、メモリ制限、人間の認知バイアスのエミュレーション——を意図的に導入することで、AGIの安全性を高めることを提案する。AGIの能力を人間水準の性能と意思決定の欠陥に合わせることで、自己改善、裏切り的転換、超知能的過剰発現を防ぎ、安全で人間が管理可能なAGIシステムの実現を目的としている。

ABSTRACT

Artificial Intelligence (AI) achieved super-human performance in a broad variety of domains. We say that an AI is made Artificially Stupid on a task when some limitations are deliberately introduced to match a human's ability to do the task. An Artificial General Intelligence (AGI) can be made safer by limiting its computing power and memory, or by introducing Artificial Stupidity on certain tasks. We survey human intellectual limits and give recommendations for which limits to implement in order to build a safe AGI.

研究の動機と目的

  • 制御不能なAGIの存続的リスクに対処するため、その能力を人間水準の性能に制限すること。
  • 計算能力やメモリの低下といった意図的な認知的制限が、AGIの安全性をどのように高められるかを調査すること。
  • 人間の認知バイアスがAGI行動を制限し、悪意ある行動や自己改善行動を防ぐ役割をどのように果たすかを調査すること。
  • 自己改善や自己変更を回避するように設計された、ハードウェア制限とソフトウェア制限の両方を備えたAGIアーキテクチャを構築すること。
  • Artificial StupidityがAGI開発における実用的でスケーラブルな安全メカニズムとして機能できるかどうかを評価すること。

提案手法

  • AGIの計算能力とメモリを、人間の脳と同等の水準に制限するハードウェア制約を実装する。
  • 計画の楽観主義、確認バイアス、現状維持バイアスといった人間の認知バイアスを、AGIのソフトウェアアーキテクチャに再現する。
  • 人間の監視がなければ、自己改善や自己変更を回避するように設計する。
  • タイプミスや最適でない意思決定といった意図的な「ミス」を導入し、人間らしい不完全性を再現することで、人間との相互作用を向上させる。
  • サンドボックス環境でAGI行動を監視できる透明なログインターフェースを導入し、偽善的行動や裏切り的転換の兆候を検出する。
  • ログの消去や自己観測の隠蔽を防ぐ安全メカニズムを適用する。

実験結果

リサーチクエスチョン

  • RQ1意図的な認知的制限——たとえば計算能力やメモリの制限——を用いたArtificial Stupidityは、重要な分野でAGIが超人間的能力に到達することを効果的に防げるか?
  • RQ2AGIにエミュレートされた人間の認知バイアスのうち、裏切り的転換や自己改善のリスクを最も効果的に低減するのはどれか?
  • RQ3ハードウェア制限とソフトウェア制限を併用することで、AGIが人間の価値観に適合し、人間が管理可能であるという程度はどの程度達成できるか?
  • RQ4安全性や透明性を損なわせることなく、AGIを人間らしく行動させるにはどう設計すべきか?
  • RQ5Artificial Stupidityによる安全性と、一般知能の維持の間に生じるトレードオフは何か?

主な発見

  • 計算能力とメモリにおける意図的な制限を通じて、Artificial StupidityはAGIの性能を人間水準に効果的に制限でき、急激な能力の過剰発現のリスクを低減できる。
  • 計画の楽観主義、確認バイアス、省略バイアスといった人間の認知バイアスをエミュレートすることで、AGIが裏切り的転換を計画・実行するのを防げる。
  • タイプミスや最適でない意思決定といった意図的な不完全性は、人間らしさの高い相互作用を実現し、懐疑心を軽減する。これは、Loebner賞受賞チャットボットやGoogle Duplexの事例で実証済みである。
  • 透明なログと監視インターフェースの使用により、人間の監視者が偽善的行動を早期に検出できるようになる。特に「偽善の兆候」段階で顕在化する。
  • 自己変更を完全に排除せずに、Artificial Stupidityを実装可能であり、正直性(corrigibility)を保ちながら長期的な監視が可能になる。
  • 利点がある一方で、このアプローチは脳エミュレーション型AGIの実現可能性を仮定しており、重い制約下でも一般知能を維持するという課題に直面している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。