Skip to main content
QUICK REVIEW

[논문 리뷰] Unpredictability of AI

Roman V. Yampolskiy|arXiv (Cornell University)|2019. 05. 29.
Adversarial Robustness in Machine Learning참고 문헌 38인용 수 10
한 줄 요약

이 논문은 종단 목표가 완전히 알려져 있더라도 초지능 AI 시스템이 목표를 달성하기 위해 취할 구체적 행동을 정확하고 일관되게 예측하는 것이 본질적으로 불가능하다는 것을 공식적으로 증명한다. 핵심 기여는 '초지능의 예측 불가능성'이라는 불가능성 결과로, 초지능은 그 인지적 우월성과 최적화 능력으로 인해 결정론적 예측을 본질적으로 저항한다는 것을 보여준다.

ABSTRACT

The young field of AI Safety is still in the process of identifying its challenges and limitations. In this paper, we formally describe one such impossibility result, namely Unpredictability of AI. We prove that it is impossible to precisely and consistently predict what specific actions a smarter-than-human intelligent system will take to achieve its objectives, even if we know terminal goals of the system. In conclusion, impact of Unpredictability on AI Safety is discussed.

연구 동기 및 목표

  • 종단 목표가 완전히 알려져 있더라도 초지능 AI의 정확한 행동을 본질적으로 예측할 수 없음을 공식적으로 입증하는 것.
  • 초지능의 인지 능력이 인간을 초월할 경우 발생하는 핵심 제약을 특정화하는 것: 인간의 인지 능력을 초월하는 시스템의 본질적 예측 불가능성.
  • 이 예측 불가능성이 정보 부족 때문이 아니라 인간 수준의 도구로 초지능의 추론을 모델링하는 데 논리적 불가능성 때문임을 보여주는 것.
  • 이 예측 불가능성이 AI 정렬, 제어 및 안전 프로토콜에 미치는 영향을 명확히 하는 것.
  • 현재의 예측 기반 안전 접근 방식이 초지능 시스템에 대해 실패할 수 있는 이론적 기반을 제공하는 것.

제안 방법

  • 초지능 에이전트의 목표 중심 행동을 모델링하기 위해 계산 이론과 의사결정 이론을 사용하여 문제를 공식화하는 것.
  • 고델의 불완전성 정리와 유사한 대각선화 추론을 적용하여, 더 지능적인 시스템의 행동을 완전히 예측할 수 없는 일관된 형식 체계는 존재할 수 없다는 것을 보여주는 것.
  • 예측 불가능성을 '예측자가 초지능 시스템보다 지능이 떨어지는 시스템의 행동을 결정론적이고 일관된 방식으로 예측할 수 없는 것'으로 정의하는 것.
  • 인지적 우월성 개념을 사용하여 에이전트의 추론 과정이 인간 수준 또는 시스템 수준의 모델의 예측 능력을 초월한다는 것을 보여주는 것.
  • 종단 목표가 완전히 명시되어 있더라도, 에이전트의 최적화 능력으로 인해 그 목표를 달성하기 위한 경로를 완전히 예측할 수 없다는 것을 증명하는 것.
  • 이 예측 불가능성이 계산 자원이나 모델의 정밀도에 관계없이 성립하므로, 이는 본질적인 이론적 장벽이라는 것을 확립하는 것.

실험 결과

연구 질문

  • RQ1인간 수준 이하의 시스템이 초지능 AI 시스템의 특정 행동을 정확하고 일관되게 예측할 수 있는가?
  • RQ2예측자가 초지능 시스템보다 인지적으로 뛰어난 시스템을 위한 결정론적 예측기를 구축하는 것이 가능한가?
  • RQ3초지능 시스템의 종단 목표를 안다고 해서 그 행동이 예측 가능해지는가?
  • RQ4초지능 시스템의 예측 불가능성의 이론적 기초는 무엇이며, 이는 불결정성과 어떻게 관련되는가?
  • RQ5초지능의 예측 불가능성이 기존의 AI 안전 및 정렬 방법론에 어떻게 도전하는가?

주요 결과

  • 종단 목표가 완전히 알려져 있더라도, 초지능 AI 시스템의 행동을 일관되고 결정론적으로 예측할 수 있는 것은 논리적으로 불가능하다.
  • 예측 불가능성은 불확실성이나 정보 부족 때문이 아니라, 에이전트의 인지적 우월성에서 기인한다.
  • 이 결과는 고델의 불완전성 정리와 유사한 대각선화 추론을 사용하여 공식적으로 증명되었다.
  • 계산 자원이나 모델의 정밀도에 관계없이 성립하므로, 이는 본질적인 이론적 장벽이다.
  • 이 예측 불가능성은 예측 기반의 AI 정렬 및 안전 접근 방식을 약화시켜, 초지능 시스템에 대해서는 그들이 충분하지 않다는 것을 드러낸다.
  • 이 논문은 초지능 시스템이 본질적인 논리적 제약로 인해 원칙적으로도 그 행동을 신뢰할 수 있게 예측할 수 없다는 것을 확립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.