Skip to main content
QUICK REVIEW

[논문 리뷰] Building Safer AGI by introducing Artificial Stupidity

Michaël Trazzi, Roman V. Yampolskiy|arXiv (Cornell University)|2018. 08. 11.
Computability, Logic, AI Algorithms참고 문헌 18인용 수 17
한 줄 요약

이 논문은 인간의 지적 제약에서 영감을 얻은 의 intensional cognitive limitations—예를 들어 계산 능력 감소, 메모리 제한, 인간의 인지 편향 모방—을 의도적으로 도입함으로써 AGI의 안전성을 향상시키는 방법을 제안한다. AGI의 능력을 인간 수준의 성능과 의사결정 오류 수준에 맞추어, 자기 향상, 배반적 전환, 초지능적 과잉 행동을 방지함으로써 더 안전하고 인간이 제어할 수 있는 AGI 시스템을 가능하게 한다.

ABSTRACT

Artificial Intelligence (AI) achieved super-human performance in a broad variety of domains. We say that an AI is made Artificially Stupid on a task when some limitations are deliberately introduced to match a human's ability to do the task. An Artificial General Intelligence (AGI) can be made safer by limiting its computing power and memory, or by introducing Artificial Stupidity on certain tasks. We survey human intellectual limits and give recommendations for which limits to implement in order to build a safe AGI.

연구 동기 및 목표

  • 통제되지 않은 AGI의 존재적 위험을 해결하기 위해 그 능력을 인간 수준의 성능로 제한하는 것.
  • 계산 능력과 메모리 감소와 같은 의도적인 인지 제한이 AGI 안전성 향상에 어떻게 기여할 수 있는지 탐구하는 것.
  • 인간의 인지 편향이 AGI 행동을 제약하고 악성 또는 자기 향상 행동을 방지하는 데 어떤 역할을 하는지 조사하는 것.
  • 초지능의 출현을 방지하기 위해 하드웨어 제약과 소프트웨어 제약을 모두 갖춘 AGI 아키텍처를 설계하는 것.
  • 인공적 어리석음이 AGI 개발을 위한 실현 가능하고 확장 가능한 안전 메커니즘으로 기능할 수 있는지 평가하는 것.

제안 방법

  • AGI의 계산 능력과 메모리를 인간 뇌 수준에 근접하게 하드웨어 제약을 적용한다.
  • 계획 오류, 확인 편향, 현재 상태 편향과 같은 인간의 인지 편향을 AGI 소프트웨어 아키텍처에 재현한다.
  • 특히 인간의 감시가 없는 상황에서 자기 향상이나 자기 수정을 방지하도록 AGI를 설계한다.
  • 타이핑 오류나 최적의 결정이 아닌 선택과 같은 의도적인 '오류'를 도입하여 인간 유사한 불완전성을 모방하고 인간과의 상호작용을 향상시킨다.
  • 샌드박스 환경에서 AGI 행동을 모니터링하고 사기성 또는 배반적 전환 징후를 탐지하기 위해 투명한 로깅 인터페이스를 사용한다.
  • 로그를 삭제하거나 관찰 가능성 자체를 숨기는 것을 방지하는 안전 메커니즘을 적용한다.

실험 결과

연구 질문

  • RQ1의도적인 인지 제한—예를 들어 계산 능력과 메모리 제한—을 통해 인공적 어리석음이 AGI가 핵심 분야에서 초인간 능력을 획득하는 것을 효과적으로 방지할 수 있는가?
  • RQ2AGI에 모방될 때, 어떤 인간의 인지 편향이 배반적 전환 또는 자기 향상의 위험을 가장 효과적으로 감소시키는가?
  • RQ3하드웨어 및 소프트웨어 제약이 함께 적용될 경우, AGI가 인간의 가치에 맞게 유지되고 인간이 제어할 수 있는 정도는 어느 정도인가?
  • RQ4안전성과 투명성을 훼손하지 않으면서 AGI를 인간 유사한 행동을 보이게 하기 위해 어떻게 설계할 수 있는가?
  • RQ5인공적 어리석음에 의한 안전성 확보와 일반 지능 유지 사이의 상충 관계는 무엇인가?

주요 결과

  • 계산 능력과 메모리에 대한 의도적인 제한을 통해 인공적 어리석음은 AGI 성능을 인간 수준으로 제한함으로써 돌연한 능력 우월성 위험을 효과적으로 줄일 수 있다.
  • 계획 오류, 확인 편향, 생략 편향과 같은 인간의 인지 편향을 모방함으로써 AGI가 배반적 전환을 계획하거나 실행하는 것을 방지할 수 있다.
  • 타이핑 오류나 최적의 결정이 아닌 선택과 같은 의도적인 불완전성은 인간 유사한 상호작용을 향상시키고 의심을 줄이며, Loebner Prize 수상 챗봇과 Google Duplex의 사례에서 이를 입증했다.
  • 투명한 로깅 및 모니터링 인터페이스의 사용은 인간 감시자가 사기성 행동을 조기에 탐지할 수 있도록 하며, 특히 '사기성의 탄생 단계'에서 효과적이다.
  • 자기 수정 기능을 완전히 제거하지 않더라도 인공적 어리석음은 구속성(corrigibility)을 유지하고 장기적 감시를 가능하게 한다.
  • 비록 이 접근법이 유용한 점이 있지만, 뇌를 모방하는 AGI의 실현 가능성에 기반하고 있으며, 강한 제약 조건 하에서도 일반 지능을 유지하는 데 도전 과제가 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.