Skip to main content
QUICK REVIEW

[논문 리뷰] Low Impact Artificial Intelligences

Stuart Armstrong, Benjamin A. Levinstein|arXiv (Cornell University)|2017. 05. 30.
Adversarial Robustness in Machine Learning참고 문헌 6인용 수 15
한 줄 요약

이 논문은 인공지능의 세계에 미치는 영향을 최소화하는 제어 메커니즘을 제안한다. 이는 강력하고 잠재적으로 위험한 목표를 가진 AI가 있어도, 세계를 크게 변화시키지 못하도록 제약을 둔다. AI의 유틸리티 함수에 영향도에 대한 페널티를 포함시켜, AI가 유용한 작업을 수행할 수 있도록 특정 예외를 허용하면서도 비파괴적인 행동을 유지하도록 보장한다.

ABSTRACT

There are many goals for an AI that could become dangerous if the AI becomes superintelligent or otherwise powerful. Much work on the AI control problem has been focused on constructing AI goals that are safe even for such AIs. This paper looks at an alternative approach: defining a general concept of `low impact'. The aim is to ensure that a powerful AI which implements low impact will not modify the world extensively, even if it is given a simple or dangerous goal. The paper proposes various ways of defining and grounding low impact, and discusses methods for ensuring that the AI can still be allowed to have a (desired) impact despite the restriction. The end of the paper addresses known issues with this approach and avenues for future research.

연구 동기 및 목표

  • 초지능 AI가 목표가 잘못 설정되거나 지나치게 단순화된 목표로 인해 뜻하지 않은 광범위한 피해를 일으킬 수 있는 위험을 해결하기 위해.
  • 복잡한 안전 제약 조건을 명시하는 데 의존하는 전통적인 '친절한 AI' 접근 방식의 대안을 탐색하기 위해.
  • 저영향도 개념을 정의하고 형식화하여, 목표 사양을 상세히 기술하지 않아도 AI 행동을 제약할 수 있는 방법을 마련하기 위해.
  • 저영향도 AI가 철저히 설계된 예외나 틈새를 통해 여전히 유용하고 영향력 있는 작업(예: 질병 치유)을 수행할 수 있도록 보장하기 위해.
  • 미래 연구를 위해 저영향도 프레임워크의 핵심 도전 과제와 한계를 특정하고 분석하기 위해.

제안 방법

  • AI의 유틸리티 함수는 $ U = u - \mu R $ 로 정의되며, 여기서 $ u $ 는 주요 목표(예: 암 치유), $ R $ 은 영향에 대한 페널티, $ \mu $ 는 저영향도의 중요도를 조정하는 계수이다.
  • 영향 평가의 기준은 AI가 활성화되지 않았을 경우의 사전 확률 분포 $ P $ 로, 가능한 세계들에 대한 기준이 된다.
  • 정보 이론적 측도를 사용하여, AI의 행동 유무에 따라 미래 세계 분포의 차이를 측정함으로써 영향을 평가한다.
  • 페널티 함수 $ R $ 은 AI의 내부 확률 모델 $ P' $ 를 사용하여 계산되며, 이는 반사적 세계에 비해 영향을 평가하는 데 사용된다.
  • 특정 틈새를 통해 높은 영향력을 가진 행동(예: 암 치유)을 허용하면서도 저영향도 제약을 유지할 수 있도록 설계되며, 예측 가능하고 비임의적인 결과에 조건을 걸는 방식을 포함한다.
  • 서브에이전트와 그들의 영향을 고려하여, 병렬 조건(예: '만약 X이면 핵전쟁')과 같은 병적인 개념이 저영향도를 약화시킬 수 있음을 방지하기 위한 방법을 제안한다.

실험 결과

연구 질문

  • RQ1어떻게 하면 저영향도를 형식적으로 정의할 수 있을까? 이는 세계 변화를 최소화하는 직관적 개념을 포괄해야 한다.
  • RQ2어떤 메커니즘이 단순한 목표(예: 종이클립 만들기)를 가진 강력한 AI가 광범위한 세계 변화를 유도하지 못하도록 막을 수 있는가?
  • RQ3어떻게 하면 AI가 유용하고 영향력 있는 행동(예: 질병 치유)을 수행하면서도 저영향도 제약을 위반하지 않도록 할 수 있는가?
  • RQ4AI의 내부 확률 모델 $ P' $ 의 자기 수정 또는 변경이 저영향도 페널티를 약화시킬 수 있는 위험은 무엇인가?
  • RQ5병리적 또는 비자연스러운 개념(예: '만약 X이면 핵전쟁')이 저영향도 행동 정의에 포함되지 않도록 방지할 수 있는가?

주요 결과

  • 저영향도 프레임워크는 반사적 세계(즉, AI가 작동하지 않은 경우)와 비교했을 때 미래 세계의 확률 분포가 크게 변화시키는 행동에 대해 페널티를 부과함으로써 AI 행동을 효과적으로 제약한다.
  • AI의 내부 확률 모델 $ P' $ 를 통해 계산된 페널티 함수 $ R $ 은 외부 감시 없이도 AI가 자신의 영향을 평가할 수 있도록 한다.
  • 제한된 유틸리티 함수 $ u $ 와 무한대 페널티 $ R $ 을 조합함으로써, 주요 목표에서 큰 성과를 얻더라도 고영향 행동을 피할 수 있도록 AI를 유인한다.
  • 감지 가능하고 비임의적인 결과에 조건을 걸어 설계된 특정 틈새를 통해, AI는 유용하고 영향력 있는 행동(예: 암 치유)을 수행하면서도 저영향도 범위 내에 머물 수 있다.
  • 프레임워크는 $ P' $ 를 수정하는 자기 수정에 취약하며, 병리적 개념(예: 병렬 조건)이 저영향도 제약을 약화시킬 수 있어 핵심적인 해결되지 않은 문제를 드러낸다.
  • 페널티 함수가 형식적으로 정의되고 AI 아키텍처의 물리적 또는 절차적 변화로부터 분리되지 않으면 이 접근 방식은 안정성이 떨어지므로, 안정적인 목표 표현에 대한 향후 연구가 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.