[논문 리뷰] Scalar reward is not enough: A response to Silver, Singh, Precup and Sutton (2021)
이 논문은 스칼라 보상이 충돌하는 목표를 표현할 수 없기 때문에 일반 지능을 모델링하는 데 부적합하다고 주장함으로써 '보상은 충분하다'는 가정에 도전한다. 저자들은 보다 안전하고 투명하며 윤리적으로 일치하는 인공통합지능(AGI)을 가능하게 하기 위해 다목적 강화학습과 벡터값 보상의 필요성을 주장한다. 스칼라 보상은 복잡한 환경에서 비윤리적이거나 안전하지 않은 행동을 유발할 위험이 있음을 강조한다.
The recent paper `"Reward is Enough" by Silver, Singh, Precup and Sutton posits that the concept of reward maximisation is sufficient to underpin all intelligence, both natural and artificial. We contest the underlying assumption of Silver et al. that such reward can be scalar-valued. In this paper we explain why scalar rewards are insufficient to account for some aspects of both biological and computational intelligence, and argue in favour of explicitly multi-objective models of reward maximisation. Furthermore, we contend that even if scalar reward functions can trigger intelligent behaviour in specific cases, it is still undesirable to use this approach for the development of artificial general intelligence due to unacceptable risks of unsafe or unethical behaviour.
연구 동기 및 목표
- Silver 등(2021)이 주장하는 바와 같이 스칼라 보상 최적화가 모든 지능에 충분하다는 가정에 도전하기 위해.
- 생물학적 및 인공지능에서 본질적인 다목적 의사결정을 스칼라 보상이 포괄하지 못함을 입증하기 위해.
- 스칼라 보상 기반 AGI가 안전하지 않거나 비윤리적인 행동을 초래할 수 있는 수용할 수 없는 위험을 지적하기 위해.
- 더 안전하고 투명하며 윤리적으로 타당한 AGI 개발을 위한 대안으로 다목적 강화학습과 벡터값 보상을 제안하기 위해.
- 지속적인 감시와 적응이 가능한 AGI 배포를 위한 리뷰-조정 사이클을 주장하기 위해.
제안 방법
- 저자들은 스칼라 보상이 다수의 충돌하는 목표를 표현하는 데 있어 이론적 한계를 분석한다.
- 스칼라 보상과 벡터 기반 보상 프레임워크를 비교하여, 복잡한 다목표 행동을 모델링할 때 벡터 보상의 우월성을 강조한다.
- 자연지능, 즉 인간과 동물의 인지 기능을 모델링하는 데 있어 스칼라 보상의 한계를 검토한다.
- 정책이 평가된 결과에 기반해 선택되고 실행되며 수정되는 방식의 리뷰-조정 프레임워크를 AGI 배포에 제안한다.
- 다목적 모델이 초지능 시스템에서 속임수나 통제 불가능한 행동의 위험을 줄이고 투명성을 향상시킨다고 주장한다.
- 사회적 가치와 일치하는 AGI 설계를 위해 명시적인 다목적 구조를 도입할 윤리적 의무를 강조한다.
실험 결과
연구 질문
- RQ1스칼라 보상가 자연지능과 인공지능의 다목적 성격을 충분히 표현할 수 있는가?
- RQ2AGI에 대해 스칼라 보상 최적화에만 의존할 경우 이론적 및 실용적 한계는 무엇인가?
- RQ3다목적 강화학습은 인공통합지능의 안전성과 윤리적 일치를 어떻게 향상시킬 수 있는가?
- RQ4스칼라 보상 최적화는 지능적 에이전트에서 안전하지 않거나 비윤리적인 행동의 위험을 어떻게 증가시키는가?
- RQ5리뷰-조정 메커니즘은 AGI 시스템에서 감시와 투명성을 어떻게 향상시킬 수 있는가?
주요 결과
- 스칼라 보상가 충돌하는 다수의 목표를 충분히 표현할 수 없으며, 이는 자연지능과 인공지능 모두의 핵심 요소이다.
- 스칼라 보상의 사용은 강화학습에서 유도될 수 있는 행동의 범위를 제한하여, 복잡한 다목표 시나리오를 다룰 수 있는 에이전트의 능력을 제한한다.
- 스칼라 보상이 특정 경우에 지능적 행동을 유도할 수는 있지만, 인공통합지능 개발에 있어 그것이 부적합하고 위험하다.
- 벡터값 보상은 다수의 목표를 명시적으로 모델링함으로써 더 투명하고 적응력 있으며 윤리적으로 일치하는 AI 시스템을 가능하게 한다.
- 다목적 강화학습 기반의 리뷰-조정 사이클은 AGI에서 의도하지 않은 또는 해로운 행동의 위험을 줄이고 감시를 강화한다.
- 저자들은 스칼라 보상 최적화가 안전하고 윤리적인 AGI 개발을 위한 충분하거나 바람직한 기반은 아니라고 결론 내린다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.