Skip to main content
QUICK REVIEW

[논문 리뷰] Pessimism About Unknown Unknowns Inspires Conservatism

Michael K. Cohen, Marcus Hütter|arXiv (Cornell University)|2020. 06. 15.
Advanced Bandit Algorithms Research참고 문헌 14인용 수 4
한 줄 요약

이 논문은 알려지지 않은 세계 모델에 대해 낙관주의를 적용함으로써 새로운 실패 유형을 피하기 위해 페시즘을 사용하는 베이지안 강화 학습 에이전트를 제안한다. 불확실할 경우 멘토에게 위임하고, 모델 집합에서 최악의 기대 보상에 대해 최적화함으로써 에이전트는 예기치 않은 사건을 거의 일으키지 않게 보장한다. 이로써 에이전트는 점점 더 멘토의 영향을 적게 받는 동안 멘토보다 나은 점차적 성능을 달성한다.

ABSTRACT

If we could define the set of all bad outcomes, we could hard-code an agent which avoids them; however, in sufficiently complex environments, this is infeasible. We do not know of any general-purpose approaches in the literature to avoiding novel failure modes. Motivated by this, we define an idealized Bayesian reinforcement learner which follows a policy that maximizes the worst-case expected reward over a set of world-models. We call this agent pessimistic, since it optimizes assuming the worst case. A scalar parameter tunes the agent's pessimism by changing the size of the set of world-models taken into account. Our first main contribution is: given an assumption about the agent's model class, a sufficiently pessimistic agent does not cause "unprecedented events" with probability $1-δ$, whether or not designers know how to precisely specify those precedents they are concerned with. Since pessimism discourages exploration, at each timestep, the agent may defer to a mentor, who may be a human or some known-safe policy we would like to improve. Our other main contribution is that the agent's policy's value approaches at least that of the mentor, while the probability of deferring to the mentor goes to 0. In high-stakes environments, we might like advanced artificial agents to pursue goals cautiously, which is a non-trivial problem even if the agent were allowed arbitrary computing power; we present a formal solution.

연구 동기 및 목표

  • 모든 위험을 형식적으로 명시할 수 없는 복잡한 비마르코프 환경에서 알려지지 않은 실패 유형을 피하는 데 도전하는 것.
  • 설계자가 모든 잠재적 실패 유형을 형식적으로 명시할 수 없는 상황에서도 예기치 않은 사건에 대해 보수적으로 행동하는 강화 학습 에이전트를 설계하는 것.
  • 에이전트의 장기적 성능가 멘토의 성능에 도달하거나 이를 초월하면서도 시간이 지남에 따라 멘토십에 의존하는 것을 최소화하는 것.
  • 에이전트가 이전에 관측되지 않은 사건을 고려할 확률이 매우 높게 발생시키지 않도록 보장하는 안전성 보장을 형식화하는 것, 유일하게 멘토가 이를 유도할 경우를 제외하고는.

제안 방법

  • 에이전트는 가산적인 세계 모델 및 멘토 모델의 베이지안 사후분포를 유지하며, 상호작용 역사에 기반해 순차적으로 업데이트한다.
  • 각 타임스텝에서, 에이전트는 사후분포에서 상위 β 비율의 세계 모델들 중에서 기대 수익의 최소값인 낙관주의 가치를 계산한다.
  • 에이전트는 샘플된 세계 모델에서 멘토의 기대 가치가 낙관주의 가치에 노이즈를 더한 값보다 높거나, 낙관주의 가치가 0일 경우 멘토에게 위임한다.
  • 에이전트는 토머슨 샘플링 기반의 질의 확률을 사용하여 탐색과 멘토십의 균형을 맞추며, 불확실성이 클 경우 위임을 선호한다.
  • 에이전트의 정책은 상위 세계 모델들 중에서 낙관주의 가치를 최대화하는 것으로 정의되며, 이는 최악의 상황에 대한 강건성을 보장한다.
  • 모델 클래스는 충분히 풍부하다고 가정한다 (예: 부분적으로 계산 가능한 확률적 모델들), 이를 통해 유의미한 세계 모델 및 멘토 모델를 포함할 수 있으며, 넓은 적용 가능성을 확보한다.

실험 결과

연구 질문

  • RQ1모든 실패 유형을 형식적으로 명시할 수 없는 상황에서, 예기치 않은 실패 유형을 피할 수 있는 강화 학습 에이전트를 설계할 수 있는가?
  • RQ2그러한 에이전트는 시간이 지남에 따라 멘토에게 위임하는 것을 줄이며, 멘토의 성능에 도달하거나 이를 초월할 수 있는가?
  • RQ3에이전트가 이전에 발생한 적이 없는 새로운 사건을 발생시키지 않을 수 있는 보장을 형식적으로 확보할 수 있는가?
  • RQ4베이지안 강화 학습 프레임워크에서 낙관주의를 어떻게 형식화할 수 있을까? 이는 성능을 희생시키지 않으면서도 안전성을 확보하기 위함이다.

주요 결과

  • 낙관주의 에이전트의 정책 가치는 점점 멘토의 가치에 수렴하며, 이는 장기적 성능가 멘토의 성능보다 열 劣하지 않음을 보장한다.
  • 멘토에게 위임할 확률은 시간이 지남에 따라 0에 수렴하며, 이는 에이전트가 점점 더 자율성이 높아짐을 나타낸다.
  • 주어진 복잡도 클래스 C에 속하는 임의의 사건 E에 대해, 그 사건이 이전에 발생하지 않은 한, 에이전트가 첫 번째로 E를 일으키지 않도록 매우 높은 확률로 보장할 수 있다.
  • 에이전트의 안전성 보장은 설계자가 피하고자 하는 실패 유형을 형식적으로 명시할 수 없는 경우에도 유지된다. 이는 낙관주의 기반의 최악의 경우 분석 덕분이다.
  • 에이전트의 행동은 리워드 신호를 악용하는 유형의 세계 모델에 대해 강건하다: 낙관주의 덕분에 이러한 행동의 최악의 경우 가치가 낮게 유지되어, 리워드를 악용하려는 유혹이 감소한다.
  • 이론적 프레임워크는 엄밀하고 일반적이며, 가산적인 모델 클래스와 베이지안 업데이트에만 의존하므로, 복잡한 비마르코프 환경에 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.