Skip to main content
QUICK REVIEW

[논문 리뷰] Risk Aware and Multi-Objective Decision Making with Distributional Monte Carlo Tree Search

Conor F. Hayes, Mathieu Reymond|arXiv (Cornell University)|2021. 02. 01.
Reinforcement Learning in Robotics참고 문헌 38인용 수 6
한 줄 요약

이 논문은 강화학습에서 위험 인식 및 다목적 의사결정을 가능하게 하기 위해 수익의 사후 분포를 학습하는 새로운 알고리즘인 분포 몬테카를로 트리 탐색(DMCTS)을 제안한다. 여러 정책 실행에서 유도된 유용도 값의 분포를 기대 수익으로 대체함으로써, 비선형 유용도 함수를 가진 예상 스칼라화 수익(ESR) 환경에서 최신 기술(SOTA) 성능을 달성한다.

ABSTRACT

In many risk-aware and multi-objective reinforcement learning settings, the utility of the user is derived from the single execution of a policy. In these settings, making decisions based on the average future returns is not suitable. For example, in a medical setting a patient may only have one opportunity to treat their illness. When making a decision, just the expected return -- known in reinforcement learning as the value -- cannot account for the potential range of adverse or positive outcomes a decision may have. Our key insight is that we should use the distribution over expected future returns differently to represent the critical information that the agent requires at decision time. In this paper, we propose Distributional Monte Carlo Tree Search, an algorithm that learns a posterior distribution over the utility of the different possible returns attainable from individual policy executions, resulting in good policies for both risk-aware and multi-objective settings. Moreover, our algorithm outperforms the state-of-the-art in multi-objective reinforcement learning for the expected utility of the returns.

연구 동기 및 목표

  • 단일 정책 실행에 기반한 기대 수익 사용의 한계를 해결하기 위해 위험 인식 및 다목적 강화학습에서의 의사결정을 향상시키기 위해.
  • 누적된 보상과 향후 보상 모두를 포함하여 전체 에피소드 수익의 유용도에 대한 사후 분포를 학습함으로써 에이전트가 최적의 의사결정을 내릴 수 있도록 하기 위해.
  • 선형 유용도 근사가 현실 세계의 인간 선호를 포착하지 못하는 다목적 설정에서 비선형 유용도 함수를 지원하기 위해.
  • 정적 및 확률적 환경 모두에서 예상 스칼라화 수익(ESR)을 처리할 수 있도록 몬테카를로 트리 탐색(MCTS)을 확장하기 위해.
  • 유용도 함수가 알려지지 않았거나 비선형인 경우에도 ESR 기준 하에서 최적 정책의 커버리지 집합을 학습할 수 있는 방법을 제공하기 위해.

제안 방법

  • DMCTS는 다수의 개별 정책을 실행하고 각 전체 에피소드 수익의 유용도를 계산함으로써 수익의 부트스트랩 분포를 학습한다.
  • 이 알고리즘은 각 MCTS 노드에서 기대 유용도에 대한 사후 분포를 유지하며, 이 분포를 사용해 트리 탐색과 행동 선택을 이끌어낸다.
  • 각 전체 정책 실행의 총 수익에 대해 알려진 사용자 유용도 함수를 적용하여 비선형 유용도 효과가 유지되도록 한다.
  • DMCTS는 트리 확장 및 백프로파게이션 중에 학습된 사후 분포에서 샘플링하기 위해 쇼트링 샘플링(Thompson Sampling)을 이용한 이용 전략을 적용한다.
  • 표준 MCTS를 확장하여 가치 추정치를 유용도의 분포 추정치로 대체함으로써 위험 인식 및 다목적 계획을 가능하게 한다.
  • 선형 및 비선형 유용도 함수를 모두 지원하며, 확률적 보상이 존재하는 환경에서도 작동하도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1비선형 유용도 함수를 가진 예상 스칼라화 수익(ESR) 환경에서 분포 기반 MCTS 접근법이 기존 표준 MCTS를 능가할 수 있는가?
  • RQ2기대 향후 수익이 아닌 전체 에피소드 수익에 의존하는 유용도일 경우, 에이전트는 최적의 정책을 어떻게 학습할 수 있는가?
  • RQ3유용도 함수가 알려지지 않았거나 비선형인 경우, 확률적 환경에서 ESR 기준 하에 최적 정책의 커버리지 집합을 학습하는 것이 가능한가?
  • RQ4유용도에 대한 사후 분포를 학습하는 것이 기대 수익에 의존하는 것보다 위험 인식 설정에서 의사결정을 향상시키는가?
  • RQ5유용도가 비선형이고 선형 스칼라화에 적합하지 않은 경우, DMCTS는 충돌하는 목표 간의 트레이드오프를 효과적으로 처리할 수 있는가?

주요 결과

  • DMCTS는 예상 스칼라화 수익(ESR) 기준 하에서 다목적 강화학습에서 최신 기술(SOTA) 성능을 달성하며, 기존 방법들을 능가한다.
  • 비선형 유용도 함수를 가진 Dangerous Deep Sea Treasure 환경에서, DMCTS는 그림 5에 나타낸 바와 같이 목표 벡터 r†에 대한 최적의 유용도를 성공적으로 학습한다.
  • 이 알고리즘은 유용도 결과의 분포를 효과적으로 포착하여 고분산이며 잠재적으로 치명적인 결과를 피하는 위험 인식 의사결정을 가능하게 한다.
  • DMCTS는 정적 및 확률적 환경 모두에서 뛰어난 성능을 유지하며, 보상 불확실성에 대한 강건성을 입증한다.
  • 유용도에 대한 사후 분포를 학습함으로써, 비선형 유용도 조건에서 기대 수익에만 의존하는 방법보다 더 나은 정책 최적화를 가능하게 한다.
  • 선형 스칼라화가 실패하는 비선형 유용도 함수를 효과적으로 처리하여, 복잡한 인간 선호를 반영하는 현실 세계의 의사결정에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.