Skip to main content
QUICK REVIEW

[논문 리뷰] Real-time tree search with pessimistic scenarios

Takayuki Osogami, Toshihiro Takahashi|arXiv (Cornell University)|2019. 02. 28.
Robotic Path Planning Algorithms참고 문헌 36인용 수 11
한 줄 요약

이 논문은 시간 제약 조건이 엄격한 환경에서 장기 계획을 가능하게 하기 위해 특정 탐색 깊이를 초과하는 결정론적이고 낙관적인 시나리오를 사용하는 실시간 트리 탐색 방법을 제안한다. 낙관적인 미래에서의 분기 구조를 제거함으로써, 먼 미래의 중요한 사건을 고려한 행동 평가를 효율적으로 수행할 수 있다. 최적화된 자기대전(self-play)을 통해 NeurIPS 2018 Pommerman 경쟁에서 1등과 3등을 차지하였으며, 기준 기반 에이전트와의 대결에서 99.7%의 승률을 기록하였다.

ABSTRACT

Autonomous agents need to make decisions in a sequential manner, under partially observable environment, and in consideration of how other agents behave. In critical situations, such decisions need to be made in real time for example to avoid collisions and recover to safe conditions. We propose a technique of tree search where a deterministic and pessimistic scenario is used after a specified depth. Because there is no branching with the deterministic scenario, the proposed technique allows us to take into account the events that can occur far ahead in the future. The effectiveness of the proposed technique is demonstrated in Pommerman, a multi-agent environment used in a NeurIPS 2018 competition, where the agents that implement the proposed technique have won the first and third places.

연구 동기 및 목표

  • 엄격한 시간 제약 조건이 존재하는 부분 관측 다중 에이전트 환경에서 실시간 순차적 의사결정 문제를 해결하기 위해.
  • 큰 분기 계수와 제한된 계산 시간에도 불구하고 효과적인 장기 계획을 가능하게 하기 위해.
  • 탐색 깊이를 초월하는 결정론적 낙관적 미래를 시뮬레이션하여 안전이 중요한 상황에서의 의사결정 품질을 향상시키기 위해.
  • 자기대전을 통해 낙관 수준을 최적화하여 경쟁적 다중 에이전트 환경에서 성능과 내구성을 균형 잡히게 하기 위해.

제안 방법

  • 해당 방법은 지정된 깊이까지 트리 탐색을 수행한 후, 다수의 불리한 행동이 동시에 발생할 것이라는 가정을 하는 결정론적 낙관적 시나리오 하에서 리프 노드를 평가한다.
  • 낙관적 시나리오는 현실적이지 않지만, 폭탄 폭발 및 상대의 공격과 같은 중요한 미래 사건을 포괄하도록 설계되어 있으며, 다수의 에이전트가 비결정론적이지만 결정론적인 순서로 행동할 수 있도록 허용한다.
  • 이 방법은 시나리오를 결정론적으로 취급함으로써 탐색 깊이를 초월한 분기 구조를 피함으로써, 실시간 제약 조건 내에서 장기적 결과를 더 깊이 탐색할 수 있도록 한다.
  • 낙관 수준은 자기대전을 통해 조정되며, 다양한 낙관 수준에서 에이전트의 성능을 평가하여 최적의 설정을 식별한다.
  • 이 방법은 최적화된 낙관 수준을 사용하는 두 개의 Pommerman 에이전트—HakozakiJunctions와 dypm-final—에 적용되었다.

실험 결과

연구 질문

  • RQ1결정론적 낙관적 시나리오가 엄격한 시간 제약 조건 하에서 실시간 트리 탐색에서 효과적인 장기 계획을 가능하게 할 수 있는가?
  • RQ2부분 관측과 동시에 행동이 가능한 다중 에이전트 환경에서 낙관 수준은 성능에 어떤 영향을 미치는가?
  • RQ3계산 시간이 매우 제한된 상황에서 낙관적 시나리오가 확률적 샘플링보다 우수한 성능을 낼 수 있는가?
  • RQ4자기대전은 경쟁적 환경에서 전체 성능을 극대화하기 위해 낙관 수준을 조정하는 데 효과적인 방법인가?

주요 결과

  • 낙관 수준이 3인 dypm 에이전트는 기준 기반 에이전트(SimpleAgent)와의 대결에서 99.7%의 승률을 기록하여 1,000판 중 997판에서 승리하였다.
  • 낙관 수준을 0에서 3으로 증가시킴으로써 SimpleAgent에 대한 승률은 92.6%에서 99.7%로 상승하여 뚜렷한 성능 향상을 보였다.
  • 더 강력한 기준 기반 에이전트(dypm, 낙관 수준 0)와의 대결에서 낙관 수준 3을 사용할 경우 승률은 36.9%에서 77.8%로 상승하여 강력한 상대에게도 효과적임을 입증하였다.
  • 낙관 수준을 3를 초과해 더 높이면 손실은 줄어들지만 비기 수가 증가하여 수익 감소 현상이 나타나며, 이는 초모수 조정이 신중히 이루어져야 함을 시사한다.
  • 성능는 선택된 낙관 수준에 매우 민감하게 반응하여, 최적의 결과를 얻기 위해 자기대전을 통한 최적화가 필수적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.