Skip to main content
QUICK REVIEW

[논문 리뷰] SPOTTER: Extending Symbolic Planning Operators through Targeted Reinforcement Learning

Vasanth Sarathy, Daniel Kasenberg|arXiv (Cornell University)|2020. 12. 23.
Artificial Intelligence in Games인용 수 4
한 줄 요약

SPOTTER는 기존의 기호적 계획 도구가 목표를 달성하는 데 부족할 경우 자동으로 새로운 기호적 연산자들을 발견하고 합성하기 위해 기호적 계획과 타겟팅된 강화학습을 통합하는 프레임워크이다. 목표에 도달할 수 있도록 도와주는 보조 목표 상태를 탐색함으로써, SPOTTER는 이러한 보조 목표 상태를 정복할 수 있는 정책을 학습시키기 위해 강화학습 에이전트를 훈련시키며, 이 정책은 기호적 도메인에 추가된다. 이로 인해 순수한 강화학습에 비해 더 높은 샘플 효율성과 이식 가능성을 달성할 수 있으며, 사전 지식이나 성공적인 계획 추적 데이터가 필요로 하지 않는다.

ABSTRACT

Symbolic planning models allow decision-making agents to sequence actions in arbitrary ways to achieve a variety of goals in dynamic domains. However, they are typically handcrafted and tend to require precise formulations that are not robust to human error. Reinforcement learning (RL) approaches do not require such models, and instead learn domain dynamics by exploring the environment and collecting rewards. However, RL approaches tend to require millions of episodes of experience and often learn policies that are not easily transferable to other tasks. In this paper, we address one aspect of the open problem of integrating these approaches: how can decision-making agents resolve discrepancies in their symbolic planning models while attempting to accomplish goals? We propose an integrated framework named SPOTTER that uses RL to augment and support ("spot") a planning agent by discovering new operators needed by the agent to accomplish goals that are initially unreachable for the agent. SPOTTER outperforms pure-RL approaches while also discovering transferable symbolic knowledge and does not require supervision, successful plan traces or any a priori knowledge about the missing planning operator.

연구 동기 및 목표

  • 부분적으로 명시된 도메인에서 기호적 계획 에이전트가 목표에 도달하지 못하는 이유로 인해 기존의 연산자가 부족하거나 잘못되었을 경우를 해결하기 위해.
  • 결함이 있는 기존의 기호적 연산자나 성공적인 계획 추적 데이터 없이도 새로운 기호적 연산자와 그에 대응하는 저수준 제어기들을 자동으로 발견할 수 있도록 하기 위해.
  • 기본적으로 기호적 계획을 위한 타겟팅된 탐색을 통해 기반이 되는 보조 목표 상태에 집중함으로써, 기호적 계획이 가능해지는 방식으로 강화학습의 샘플 효율성과 이식 가능성을 향상시키기 위해.
  • 작업 실행 중에 실시간으로 연산자 합성을 지원할 수 있도록 기호적 계획과 강화학습을 통합하는 방식을 개발하기 위해.
  • 에이전트가 예측하지 못한 상황에 대응하기 위해 동적으로 기호적 동작 모델을 확장할 수 있도록 하는 프레임워크를 개발하기 위해.

제안 방법

  • 에이전트는 현재의 도메인 모델을 사용하여 목표 향한 기호적 계획을 먼저 尝시도한다.
  • 계획이 발견되지 않으면, 온라인 탐색자가 무작위 탐색을 수행하여 기호적 계획이 가능해지는 상태에 도달한다.
  • 그러한 보조 목표 상태에 도달하면, 오프라인 강화학습 학습자들이 생성되어 해당 상태에 안정적으로 도달할 수 있는 정책을 학습한다.
  • 강화학습 학습자들은 탐색자로부터 수집한 궤적 데이터를 사용하여 정책을 훈련시키며, 정책이 높은 수익을 얻는 조건을 주기적으로 추론해낸다.
  • 유효한 전제 조건이 발견되면, 새로운 기호적 연산자가 그 전제 조건과 함께 계획 도메인에 합성되어 추가된다.
  • 이 과정은 반복된다: 새로운 연산자가 새로운 계획을 가능하게 하며, 목표에 도달하거나 더 이상 진전이 없을 때까지 이 주기를 반복한다.

실험 결과

연구 질문

  • RQ1기존의 도메인 모델이 목표에 도달하는 데 부족할 경우, 기호적 계획 에이전트는 어떻게 새로운 연산자를 자동으로 발견할 수 있는가?
  • RQ2성공적인 계획 추적 데이터나 누락된 연산자에 대한 사전 지식 없이도 강화학습을 사용하여 이식 가능한 기호적 연산자를 학습시킬 수 있는가?
  • RQ3기호적 계획이 가능해지도록 보조 목표 상태에 집중된 탐색을 어떻게 설계할 수 있으며, 샘플 효율성을 향상시킬 수 있는가?
  • RQ4합성된 연산자가 동일한 도메인 내 다양한 작업 간에 얼마나 널리 재사용될 수 있는가?
  • RQ5기호적 계획과 강화학습을 통합함으로써 순수한 강화학습보다 더 빠른 수렴 속도와 향상된 성능을 달성할 수 있는가?

주요 결과

  • SPOTTER는 도어 해제 및 물체 조작을 포함한 격자 퍼즐 환경에서 순수한 강화학습 기반 모델에 비해 누적 보상과 학습 속도 측면에서 뚜렷한 우수성을 보였다.
  • 프레임워크는 원래의 도메인 모델에 포함되지 않은 새로운 기호적 연산자—예를 들어 '공을 길에서 옮기기'—를 성공적으로 발견하여 이전에는 도달할 수 없었던 목표를 달성할 수 있도록 했다.
  • SPOTTER는 이식 가능한 기호적 지식을 학습한다: 합성된 연산자는 다양한 작업 간에 일반화되며, 새로운 계획 환경에서 재사용 가능하다.
  • 기본적으로 목표 달성과 관련된 구조적 요소를 갖춘 보조 목표 상태에 집중함으로써, 무작위 탐색을 피하는 방식으로 높은 샘플 효율성을 달성했다.
  • 성공적인 계획 추적 데이터나 누락된 연산자에 대한 사전 지식이 필요로 하지 않기 때문에, 부분적으로 알려진 환경에서 실생활에 적용하기에 강건하다.
  • 격자 퍼즐 환경에서의 평가 결과, SPOTTER는 기존의 기호적 계획 에이전트나 순수한 강화학습 에이전트가 처리할 수 없는 복잡한 퍼즐을 해결할 수 있도록 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.