Skip to main content
QUICK REVIEW

[논문 리뷰] Physically Embedded Planning Problems: New Challenges for Reinforcement Learning

Mehdi Mirza, Andrew Jaegle|arXiv (Cornell University)|2020. 09. 11.
Reinforcement Learning in Robotics참고 문헌 76인용 수 6
한 줄 요약

이 논문은 물리 엔진 내에서 고전적 보드 게임—솔로반, 십자포커, 고—을 시뮬레이션하여 신체적으로 통합된 계획 문제를 도입한다. 이는 에이전트가 추상적 수를 수행하기 위해 감각운동 제어를 수행하도록 요구한다. 추상적 버전에서는 뛰어난 성능를 보이지만, 표준 딥 강화학습 에이전트는 인지, 장기 계획, 운동 제어의 복합적 과제에 어려움을 겪으며, 현재의 강화학습 기법들이 추상적 계획과 신체적 제어를 연결하는 데 있어 심각한 격차를 드러내고 있다. 이 격차는 새로운 기법에 의해 해결되어야 한다.

ABSTRACT

Recent work in deep reinforcement learning (RL) has produced algorithms capable of mastering challenging games such as Go, chess, or shogi. In these works the RL agent directly observes the natural state of the game and controls that state directly with its actions. However, when humans play such games, they do not just reason about the moves but also interact with their physical environment. They understand the state of the game by looking at the physical board in front of them and modify it by manipulating pieces using touch and fine-grained motor control. Mastering complicated physical systems with abstract goals is a central challenge for artificial intelligence, but it remains out of reach for existing RL algorithms. To encourage progress towards this goal we introduce a set of physically embedded planning problems and make them publicly available. We embed challenging symbolic tasks (Sokoban, tic-tac-toe, and Go) in a physics engine to produce a set of tasks that require perception, reasoning, and motor control over long time horizons. Although existing RL algorithms can tackle the symbolic versions of these tasks, we find that they struggle to master even the simplest of their physically embedded counterparts. As a first step towards characterizing the space of solution to these tasks, we introduce a strong baseline that uses a pre-trained expert game player to provide hints in the abstract space to an RL agent's policy while training it on the full sensorimotor control task. The resulting agent solves many of the tasks, underlining the need for methods that bridge the gap between abstract planning and embodied control. See illustrating video at https://youtu.be/RwHiHlym_1k.

연구 동기 및 목표

  • 에이전트가 추상적 환경에서는 잘 성과를 내지만, 물리적으로 기반을 둔 장기 계획 과제에서는 실패하는 강화학습의 격차를 해결하기 위함.
  • 고수준의 기호적 추론과 저수준의 감각운동 제어를 결합한 벤치마크를 만들기 위함. 이는 실제 세계의 신체적 지능 과제를 시뮬레이션한다.
  • 기존의 딥 강화학습 알고리즘이 추상적 대안에서는 성공했음에도 불구하고, 고전적 계획 게임의 물리적 기반 버전에서는 실패함을 입증하기 위함.
  • 추상적 계획과 신체적 제어를 연결하는 방법을 개발하기 위한 테스트베드를 제공하기 위함. 오픈소스 시뮬레이션 환경을 사용한다.
  • 장기 계획 제어 과제에서 구조적 지식, 계층적 계획, 내재적 탐색을 통합하는 기법에 대한 연구를 촉진하기 위함.

제안 방법

  • 솔로반, 십자포커, 고와 같은 기호적 계획 과제를 물리 엔진에 통합하여, 9-자유도 로봇 암을 사용해 물리적 게임 피ece를 조작하도록 요구한다.
  • 에고세트릭 카메라 입력을 사용하는 시각 기반 관측 공간을 활용하여 실제 세계의 인지 제약을 시뮬레이션한다.
  • 정책 학습을 위해 표준 딥 Q 네트워크(DQN) 또는 액터-크리틱 아키텍처를 사용하며, 물리 시뮬레이션에서 시행착오 방식으로 훈련한다.
  • 사전에 훈련된 전문가 게임 플레이어를 사용해 훈련 중에 추상적 힌트(예: 최적의 수)를 제공하는 강력한 베이스라인을 도입한다. 이는 감각운동 공간에서 정책 학습을 안내한다.
  • 커리큘럼 학습을 적용하여 간단한 과제(십자포커)에서 시작해 점점 더 복잡한 과제(고)로 전환하며, 물리적 제어 요구 수준을 점차 높인다.
  • MuJoGo(7x7 고)에서 고정된 강도의 상대를 사용하여 학습 진전과 상대의 실력 간의 영향을 분리함으로써 샘플 효율성과 수렴성 평가가 가능하도록 한다.

실험 결과

연구 질문

  • RQ1표준 딥 강화학습 에이전트는 장기 계획 과제에서 정밀한 운동 제어가 요구되는 고나 솔로반과 같은 고전적 계획 게임의 물리적 기반 버전을 해결할 수 있는가?
  • RQ2사전에 훈련된 전문가 게임 플레이어를 통한 추상적 계획 지식 통합은 감각운동 제어 과제에서 샘플 효율성과 성능을 어떻게 향상시키는가?
  • RQ3종단 간 강화학습이 물리적으로 기반을 둔 장기 지속 계획 문제에서 겪는 주요 실패 원인은 무엇이며, 어떤 구조적 제약을 드러내는가?
  • RQ4진정한 게임 상태와 같은 특권 정보가 없는 상태에서, 이러한 환경에서의 학습은 추상적 버전 대비 얼마나 방해받는가?
  • RQ5추상적 과제와 물리적 기반 과제 간의 성능 격차를 줄이기 위해 어떤 새로운 방법론적 요소가 필요한가?

주요 결과

  • 표준 딥 강화학습 에이전트는 추상적 버전에서는 성공했음에도 불구하고, 십자포커와 고의 물리적 기반 버전에서 기본적인 게임 플레이는 학습하지 못한다.
  • MuJoGo(7x7 고)에서의 바닐라 DQN 에이전트는 수십억 번의 훈련 스텝 후에도 1000판당 1승 이하의 성과를 보이며, 극도로 열악한 샘플 효율성을 보인다.
  • 사전에 훈련된 전문가 게임 플레이어를 통합한 에이전트는 400만 판 후 약 60%의 승률을 기록하며, 추상적 지식이 학습에 도움이 되지만 단독으로는 부족함을 보여준다.
  • 작은 보드와 약한 상대를 사용하더라도 추상적 과제와 물리적 기반 과제 간의 성능 격차는 막대하며, 인지, 제어, 장기 계획 추론의 복합성에 기인한 근본적인 과제를 드러낸다.
  • 결과는 현재의 강화학습 알고리즘이 다중 척도 추론과 제어를 효과적으로 조율할 수 있는 메커니즘이 부족함을 시사하며, 계층적 계획과 구조적 지도를 통합하는 새로운 방법이 필요하다.
  • 오픈소스 환경은 현재의 벤치마크가 짧은 수순, 반응형 제어에 치우쳐 있으며, 실제 세계의 신체적 의사결정의 복잡성을 포괄하지 못함을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.