Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Curiosity Search: Intra-Life Exploration Can Improve Performance on Challenging Deep Reinforcement Learning Problems

Christopher Stanton, Jeff Clune|arXiv (Cornell University)|2018. 06. 01.
Reinforcement Learning in Robotics참고 문헌 31인용 수 19
한 줄 요약

이 논문은 각 개별 에피소드 내에서 새로운 상태를 방문하는 것(내생애 혁신성)에 보상을 주는 방식으로 탐색을 향상시키는 새로운 딥 강화학습 알고리즘인 딥 커리오시티 서치(DeepCS)를 소개한다. 이는 이전 훈련 에피소드 전반에 걸친 혁신성에만 의존하는 것과는 다릅니다. DeepCS는 몬테주마의 레비아탄에서 최신 기술 수준의 성능을 달성하며, 시쿼트와 같은 여러 다른 아케이드 게임에서 성능을 크게 향상시켰고, A2C의 성능을 두 배로 끌어올리고 한 번의 실행에서 80,000점의 점수를 기록했습니다.

ABSTRACT

Traditional exploration methods in RL require agents to perform random actions to find rewards. But these approaches struggle on sparse-reward domains like Montezuma's Revenge where the probability that any random action sequence leads to reward is extremely low. Recent algorithms have performed well on such tasks by encouraging agents to visit new states or perform new actions in relation to all prior training episodes (which we call across-training novelty). But such algorithms do not consider whether an agent exhibits intra-life novelty: doing something new within the current episode, regardless of whether those behaviors have been performed in previous episodes. We hypothesize that across-training novelty might discourage agents from revisiting initially non-rewarding states that could become important stepping stones later in training. We introduce Deep Curiosity Search (DeepCS), which encourages intra-life exploration by rewarding agents for visiting as many different states as possible within each episode, and show that DeepCS matches the performance of current state-of-the-art methods on Montezuma's Revenge. We further show that DeepCS improves exploration on Amidar, Freeway, Gravitar, and Tutankham (many of which are hard exploration games). Surprisingly, DeepCS doubles A2C performance on Seaquest, a game we would not have expected to benefit from intra-life exploration because the arena is small and already easily navigated by naive exploration techniques. In one run, DeepCS achieves a maximum training score of 80,000 points on Seaquest, higher than any methods other than Ape-X. The strong performance of DeepCS on these sparse- and dense-reward tasks suggests that encouraging intra-life novelty is an interesting, new approach for improving performance in Deep RL and motivates further research into hybridizing across-training and intra-life exploration methods.

연구 동기 및 목표

  • 기존 탐색 방법이 훈련 전반에 걸친 혁신성에만 집중함으로써, 처음에는 보상이 없지만 나중에는 유용한 상태로의 재방문을 억제하는 문제를 해결하기 위함.
  • 한 에피소드 내에서 새로운 상태를 탐색하는 내생애 혁신성 유도가 어려운 딥 RL 환경에서 학습 효율성과 최종 성능을 향상시킬 수 있는지 조사하기 위함.
  • 내생애 탐색이 단지 희박 보상 게임에만 유용한 것이 아니라, 기계적 탐색이 이미 효과적인 밀도 높은 보상 게임에서도 유익한가를 평가하기 위함.
  • 기억 메커니즘으로서의 커리오시티 그레드 사용이 성능 향상에 기여하는지, 강력한 성능을 내기 위해 필수적인지 판단하기 위함.
  • 내생애 혁신성과 훈련 전반의 혁신성을 조합하여 딥 강화학습에서 더 나은 탐색을 달성할 잠재력 탐색하기 위함.

제안 방법

  • DeepCS는 현재 에피소드 내에서 방문한 고유한 상태 수를 측정하는 인트리닉 보상 기반의 커리오시티를 도입하여, 에이전트가 자신의 수명 동안 새로운 상태를 탐색하도록 유도합니다.
  • 이 인트리닉 보상은 현재 에피소드에서 만난 고유한 상태의 수에 따라 계산되며, 이전에 본 적 없는 상태를 방문할수록 더 높은 보상을 제공합니다.
  • 이 알고리즘은 표준 딥 강화학습 프레임워크(예: A2C 또는 PPO)에서 외재적 희박 보상 신호와 함께 정책 업데이트 과정에 이 인트리닉 커리오시티 신호를 통합합니다.
  • 에이전트 위치를 RAM 또는 학습된 임bedding에서 유도하여 상태 유일성 정의를 위한 메모리 메커니즘으로 커리오시티 그레드를 사용합니다.
  • 이 방법은 표준 딥 강화학습 훈련 프rotocol에 따라 아케이드 게임 57종의 세트에서 평가되었습니다.
  • 기본 방법인 A2C, A3C, DQN 및 최신 기술 수준의 인트리닉 커리오시티 방법인 허위 수(PCA) 및 PCn과의 비교가 수행되었습니다.

실험 결과

연구 질문

  • RQ1기존의 훈련 전반의 혁신성 방법과 비교해 볼 때, 한 에피소드 내에서 새로운 상태를 탐색하는 내생애 혁신성은 어려운 딥 강화학습 과제에서 성능 향상에 기여하는가?
  • RQ2기계적 탐색이 이미 효과적인 밀도 높은 보상 게임인 시쿼트에서 내생애 탐색이 유익한가?
  • RQ3DeepCS가 강력한 성능을 내기 위해 커리오시티 그레드가 반드시 필요한가, 아니면 과거 상태의 명시적 기억 없이도 성공할 수 있는가?
  • RQ4내생애 혁신성과 훈련 전반의 혁신성을 조합하면 더 나은 전체 탐색과 학습 효율성 달성 가능성이 있는가?
  • RQ5희박 보상 아케이드 게임에서 최신 기술 수준의 인트리닉 커리오시티 방법인 허위 수와 비교해 DeepCS는 어떻게 성능을 냈는가?

주요 결과

  • DeepCS는 몬테주마의 레비아탄에서 최신 기술 수준의 훈련 전반 혁신성 방법과 동등한 성능을 달성했으며, 중앙값 점수는 PCA 및 PCn과 유사했고, 한 번의 실행에서 6,600점까지 도달했습니다.
  • 시쿼트에서는 A2C 성능을 두 배로 끌어올려 한 번의 실행에서 최대 80,000점의 훈련 점수를 기록했으며, Ape-X를 제외한 모든 방법을 뛰어넘었습니다.
  • 아미다르, 프리웨이, 그래비타르, 투탄카움에서 DeepCS는 기계적 탐색과 기본 인트리닉 커리오시티 방법을 모두 뛰어넘는 성능 향상을 보였습니다.
  • 커리오시티 그레드는 성능 향상에 기여하지만 반드시 필요한 것은 아니며, DeepCS는 이를 사용하지 않아도 강력한 성능을 내어 메모리 설계에 대한 강건성을 보여주었습니다.
  • 알고리즘이 밀도 높은 보상 환경에서도 내생애 혁신성이 효과적이라는 점을 입증하여, 이러한 방법이 희박 보상 환경에서만 유효하다는 가정을 도전했습니다.
  • 결과적으로 내생애 혁신성과 훈련 전반의 혁신성을 조합하면 성능 향상이 더 클 수 있으며, 이는 탐색 과제의 서로 다른 측면을 다루기 때문입니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.