Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Novel Policies For Tasks

Yunbo Zhang, Wenhao Yu|arXiv (Cornell University)|2019. 05. 13.
Reinforcement Learning in Robotics인용 수 14
한 줄 요약

이 논문은 작업 보상과 신선도 보상 간의 균형을 통해 주어진 작업에 대해 다양한 고성능 정책을 발견하는 강화학습 방법인 작업-신선도 이등분자(TNB)를 제안한다. 기존에 학습된 정책들과의 행동적 이탈을 측정하기 위해 오토에인코더를 사용하며, TBN은 기울기 이등분 기법을 통해 작업 성능 향상과 정책 다양성 향상을 동시에 달성한다. 이는 미로 탐색, 로봇 제어, 속임수 작업 전반에서 무작위 재초기화 및 가중치 합 방법보다 뛰어난 성능을 보였다.

ABSTRACT

In this work, we present a reinforcement learning algorithm that can find a variety of policies (novel policies) for a task that is given by a task reward function. Our method does this by creating a second reward function that recognizes previously seen state sequences and rewards those by novelty, which is measured using autoencoders that have been trained on state sequences from previously discovered policies. We present a two-objective update technique for policy gradient algorithms in which each update of the policy is a compromise between improving the task reward and improving the novelty reward. Using this method, we end up with a collection of policies that solves a given task as well as carrying out action sequences that are distinct from one another. We demonstrate this method on maze navigation tasks, a reaching task for a simulated robot arm, and a locomotion task for a hopper. We also demonstrate the effectiveness of our approach on deceptive tasks in which policy gradient methods often get stuck.

연구 동기 및 목표

  • 표준 강화학습 알고리즘이 여러 개의 서로 다른 해답이 존재할 수 있음에도 불구하고 일반적으로 한 가지 정책만을 찾는다는 한계를 해결하기 위해.
  • 수동적 보상 설계나 랜덤 시드 조정 없이도 주어진 작업에 대해 다수의 다양한 효과적인 정책을 발견할 수 있도록 하기 위해.
  • 높은 작업 성능를 유지하면서도 서로 다른 행동 패턴을 탐색하도록 유도하는 방법을 개발하기 위해.
  • 표준 정책 기울기 방법이 자주 국소 최적점에 갇히는 속임수 환경에서의 샘플 효율성과 견고성을 향상시키기 위해.
  • PPO와 같은 모든 정책 기울기 알고리즘에 적용 가능한 일반화 가능한 프레임워크를 제공하기 위해.

제안 방법

  • 기존에 발견된 정책들로부터의 상태 시퀀스에 대해 오토에인코더를 훈련시어 일반적인 행동의 압축된 표현을 학습한다.
  • 오토에인코더의 재구성 오차를 사용해 과거 정책과 유사한 행동을 방지하는 데 목적이 있는 신선도 보상 함수를 정의한다.
  • 작업 보상 최대화와 신선도 보상 최대화라는 두 가지 목표를 가진 다중목표 강화학습 문제를 설정한다.
  • 작업 보상과 신선도 보상의 정책 기울기를 균형 잡힌 비가중치 방식으로 조합하는 기울기 이등분 기법을 적용한다.
  • 결과적으로 유도된 병합 기울기를 사용해 정책 네트워크를 갱신함으로써, 작업 성능 저하 없이 두 목표 모두에서 진전을 이룬다.
  • 기본 RL 알고리즘으로 PPO를 사용하지만, SAC나 TRPO와 같은 다른 정책 기울기 방법으로도 확장 가능하다.

실험 결과

연구 질문

  • RQ1수동적 보상 설계 없이도 강화학습 알고리즘이 단일 작업에 대해 다수의 서로 다른 고성능 정책을 발견할 수 있는가?
  • RQ2작업 성능를 유지하면서 행동적 신선도를 효과적으로 측정하고 유도할 수 있는 방법은 무엇인가?
  • RQ3기울기 기반 다중목표 접근법이 다각적 정책을 발견하는 데 있어 무작위 재초기화나 가중치 합 보상 조합보다 우월한가?
  • RQ4표준 강화학습 알고리즘이 국소 최적점에 갇힐 수 있는 속임수 환경에서도 이 방법이 성공적으로 작동할 수 있는가?
  • RQ5오토에인코더 재구성 오차 기반의 신선도 신호는 정책 다양성과 작업 성공률 측면에서 다른 내재적 호기심 또는 옵션 탐색 방법과 비교해 어떻게 다른가?

주요 결과

  • 작업-신선도 이등분자(TNB)는 보상 함수 조정 없이도 5개의 테스트 작업—미로 탐색, 로봇 팔 도달, 힙퍼 이동, 두 가지 속임수 변형—모두에서 새로운 정책을 성공적으로 발견했다.
  • TBN은 속임수 미로와 속임수 도달 작업에서 표준 PPO와 SAC가 완전히 실패한 상황에서도 5개 중 4개의 성공 정책을 달성했다.
  • 가중치 합 보상(WSR) 방법은 신선도 보상과 작업 보상 간 비율의 정교한 초모수 조정이 필요했으며, 비율이 최적치에서 벗어나면 자주 실패했다.
  • TBN은 랜덤 시드 재초기화를 능가했으며, 다양한 시드로 여러 번 실행했을 때도 다양성을 확보하지 못하는 경우에도 일관되게 서로 다른 정책을 발견했다.
  • 오토에인코더 기반의 신선도 신호는 행동적 차이를 효과적으로 포착해 알고리즘이 이전에 발견된 정책 패턴을 반복하는 것을 방지했다.
  • 이 방법은 연속 제어 작업과 유혹적인 국소 최적점이 존재하는 복잡한 속임수 작업을 포함한 다양한 환경에서 견고성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.