Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Deep Neural Network Policies with Continuous Memory States

Marvin Zhang, Zoe McCarthy|arXiv (Cornell University)|2015. 07. 05.
Reinforcement Learning in Robotics참고 문헌 24인용 수 8
한 줄 요약

이 논문은 지도형 정책 학습을 사용하여, 기억이 필요한 연속 제어 작업을 위한 지속적인 기억 상태를 갖는 딥 뉴럴 네트워크 정책을 훈련시키는 방법을 제안한다. 이 방법은 기억 상태 최적화를 정책 학습에서 분리함으로써, 정책이 중요한 정보를 기억하고 재활용할 수 있도록 한다. 이 접근법은 시뮬레이션된 조작 및 탐색 작업에서 표준 RNN과 직접 정책 학습보다 뛰어난 성능을 보인다.

ABSTRACT

Policy learning for partially observed control tasks requires policies that can remember salient information from past observations. In this paper, we present a method for learning policies with internal memory for high-dimensional, continuous systems, such as robotic manipulators. Our approach consists of augmenting the state and action space of the system with continuous-valued memory states that the policy can read from and write to. Learning general-purpose policies with this type of memory representation directly is difficult, because the policy must automatically figure out the most salient information to memorize at each time step. We show that, by decomposing this policy search problem into a trajectory optimization phase and a supervised learning phase through a method called guided policy search, we can acquire policies with effective memorization and recall strategies. Intuitively, the trajectory optimization phase chooses the values of the memory states that will make it easier for the policy to produce the right action in future states, while the supervised learning phase encourages the policy to use memorization actions to produce those memory states. We evaluate our method on tasks involving continuous control in manipulation and navigation settings, and show that our method can learn complex policies that successfully complete a range of tasks that require memory.

연구 동기 및 목표

  • 부분 관측된 연속 제어 작업에서 기억이 필요한 딥 뉴럴 네트워크 정책을 훈련시키는 데 도전하는 것.
  • 고차원적이고 연속적인 시스템에서 효과적인 기억 저장과 행동 선택 전략을 동시에 학습하는 데 어려움을 해결하는 것.
  • 일반적인 정책이 과거 관측치에서 중요한 정보를 지속적인 기억 상태를 통해 저장하고 검색할 수 있도록 하는 것.
  • 백프로파게이션을 시간에 따라 수행하거나 복잡한 모델 기반 역학 추정이 필요 없이도 스케일링 가능하고 효율적인 훈련 방법을 개발하는 것.

제안 방법

  • 정책이 읽고 쓸 수 있는 연속적인 기억 상태를 상태 공간과 행동 공간에 추가한다.
  • 각 초기 상태에 대해 기억 상태 값의 최적화를 수행하는 궤적 중심 강화 학습 알고리즘('선생')을 사용하여 학습 문제를 단순화한다.
  • 선생의 궤적을 감독으로 사용하여 지도 학습 방식으로 딥 뉴럴 네트워크 정책을 훈련시킨다.
  • 최종 정책의 행동을 따라가도록 선생의 궤적을 반복적으로 수정하여, 정책이 기억 상태 활성화를 재현할 수 있도록 보장한다.
  • 선생이 어떤 정보를 저장해야 하는지 결정하고, 정책이 그 상태를 재현하도록 학습함으로써 기억 상태 최적화와 정책 학습을 분리한다.
  • 다중층 신경망을 사용하여 다양한 초기 조건과 작업에 일반화할 수 있도록 최종 정책을 훈련시킨다.

실험 결과

연구 질문

  • RQ1고차원적이고 부분 관측된 제어 작업에 대해 지속적인 기억 상태를 갖는 딥 뉴럴 네트워크 정책을 효과적으로 훈련시킬 수 있는가?
  • RQ2지침형 정책 학습을 통해 기억 상태 최적화를 정책 학습에서 분리하면, 엔드 투 엔드 방법보다 더 안정적이고 효과적인 훈련이 가능한가?
  • RQ3제안된 방법은 표준 RNN 기반 정책과 직접 정책 학습에 비해 성능 및 일반화 능력에서 어떻게 비교되는가?
  • RQ4목표 위치 기억이나 접촉 피드백을 통한 방향 감지와 같은 복잡한 기억 기반 행동을 학습할 수 있는가?
  • RQ5피드포워드 정책이 물리적 상태에 기억을 '오프로딩'하는 작업에서 기억 상태는 성능 향상에 얼마나 기여하는가?

주요 결과

  • 제안된 방법은 펠렛 삽입 및 수직 또는 수평 슬롯에 물체를 놓는 것과 같은 기억이 필요한 복잡한 조작 작업을 성공적으로 학습한 정책을 도출했다.
  • 2D 탐색 및 물건 회수 작업에서, 피드포워드 네트워크가 기억 부족으로 실패한 반면, 제안된 방법은 네 가지 초기 위치에서 모두 성공했다. 표준 LSTM도 효과적으로 최적화되지 못했다.
  • RWR(재생 가중 회귀)와 표준 LSTM 정책은 모든 초기 조건에서 일관된 행동을 학습하지 못해 성능이 열등했다.
  • 피드포워드 정책이 물리적 상태에 기억을 오프로딩함으로써 성공할 수 있는 작업에서도, 명시적 기억 상태를 갖는 제안된 방법이 더 뛰어난 일반화 능력과 신뢰성을 보였다.
  • 지침형 정책 학습 프레임워크 덕분에 내부 기억 기능을 갖는 복잡한 정책의 안정적인 훈련이 가능했으며, 시간에 따른 백프로파게이션을 피할 수 있었다.
  • 프로젝트 웹사이트의 보조 영상에서는 학습된 정책이 다양한 작업에서 일관되고 기억에 의존하는 행동을 보임을 확인할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.