Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-task Learning with Gradient Guided Policy Specialization

Wenhao Yu, C. Karen Liu|arXiv (Cornell University)|2017. 09. 23.
Reinforcement Learning in Robotics참고 문헌 18인용 수 3
한 줄 요약

이 논문은 다중 작업 강화 학습 방법을 제안하며, 먼저 여러 작업 간에 공유되는 신경망 정책을 함께 훈련한 후, 기울기 기반 척도를 사용하여 상호 간에 높은 불일치를 보이는 가중치를 식별함으로써 정책을 선택적으로 특화시킴으로써 데이터 효율성을 향상시킨다. 이 방법은 다양한 로봇 제어 작업(작업 유사도가 다양함)에서 공동 훈련, 독립 훈련, 무작위 특화, 표준 다중 작업 아키텍처보다 성능이 뛰어나다.

ABSTRACT

We present a method for efficient learning of control policies for multiple related robotic motor skills. Our approach consists of two stages, joint training and specialization training. During the joint training stage, a neural network policy is trained with minimal information to disambiguate the motor skills. This forces the policy to learn a common representation of the different tasks. Then, during the specialization training stage we selectively split the weights of the policy based on a per-weight metric that measures the disagreement among the multiple tasks. By splitting part of the control policy, it can be further trained to specialize to each task. To update the control policy during learning, we use Trust Region Policy Optimization with Generalized Advantage Function (TRPOGAE). We propose a modification to the gradient update stage of TRPO to better accommodate multi-task learning scenarios. We evaluate our approach on three continuous motor skill learning problems in simulation: 1) a locomotion task where three single legged robots with considerable difference in shape and size are trained to hop forward, 2) a manipulation task where three robot manipulators with different sizes and joint types are trained to reach different locations in 3D space, and 3) locomotion of a two-legged robot, whose range of motion of one leg is constrained in different ways. We compare our training method to three baselines. The first baseline uses only joint training for the policy, the second trains independent policies for each task, and the last randomly selects weights to split. We show that our approach learns more efficiently than each of the baseline methods.

연구 동기 및 목표

  • 딥 강화 학습을 사용하여 관련된 여러 로봇 운동 기술을 훈련할 때 데이터 효율성을 향상시키는 것.
  • 다중 작업 정책 학습에서 파라미터 공유와 작업별 적응 간의 균형을 맞추는 과제를 해결하는 것.
  • 성능 향상을 위해 어떤 네트워크 가중치를 특화시켜야 할지 자동으로 식별하는 방법을 개발하는 것.
  • 작업 유사도가 다양한 경우(예: 매우 다를 수 있는 로봇 포함)에 이 방법을 평가하는 것.
  • 기울기 불일치 기반 선택적 특화가 랜덤 또는 고정 아키텍처 특화보다 성능이 뛰어나다는 것을 입증하는 것.

제안 방법

  • 이 방법은 이중 단계 훈련을 사용한다: 먼저 Proximal Policy Optimization (PPO)를 사용하여 모든 작업에 대해 단일 공유 정책을 함께 훈련한다.
  • 작업 간 정책 기울기의 분산을 기반으로 각 가중치별 척도를 계산하여 불일치 정도를 측정한다; 높은 분산은 공유 유용성이 낮음을 나타낸다.
  • 높은 불일치를 보이는 가중치는 두 번째 훈련 단계에서 선택적으로 분할하여 전용 하위 정책을 생성한다.
  • 특화는 정책 네트워크에만 적용되며, 가치 함수에는 적용되지 않으며, 기울기 분산 척도에 기반한다.
  • 이 방법은 유연한 특화 정도를 허용하며, 공유 아키텍처를 가진 임의의 수의 관련 작업에 적용할 수 있다.
  • 이 방법은 서면 손실을 사용한 PPO를 사용하여 평가되며, 특화는 훈련 중 단 한 번의 지점에서 적용된다.

실험 결과

연구 질문

  • RQ1기울기 불일치 기반 선택적 정책 특화가 공동 훈련만으로 하는 것보다 다중 작업 강화 학습 성능을 향상시키는가?
  • RQ2작업 유사도 수준에 따라(예: 크기가 다른 로봇) 제안된 방법의 성능는 어떻게 변하는가?
  • RQ3기울기 유도 특화가 다중 작업 학습에서 랜덤 또는 고정 아키텍처 특화보다 성능이 뛰어나다고 할 수 있는가?
  • RQ4이 방법은 작업 유사도가 다양할 수 있는 다양한 로봇 제어 작업에 일반화 가능한가?
  • RQ5공동 훈련 기간과 특화 비율이 최종 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 모든 테스트 설정에서 최고의 성능를 기록하였으며, 공동 훈련, 독립 훈련, 무작위 특화, 표준 다중 작업 아키텍처보다 일관되게 뛰어나다.
  • 3kg와 15kg의 몸통 질량을 가진 힙퍼 작업에서(가장 다를 수 있는 경우), 이 방법은 누적 수익 2302.74를 기록하여 독립 훈련과 공동 훈련을 모두 초월하였다.
  • 앞으로 및 뒤로 걷는 보행 작업에서, 이 방법은 800만 개의 공동 훈련 스텝과 50%의 특화 비율로 2562.53의 누적 수익을 기록하여 기준선을 크게 뛰어넘었다.
  • 작업 유사도가 증가함에 따라(예: 14kg와 15kg 힙퍼), 기울기 유도 특화를 적용한 공동 훈련이 별도 훈련을 초월하여 2562.53 대비 최고 기준선 2381.18의 성능을 기록하였다.
  • 이 방법은 9개의 하이퍼파라미터 설정에서 뛰어난 안정성을 보였으며, 최적 설정(800만 개의 공동 스텝, 50% 특화)이 모든 예제에서 강력한 성능을 기록하였다.
  • 초기 테스트 결과, 가치 함수 네트워크를 특화하는 데에는 두드러진 성능 향상이 없었으며, 이는 정책 특화만으로도 성능 향상이 충분하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.