Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-task Learning for Continuous Control

Himani Arora, Rajath Kumar|arXiv (Cornell University)|2018. 02. 03.
Reinforcement Learning in Robotics참고 문헌 7인용 수 11
한 줄 요약

이 논문은 여러 MuJoCo 환경에서 공유 정책 및 가치 네트워크를 사용하여 연속 제어 작업을 위한 다중 작업 강화 학습을 제안하고 평가한다. 일반적인 다중 작업 학습이 단일 작업 학습과 지식 정복보다 우수한 성능을 보이며, 더 적은 학습 단계로 더 높은 성능을 달성하고 치명적인 잊음 현상을 감소시킴을 입증한다.

ABSTRACT

Reliable and effective multi-task learning is a prerequisite for the development of robotic agents that can quickly learn to accomplish related, everyday tasks. However, in the reinforcement learning domain, multi-task learning has not exhibited the same level of success as in other domains, such as computer vision. In addition, most reinforcement learning research on multi-task learning has been focused on discrete action spaces, which are not used for robotic control in the real-world. In this work, we apply multi-task learning methods to continuous action spaces and benchmark their performance on a series of simulated continuous control tasks. Most notably, we show that multi-task learning outperforms our baselines and alternative knowledge sharing methods.

연구 동기 및 목표

  • 실제 로봇 제어 작업에서 강화 학습의 샘플 비효율성을 해결하기 위해 관련된 작업 간 지식 전이를 가능하게 하기 위해.
  • 컴퓨터 비전 및 이산 동작 공간에서 효과적인 다중 작업 학습 방법이 연속 제어 작업으로 일반화되는지 조사하기 위해.
  • 단일 작업 학습과 비교하여 일반적인 다중 작업 학습과 지식 정복을 연속 동작 공간 환경에서 벤치마킹하기 위해.
  • 다중 작업 강화 학습에서 학습 속도, 성능 안정성, 치명적인 잊음 현상 간의 상호 교환 관계를 평가하기 위해.
  • MuJoCo 환경을 사용하여 향후 연구를 위한 재현 가능한 벤치마크를 제공하기 위해.

제안 방법

  • 6개의 MuJoCo 환경에서 공유된 은닉층과 작업 전용 출력 헤드를 가진 6헤드 액터-크리틱 네트워크를 학습하며, 각 헤드를 100만 프레임 동안 순환적으로 학습한다.
  • 정책과 가치 함수 파라미터를 업데이트하기 위해 온-폴리시 롤아웃과 n단계 리턴을 사용한 이점 액터-크리틱(A2C) 알고리즘을 적용한다.
  • 지식 정복을 구현하기 위해 사전 훈련된 교사 네트워크의 행동을 모방하도록 학습하는 학생 네트워크를 구축하며, 정책 및 특징 회귀 손실을 모두 사용한다.
  • 탐색을 장려하고 비최적의 결정론적 정책으로의 조기 수렴을 방지하기 위해 엔트로피 정규화를 적용한다.
  • 기존 환경에서 사전 훈련된 네트워크를 새로운 환경에서 미세조정하여 치명적인 잊음 현상을 평가하며, 원래 정책의 가중치를 초기화로 사용하고 마지막 레이어만 업데이트한다.
  • 20번의 롤아웃 동안 누적 보상으로 성능을 평가하며, 작업 및 학습 방식 간 평균과 표준편차를 비교한다.

실험 결과

연구 질문

  • RQ1연속 제어 환경에서 다중 작업 학습이 단일 작업 학습에 비해 샘플 효율성과 최종 성능을 향상시키는가?
  • RQ2학습 속도, 성능, 분산 측면에서 일반적인 다중 작업 학습과 지식 정복 간의 비교는 어떻게 되는가?
  • RQ3기존 환경에서 사전 훈련된 정책을 새로운 환경에서 미세조정할 경우 원래 작업에서 치명적인 잊음 현상이 얼마나 발생하는가?
  • RQ4여러 관련 작업 간 공유 표현이 연속 제어에서 빠른 수렴과 더 나은 일반화를 이끌 수 있는가?
  • RQ5지식 정복이 다중 작업 연속 제어 설정에서 학습을 안정화하거나 분산을 줄이는가?

주요 결과

  • 일반적인 다중 작업 학습은 단일 작업 학습보다 우수하며, 단일 작업 학습에서 300만 프레임 학습을 한 것과 유사한 성능을 단지 100만 프레임 내에 달성한다.
  • 일반적인 다중 작업 에이전트는 단일 작업 및 정복 기반 모델보다 모든 환경에서 더 높은 평균 누적 보상 수준을 달성한다.
  • 지식 정복은 학습 시간을 줄이며, 정복 에이전트가 일반적인 에이전트보다 보상 1000에 더 빨리 도달한다. 그러나 성능의 분산이 더 크다.
  • HalfCheetahBigTorso 및 HalfCheetahSmallThigh에서 정복 에이전트의 표준편차가 일반적인 에이전트보다 뚜렷하게 크며, 학습이 덜 안정적임을 시사한다.
  • 사전 훈련된 네트워크를 새로운 환경에서 미세조정하면 치명적인 잊음 현상이 발생하며, 목표 작업에서 성능 향상에도 불구하고 원래 환경의 성능이 저하된다.
  • 공유 표현을 사용한 다중 작업 학습은 재학습이 필요로 하는 양을 크게 줄이며, 관련 작업 간 빠른 수렴을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.