Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Multi-Task by Active Sampling

Sahil Sharma, Ashutosh Jha|arXiv (Cornell University)|2017. 02. 20.
Advanced Bandit Algorithms Research참고 문헌 26인용 수 10
한 줄 요약

이 논문은 전문가 네트워크가 필요 없도록 하여 더 어려운 작업을 활성 학습 원칙에 따라 우선순위를 매기는 온라인, 활성 샘플링 기반의 다중 작업 강화 학습 프레임워크를 제안한다. 적응형 샘플링, UCB 기반 메타러닝, A3C 기반 메타러닝의 세 가지 방법을 도입하여, 21개 작업을 포함한 다양한 다중 작업 환경에서 최신 기술 수준(SOTA) 성능을 달성했으며, 일반화 능력과 작업에 관계없는 표현 학습 능력이 뛰어나다.

ABSTRACT

One of the long-standing challenges in Artificial Intelligence for learning goal-directed behavior is to build a single agent which can solve multiple tasks. Recent progress in multi-task learning for goal-directed sequential problems has been in the form of distillation based learning wherein a student network learns from multiple task-specific expert networks by mimicking the task-specific policies of the expert networks. While such approaches offer a promising solution to the multi-task learning problem, they require supervision from large expert networks which require extensive data and computation time for training. In this work, we propose an efficient multi-task learning framework which solves multiple goal-directed tasks in an on-line setup without the need for expert supervision. Our work uses active learning principles to achieve multi-task learning by sampling the harder tasks more than the easier ones. We propose three distinct models under our active sampling framework. An adaptive method with extremely competitive multi-tasking performance. A UCB-based meta-learner which casts the problem of picking the next task to train on as a multi-armed bandit problem. A meta-learning method that casts the next-task picking problem as a full Reinforcement Learning problem and uses actor critic methods for optimizing the multi-tasking performance directly. We demonstrate results in the Atari 2600 domain on seven multi-tasking instances: three 6-task instances, one 8-task instance, two 12-task instances and one 21-task instance.

연구 동기 및 목표

  • 작업별 전문가 네트워크에 의존하지 않고도 단일 에이전트가 다수의 목표 지향 작업을 해결할 수 있도록 하는 데 도전한다.
  • 다중 작업 학습에서의 디스틸레이션 기반 접근의 높은 계산 및 데이터 비용 문제를 해결하기 위해 온라인, 자기지도 학습을 가능하게 한다.
  • 활성 샘플링을 통해 시각적으로 다를 수 있는 고차원 작업 간의 일반화 능력을 향상시키기 위해 작업에 관계없는 표현을 학습한다.
  • 다양한 작업 세트, 특히 대규모 MTI에서 일반화 가능한 초모수를 갖는 확장성 있고 견고한 다중 작업 프레임워크를 개발한다.
  • 기존 벤치마크보다 다중 작업 성능을 더 잘 반영하는 새로운 평가 지표를 도입한다.

제안 방법

  • 더 어려운 작업을 더 자주 샘플링함으로써 학습 효율성을 향상시키기 위해 다중 작업 학습을 활성 샘플링 문제로 재정의한다.
  • 세 가지 서로 다른 모델을 제안한다: (1) 작업 난이도에 따라 동적으로 샘플링 빈도를 조정하는 적응형 샘플링 방법; (2) 탐색 보너스가 있는 다중 레버 밴딧 문제로 작업 선택을 설정한 UCB 기반 메타러닝; (3) 액터-크리틱 강화 학습을 사용해 다중 작업 성능을 직접 최적화하는 A3C 기반 메타러닝.
  • 작업별 출력 헤드를 갖는 공유 백본 네트워크를 사용하지만, 공유 헤드가 다른 헤드 아키텍처보다 성능과 일반화 능력에서 뛰어나다는 것을 보여준다.
  • 활성 샘플링을 통한 커리큘럼 학습과 함께 A3C 스타일의 비동기 강화 학습을 사용해 다중 작업 에이전트를 엔드 투 엔드로 훈련한다.
  • 모든 작업을 동시에 평가할 수 있도록 $p_{am}$, $q_{am}$, $q_{gm}$, $q_{hm}$ 등의 지표를 포함한 새로운 평가 프로토콜을 구현한다.
  • 성능 기준으로 단일 작업 A3C 에이전트의 타겟 점수를 사용하여, 모든 작업 간 공정하고 일관된 평가를 확보한다.

실험 결과

연구 질문

  • RQ1환경과의 온라인 상호작용만으로 전문가 감독 없이 다중 작업 강화 학습 에이전트를 효과적으로 훈련시킬 수 있는가?
  • RQ2더 어려운 작업을 활성 샘플링하면 다양한 고차원 작업에서 수렴 속도가 빨라지고 일반화 능력이 향상되는가?
  • RQ3적응형 샘플링, UCB, A3C 기반 최적화와 같은 다양한 메타러닝 전략이 다중 작업 인스턴스에서 성능 및 확장성 측면에서 어떻게 비교되는가?
  • RQ46개 작업의 작은 MTI에서 튜닝한 초모수는 21개 작업의 더 큰, 더 복잡한 MTI로 일반화되는가?
  • RQ5겹치는 액션 공간을 갖는 다중 작업 DRL에서 공유 출력 헤드가 작업별 헤드보다 성능과 일반화 능력에서 더 우수한가?

주요 결과

  • 제안된 활성 샘플링 프레임워크는 전문가 디스틸레이션에 의존하는 이전 방법들을 능가하는 최신 기술 수준(SOTA) 성능을 7개의 다중 작업 인스턴스에서 달성했으며, 이는 21개 작업을 포함한 Atari 설정에서도 해당된다.
  • 적응형 샘플링 방법은 MT1(6개 작업)에서 $p_{am} = 0.907$을 기록하여 기준선 DBA3C 에이전트($p_{am} = 0.244$)를 크게 앞서며 뛰어난 일반화 능력을 입증했다.
  • A3C 기반 메타러닝(A5C)은 모든 MTI에서 그 다른 헤드 버전(DA5C)을 능가했으며, 공통된 액션 공간을 갖는 다중 작업 학습에서 공유 헤드가 더 효과적임을 시사한다.
  • 6개 작업의 MTI에서 튜닝한 초모수는 최대 21개 작업까지의 더 큰 MTI로 잘 일반화되며, 이는 프레임워크의 확장성과 견고성을 시사한다.
  • 특징 분석 결과, 공유 표현은 작업에 관계없고 일반화에 기여하며, 아블레이션 및 시각화 연구를 통해 이를 확인했다.
  • 제안된 평가 지표($p_{am}$, $q_{am}$, $q_{gm}$, $q_{hm}$)는 기존 지표보다 다중 작업 성능을 더 세밀하고 타당하게 평가할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.