Skip to main content
QUICK REVIEW

[논문 리뷰] AdaTask: A Task-aware Adaptive Learning Rate Approach to Multi-task Learning

Enneng Yang, Junwei Pan|arXiv (Cornell University)|2022. 11. 28.
Domain Adaptation and Few-Shot Learning참고 문헌 42인용 수 4
한 줄 요약

AdaTask는 다중태스크학습(MTL)에서 태스크별 누적 기울기를 분리하여 파라미터 수준의 태스크 지배를 완화하기 위해 작업 지각적 적응형 학습률 방법을 제안한다. 각 파라미터별로 태스크별로 학습률을 분리함으로써 AdaTask는 평균 성능에서 최고 수준의 성능을 달성하고, 성능이 열등한 태스크의 성능을 크게 향상시키면서도 우세한 태스크의 성능를 떨어뜨리지 않는다.

ABSTRACT

Multi-task learning (MTL) models have demonstrated impressive results in computer vision, natural language processing, and recommender systems. Even though many approaches have been proposed, how well these approaches balance different tasks on each parameter still remains unclear. In this paper, we propose to measure the task dominance degree of a parameter by the total updates of each task on this parameter. Specifically, we compute the total updates by the exponentially decaying Average of the squared Updates (AU) on a parameter from the corresponding task.Based on this novel metric, we observe that many parameters in existing MTL methods, especially those in the higher shared layers, are still dominated by one or several tasks. The dominance of AU is mainly due to the dominance of accumulative gradients from one or several tasks. Motivated by this, we propose a Task-wise Adaptive learning rate approach, AdaTask in short, to separate the \emph{accumulative gradients} and hence the learning rate of each task for each parameter in adaptive learning rate approaches (e.g., AdaGrad, RMSProp, and Adam). Comprehensive experiments on computer vision and recommender system MTL datasets demonstrate that AdaTask significantly improves the performance of dominated tasks, resulting SOTA average task-wise performance. Analysis on both synthetic and real-world datasets shows AdaTask balance parameters in every shared layer well.

연구 동기 및 목표

  • 다중태스크학습(MTL) 파라미터 최적화에서 태스크 지배를 정량화할 수 있는 지표가 부족한 문제를 해결한다.
  • AdaGrad 및 RMSProp과 같은 적응형 최적화기에서 누적 기울기의 불균형이 MTL에서 태스크 지배를 유발함을 규명한다.
  • 각 파라미터별로 태스크별 기울기 누적을 분리하여 태스크 간 학습률을 균형 있게 조절하는 방법을 제안한다.
  • 우세한 태스크의 성능를 유지하거나 약간 감소시키면서도 지배받는 태스크의 성능를 향상시켜 전체적으로 최고 성능(SOTA)을 달성한다.
  • AdaTask가 MTL 모델의 모든 공유 레이어에서 파라미터 업데이트의 균형을 잘 이루는지 확인한다.

제안 방법

  • 각 파라미터에서 태스크별 지수 감쇠 평균 제곱 파라미터 업데이트(AU)를 도입하여 태스크 지배를 정량화하는 새로운 지표를 제안한다.
  • 단일 태스크의 AU를 총 AU에 대한 비율로 정의하여 rAU 지표를 도입하여 파라미터에서 태스크의 지배 정도를 측정한다.
  • 적응형 최적화기(예: Adam, RMSProp, AdaGrad)에서 각 파라미터별로 태스크별로 누적 기울기를 분리하는 AdaTask를 제안한다.
  • 공유 파라미터에서 각 태스크별로 독립적인 일阶 및 이阶 모멘텀을 유지하도록 기존 적응형 최적화기를 수정한다.
  • 태스크별 학습률 업데이트 규칙을 적용: 각 태스크의 학습률을 자체 누적 기울기 통계 기반으로 독립적으로 계산한다.
  • 최적화 루프에 태스크별 기울기 추적 기능을 통합하여 모든 주요 적응형 최적화기(Adam, RMSProp, AMSGrad 등)와의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1기존의 MTL 방법들은 공유 레이어가 높을수록 파라미터 업데이트에서 태스크 지배 문제를 얼마나 심각하게 겪는가?
  • RQ2지수 감쇠 평균 제곱 파라미터 업데이트(AU)를 기반으로 한 지표로 태스크 지배를 정량화할 수 있는가?
  • RQ3적응형 최적화기에서 태스크별 누적 기울기를 분리하면 파라미터 수준의 태스크 지배가 감소하고, 지배받는 태스크의 성능가 향상되는가?
  • RQ4AdaTask는 우세한 태스크의 성능를 크게 떨어뜨리지 않으면서도 모든 태스크에서 파레토 최적 성능를 달성할 수 있는가?
  • RQ5실제 MTL 모델에서 AdaTask는 모든 공유 레이어에서 학습률과 파라미터 업데이트의 균형을 얼마나 잘 유지하는가?

주요 결과

  • AdaTask는 지배받는 태스크의 성능를 크게 향상시키며, 예를 들어 합성 데이터, CityScapes, TikTok 데이터셋에서 태스크 A의 성능를 향상시키지만 전체 성능는 유지한다.
  • CityScapes 데이터셋에서 EqualWeight의 99%, GradNorm의 95% 공유 파라미터가 태스크 B에 의해 지배되지만, AdaTask에서는 이 비율이 7%로 떨어져 효과적인 지배 감소를 보여준다.
  • 몇 에포크 후, 합성 데이터셋의 네 레이어 모두에서 AdaTask 하에 98% 이상의 공유 파라미터가 rAU 값이 (40%, 60%] 범위에 들어가 균형 잡힌 업데이트를 보임을 확인한다.
  • AdaTask는 합성, CityScapes, TikTok, WeChat 네 데이터셋에서 태스크별 평균 성능에서 MGDA, GradNorm, UW, PCGrad, CAGrad를 모두 능가하며 최고 성능(SOTA)을 달성한다.
  • 모든 태스크에서 동시에 우월한 성능를 내는 베이스라인이 존재하지 않아, AdaTask가 파레토 정적 해에 도달했음을 입증한다.
  • AdaTask에서는 학습률 지배가 사라지며, 각 태스크가 각 파라미터별로 독립적으로 학습률을 계산하므로, 지배적인 태스크의 간섭을 방지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.