Skip to main content
QUICK REVIEW

[論文レビュー] AdaTask: A Task-aware Adaptive Learning Rate Approach to Multi-task Learning

Enneng Yang, Junwei Pan|arXiv (Cornell University)|Nov 28, 2022
Domain Adaptation and Few-Shot Learning参考文献 42被引用数 4
ひとこと要約

AdaTaskは、マルチタスク学習(MTL)におけるタスク固有の累積勾配を分離することで、パラメータレベルのタスク優位性を軽減するタスクに適応した自己適応的学習率手法を提案する。パラメータごとにタスクごとの学習率を分離することにより、AdaTaskは平均性能で最先端水準を達成し、劣化しがちなタスクの性能を著しく向上させつつ、優位なタスクの性能を損なわない。

ABSTRACT

Multi-task learning (MTL) models have demonstrated impressive results in computer vision, natural language processing, and recommender systems. Even though many approaches have been proposed, how well these approaches balance different tasks on each parameter still remains unclear. In this paper, we propose to measure the task dominance degree of a parameter by the total updates of each task on this parameter. Specifically, we compute the total updates by the exponentially decaying Average of the squared Updates (AU) on a parameter from the corresponding task.Based on this novel metric, we observe that many parameters in existing MTL methods, especially those in the higher shared layers, are still dominated by one or several tasks. The dominance of AU is mainly due to the dominance of accumulative gradients from one or several tasks. Motivated by this, we propose a Task-wise Adaptive learning rate approach, AdaTask in short, to separate the \emph{accumulative gradients} and hence the learning rate of each task for each parameter in adaptive learning rate approaches (e.g., AdaGrad, RMSProp, and Adam). Comprehensive experiments on computer vision and recommender system MTL datasets demonstrate that AdaTask significantly improves the performance of dominated tasks, resulting SOTA average task-wise performance. Analysis on both synthetic and real-world datasets shows AdaTask balance parameters in every shared layer well.

研究の動機と目的

  • マルチタスク学習(MTL)のパラメータ最適化におけるタスク優位性を定量化する指標の欠如に対処すること。
  • Adam や RMSProp などの自己適応的最適化手法において、不均衡な累積勾配が原因でMTLにおけるタスク優位性が生じることを同定すること。
  • 各パラメータごとにタスク固有の勾配蓄積を分離することで、パラメータごとのタスク間学習率をバランスさせる手法を提案すること。
  • 優位なタスクの性能を維持またはわずかに低下させつつ、劣位なタスクの性能を向上させ、全体として最先端の性能を達成すること。
  • MTLモデルのすべての共有層において、パラメータ更新のバランスがどのように取られているかを示すこと。

提案手法

  • 各パラメータにおけるタスク優位性を定量化するための新規指標として、パラメータ更新の指数的減衰平均(AU)を導入する。
  • 単一タスクのAUと全AUの比を定義し、その比をrAU指標として、タスクがパラメータに与える優位性を測定する。
  • 自己適応的最適化手法(例:Adam、RMSProp、AdaGrad)において、各タスク・各パラメータごとに累積勾配を分離するAdaTaskを提案する。
  • 共有パラメータにおける各タスクごとに独立した一次モーメントおよび二次モーメントを維持するように、既存の自己適応的最適化手法を変更する。
  • タスク固有の学習率更新ルールを適用する:各タスクの学習率は、自らの蓄積勾配統計に基づいて独立に計算される。
  • 最適化ループにタスクごとの勾配追跡を統合することで、すべての主要な自己適応的最適化手法(Adam、RMSProp、AMSGradなど)と互換性を保つ。

実験結果

リサーチクエスチョン

  • RQ1既存のMTL手法は、特に高い共有層において、パラメータ更新におけるタスク優位性をどの程度抱えているか?
  • RQ2指数的減衰平均の二乗パラメータ更新(AU)に基づく指標を用いることで、タスク優位性を定量化できるか?
  • RQ3自己適応的最適化手法におけるタスク固有の累積勾配の分離は、パラメータレベルのタスク優位性を低減させ、劣位タスクの性能向上に寄与するか?
  • RQ4AdaTaskは、優位なタスクの性能を著しく低下させることなく、すべてのタスクにおいてパラトリア最適な性能を達成できるか?
  • RQ5実世界のMTLモデルにおいて、AdaTaskはすべての共有層における学習率とパラメータ更新のバランスをどの程度適切に保っているか?

主な発見

  • AdaTaskは劣位なタスクの性能を顕著に向上させる。例えば、合成データ、CityScapes、TikTokデータセットにおけるタスクAで顕著な改善が確認された。
  • CityScapesデータセットでは、EqualWeightでは共有パラメータの99%、GradNormでは95%がタスクBに支配されているが、AdaTaskではわずか7%にまで低下しており、優位性低減の有効性が明確に示された。
  • 数エポック経過後、合成データセットの4層すべてにおいて、AdaTask下でのrAU値の98%以上が(40%, 60%]の範囲内に集中しており、強いバランスが実現されていることが示された。
  • AdaTaskは4つのデータセット(合成、CityScapes、TikTok、WeChat)において、MGDA、GradNorm、UW、PCGrad、CAGradを上回る、タスクごとの平均性能で最先端水準を達成した。
  • この手法は、すべてのタスクで同時に優位なベースラインが存在しないことから、パラトリア定常解に到達していることが示された。
  • AdaTaskでは学習率の優位性が解消されており、各タスクがパラメータごとに独自の学習率を計算するため、優位なタスクによる干渉が防止された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。