[论文解读] AdaTask: A Task-aware Adaptive Learning Rate Approach to Multi-task Learning
AdaTask 提出了一种任务感知的自适应学习率方法,通过在多任务学习(MTL)中分离特定任务的累积梯度,减轻参数层面的任务主导问题。通过按参数为每个任务解耦学习率,AdaTask 实现了最先进(SOTA)的平均性能,并显著提升了表现较差的任务性能,同时不损害主导任务的性能。
Multi-task learning (MTL) models have demonstrated impressive results in computer vision, natural language processing, and recommender systems. Even though many approaches have been proposed, how well these approaches balance different tasks on each parameter still remains unclear. In this paper, we propose to measure the task dominance degree of a parameter by the total updates of each task on this parameter. Specifically, we compute the total updates by the exponentially decaying Average of the squared Updates (AU) on a parameter from the corresponding task.Based on this novel metric, we observe that many parameters in existing MTL methods, especially those in the higher shared layers, are still dominated by one or several tasks. The dominance of AU is mainly due to the dominance of accumulative gradients from one or several tasks. Motivated by this, we propose a Task-wise Adaptive learning rate approach, AdaTask in short, to separate the \emph{accumulative gradients} and hence the learning rate of each task for each parameter in adaptive learning rate approaches (e.g., AdaGrad, RMSProp, and Adam). Comprehensive experiments on computer vision and recommender system MTL datasets demonstrate that AdaTask significantly improves the performance of dominated tasks, resulting SOTA average task-wise performance. Analysis on both synthetic and real-world datasets shows AdaTask balance parameters in every shared layer well.
研究动机与目标
- 解决多任务学习(MTL)参数优化中缺乏量化任务主导性的度量指标的问题。
- 识别出在自适应优化器(如 Adam 和 RMSProp)中,任务主导性源于不平衡的累积梯度。
- 提出一种方法,通过分离每个参数上特定任务的梯度累积,实现每个参数上各任务学习率的解耦。
- 在保持或略微降低主导任务性能的同时,提升被主导任务的性能,从而实现整体最先进性能。
- 证明 AdaTask 能够在 MTL 模型的所有共享层中实现参数更新的更好平衡。
提出的方法
- 引入一种新度量——按任务划分的参数更新平方值的指数加权平均(AU),用于量化每个参数上的任务主导性。
- 定义单个任务的 AU 与总 AU 的比值为 rAU 度量,用于衡量任务在参数上的主导程度。
- 提出 AdaTask,通过在自适应优化器(如 Adam、RMSProp、AdaGrad)中为每个参数独立分离特定任务的累积梯度。
- 修改现有自适应优化器,为共享参数上的每个任务维护独立的一阶和二阶矩统计量。
- 应用特定任务的学习率更新规则:每个任务的学习率基于其自身的累积梯度统计量独立计算。
- 通过在优化循环中集成任务级梯度追踪,确保与所有主流自适应优化器(如 Adam、RMSProp、AMSGrad 等)的兼容性。
实验结果
研究问题
- RQ1现有 MTL 方法在参数更新中在多大程度上受到任务主导性的影响,尤其是在更高层共享层中?
- RQ2能否基于参数更新平方值的指数加权平均(AU)提出一种度量来量化任务主导性?
- RQ3在自适应优化器中分离特定任务的累积梯度,是否能有效降低参数层面的任务主导性,并提升被主导任务的性能?
- RQ4AdaTask 是否能在不显著损害主导任务的前提下,实现所有任务的帕累托最优性能?
- RQ5AdaTask 在真实 MTL 模型中,能否在所有共享层上实现学习率和参数更新的更好平衡?
主要发现
- AdaTask 显著提升了被主导任务的性能——例如在合成数据集、CityScapes 和 TikTok 数据集中的任务 A,同时保持了整体性能的强劲表现。
- 在 CityScapes 数据集中,EqualWeight 中 99% 的共享参数、GradNorm 中 95% 的共享参数受任务 B 主导,但在 AdaTask 中仅占 7%,表明主导性得到有效降低。
- 经过几个训练周期后,合成数据集中所有四层共享参数的 rAU 值中,超过 98% 落在 (40%, 60%] 区间,表明实现了极强的平衡性。
- AdaTask 在四个数据集(合成、CityScapes、TikTok、WeChat)上实现了最先进(SOTA)的平均任务性能,优于 MGDA、GradNorm、UW、PCGrad 和 CAGrad。
- 该方法实现了帕累托平稳解,因为没有任何基线方法能在所有任务上同时优于 AdaTask。
- AdaTask 消除了学习率主导性,因为每个任务独立计算其在每个参数上的学习率,从而避免了主导任务的干扰。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。