[论文解读] Task Selection Policies for Multitask Learning
本文提出了一种基于反事实估计的任务选择策略,用于多任务学习(MTL),通过动态分配训练预算以提升模型性能。该方法利用离策略评估学习任务上的最优采样分布,其性能在GLUE基准上接近任务特定微调,优于均匀采样和按数据量比例分配的策略。
One of the questions that arises when designing models that learn to solve multiple tasks simultaneously is how much of the available training budget should be devoted to each individual task. We refer to any formalized approach to addressing this problem (learned or otherwise) as a task selection policy. In this work we provide an empirical evaluation of the performance of some common task selection policies in a synthetic bandit-style setting, as well as on the GLUE benchmark for natural language understanding. We connect task selection policy learning to existing work on automated curriculum learning and off-policy evaluation, and suggest a method based on counterfactual estimation that leads to improved model performance in our experimental settings.
研究动机与目标
- 解决在多任务学习设置中,如何在多个NLP任务之间分配有限训练预算的挑战。
- 探究任务选择策略是否能够缓解多任务学习相比单任务微调时的性能下降问题。
- 探索任务选择与自动化课程学习之间的联系,特别是在离策略评估的背景下。
- 开发并评估一种基于反事实估计学习最优任务采样策略的方法,以提升多任务学习的泛化能力。
- 证明所学习的策略能够在数据量各异的多样化NLP任务上,接近单任务微调的性能。
提出的方法
- 将任务选择建模为随机策略学习问题,其中每个任务以学习到的概率被采样。
- 使用反事实估计(Bottou et al., 2012)评估策略的期望性能,而无需重新训练,从而实现离策略学习。
- 基于模型在单个样本上的性能,定义一个代理样本级奖励信号,以指导策略优化。
- 使用包含熵正则项的正则化目标函数优化策略,以防止对低效用任务的过拟合。
- 在少量初始试运行(共4次,包括超参数调优)中,使用类似Bandit的设置训练策略。
- 将所学策略应用于在GLUE基准上微调BERT,并与均匀采样和按数据量比例分配的策略进行性能比较。
实验结果
研究问题
- RQ1所学习的任务选择策略是否能在多任务学习中优于均匀采样或按数据量比例分配等启发式策略?
- RQ2基于反事实估计的策略在合成数据和真实世界NLP基准上的性能,与随机策略或课程学习策略相比如何?
- RQ3在无需完整重训练的情况下,离策略评估结合反事实估计在多任务学习中优化任务采样策略方面,其适用程度如何?
- RQ4所学习的策略是否能有效平衡数据量差异巨大的任务(尤其是小样本任务)的性能?
- RQ5该方法是否能在真实世界基准(如GLUE)上实现泛化,同时保持接近单任务微调的性能?
主要发现
- 基于反事实估计的策略($\pi^{\textsc{c}}$)在GLUE开发集上取得了87.0的得分,优于均匀采样和按数据量比例分配的策略,并接近单任务微调的性能。
- 在GLUE测试集上,使用$\pi^{\textsc{c}}$的MTL模型取得了77.9的得分,与单任务微调BERT的78.3得分非常接近。
- 所学习的策略为较小的任务(如CoLA、RTE、MRPC)分配了更高的采样概率,尽管其数据量较低,显示出有效的反课程行为。
- 尽管STS-B和SST-2的训练集大小相差10倍,但其采样概率相近(分别为0.102和0.094),表明策略不仅捕捉了数据量,还捕捉了任务难度。
- 该策略显著提升了RTE的性能(74.5 vs. 66.4,基线),同时在QNLI和SST-2上仍保持了具有竞争力的结果。
- 该方法仅通过四次训练运行(包括超参数调优)就学习到了有效的策略,展示了在策略优化中的高样本效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。