[论文解读] Worst-Case-Aware Curriculum Learning for Zero and Few Shot Transfer
本文提出了一种面向多任务迁移学习的最坏情况感知课程学习框架,通过动态选择任务以最小化最坏情况损失,提升了零样本和少样本泛化能力。通过使用多臂赌博机基于缓冲区中任务性能来优化采样策略,该方法在不显式加权数据规模的情况下,提升了对小样本和异常值任务的鲁棒性。
Multi-task transfer learning based on pre-trained language encoders achieves state-of-the-art performance across a range of tasks. Standard approaches implicitly assume the tasks, for which we have training data, are equally representative of the tasks we are interested in, an assumption which is often hard to justify. This paper presents a more agnostic approach to multi-task transfer learning, which uses automated curriculum learning to minimize a new family of worst-case-aware losses across tasks. Not only do these losses lead to better performance on outlier tasks; they also lead to better performance in zero-shot and few-shot transfer settings.
研究动机与目标
- 解决标准多任务学习最小化平均损失的局限性,该方法可能导致在异常值或小样本任务上表现不佳。
- 在训练数据稀缺或不可用的零样本和少样本设置下,提升对分布外任务的泛化能力。
- 开发一种鲁棒且自动化的课程学习策略,基于最坏情况性能而非均匀或按规模比例的启发式方法来调整采样策略。
- 通过动态优先选择损失较高或滞后任务,提升低资源任务的性能。
- 形式化一类最坏情况感知的目标函数族,该函数族在极小化最大损失与损失成比例策略之间进行插值。
提出的方法
- 使用多臂赌博机学习一种动态采样策略,根据缓冲区中最近训练损失的最坏情况性能来选择任务。
- 维护一个先进先出的缓冲区,存储最近训练步骤中每个任务的平均损失,以支持采样决策。
- 定义一个由φ参数化的最坏情况感知损失目标族,其中φ=0对应损失成比例采样,φ=1对应严格最坏情况最小化。
- 将课程学习包装器集成到标准多任务训练流水线中,无需修改基础模型或损失计算逻辑。
- 使用来自任务间最坏情况损失的奖励来训练赌博机策略,以鼓励选择当前损失最高的任务。
- 将该方法应用于GLUE基准上的预训练语言模型,评估其在域内和域外迁移任务上的性能。
实验结果
研究问题
- RQ1与标准多任务学习相比,最坏情况感知的课程学习策略是否能在零样本和少样本迁移设置中提升泛化能力?
- RQ2基于最坏情况性能的动态任务采样如何影响不同规模任务的学习动态与收敛性?
- RQ3与均匀或按规模比例采样相比,最小化最坏情况损失是否能带来对小样本或异常值任务的更好性能?
- RQ4与固定或基于启发式的课程相比,所提方法在鲁棒性和迁移性能方面表现如何?
- RQ5该自动化课程学习策略在无需显式数据规模或复杂度监督的情况下,能在多大程度上适应任务难度?
主要发现
- 与标准多任务学习相比,所提方法在GLUE基准上实现了相当或略优的平均性能。
- 在小样本任务(如SICK-R/E、SciTail和WikiQA)上,模型性能显著提升,尤其在低数据设置下表现更优。
- 当φ=1(严格最坏情况最小化)时,各任务的训练损失曲线收敛更紧密,表明学习更加均衡,偏差更小。
- 赌博机学习到的采样策略与均匀采样和按规模比例采样基线存在明显差异,小样本任务被采样得比预期更频繁。
- 在零样本和少样本设置下,该方法对分布外数据集的泛化能力更强,表现出对分布偏移的更好鲁棒性。
- 学习动态表明,课程策略能自动适应任务难度,无需显式的数据规模或复杂度特征,仅依赖缓冲区中的损失趋势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。