[论文解读] ForkMerge: Mitigating Negative Transfer in Auxiliary-Task Learning
ForkMerge 是一种新颖的方法,通过定期将模型分叉为多个分支,利用目标验证误差最小化动态优化任务权重,并将分支合并以过滤有害的参数更新,从而减轻辅助任务学习中的负迁移。该方法在多个基准测试中实现了最先进性能,包括在 AliExpress 数据集上实现 1.30% 的绝对性能提升,以及在使用 1000 个标签的 SVHN 数据集上实现 46.3% 的测试误差降低。
Auxiliary-Task Learning (ATL) aims to improve the performance of the target task by leveraging the knowledge obtained from related tasks. Occasionally, learning multiple tasks simultaneously results in lower accuracy than learning only the target task, which is known as negative transfer. This problem is often attributed to the gradient conflicts among tasks, and is frequently tackled by coordinating the task gradients in previous works. However, these optimization-based methods largely overlook the auxiliary-target generalization capability. To better understand the root cause of negative transfer, we experimentally investigate it from both optimization and generalization perspectives. Based on our findings, we introduce ForkMerge, a novel approach that periodically forks the model into multiple branches, automatically searches the varying task weights by minimizing target validation errors, and dynamically merges all branches to filter out detrimental task-parameter updates. On a series of auxiliary-task learning benchmarks, ForkMerge outperforms existing methods and effectively mitigates negative transfer.
研究动机与目标
- 系统研究辅助任务学习中超越梯度冲突的负迁移根本原因。
- 解决现有基于优化的方法忽视泛化能力的局限性。
- 通过模型分支与合并结合多样化的任务分布假设,开发一种提升模型泛化能力的方法。
- 通过过滤有害参数更新而保留有益更新,提升多任务学习的性能。
- 在包括大规模推荐和半监督学习任务在内的多样化辅助任务学习基准上实现最先进结果。
提出的方法
- ForkMerge 定期将主模型分叉为多个分支,每个分支使用不同的任务权重配置进行训练。
- 它通过在训练过程中最小化目标验证误差,动态搜索任务权重。
- 在固定时间间隔,所有分支被合并并同步,形成统一模型,从而过滤有害的参数更新。
- 该方法将任务分布的组合视为假设组合问题,避免对所有可能的数据分布组合进行穷举搜索。
- 该方法采用基于梯度的优化策略,平衡正向迁移并减轻负向迁移。
- 它与现有多任务学习框架兼容,可集成到监督学习和自监督学习流程中。
实验结果
研究问题
- RQ1除了梯度冲突之外,辅助任务学习中负迁移的根本原因是什么?
- RQ2训练数据与测试数据之间的分布偏移如何影响负迁移?
- RQ3模型分支与动态权重优化能否提升多任务学习中的泛化能力?
- RQ4通过合并过滤有害参数更新,是否能带来优于标准多任务训练的性能?
- RQ5ForkMerge 在监督和半监督辅助任务学习设置中是否能超越现有最先进方法?
主要发现
- 与最强基线相比,ForkMerge 在 AliExpress 推荐基准上的平均性能实现了 1.30% 的绝对提升。
- 在使用 1000 个标注样本的 SVHN 数据集上,ForkMerge 将测试误差降低至 5.49%,相比基线 S4L 方法实现了 46.3% 的误差降低。
- 实验表明,该方法在所有评估基准上均优于现有最先进方法,如 GradNorm、CAGrad 和 Auto-λ。
- 实验结果表明,梯度冲突本身并不必然导致负迁移,即使在如权重衰减这类冲突的辅助任务中,也可能带来益处。
- 负迁移与训练与测试数据之间的分布偏移相关性更强,而非与优化干扰相关。
- 动态合并机制能有效过滤有害参数更新,同时保留并增强有益更新。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。