[论文解读] Small Towers Make Big Differences
本文提出了一种参数量较少的自监督辅助头——在多任务深度学习模型中添加小型、与任务无关的分支结构——以通过平衡多目标优化与多任务泛化能力来提升帕累托效率。实验结果表明,这些小型辅助头在参数量增加极少的情况下,显著提升了多个任务的性能,优于标准的多任务模型和参数量过大的基线模型。
Multi-task learning aims at solving multiple machine learning tasks at the same time. A good solution to a multi-task learning problem should be generalizable in addition to being Pareto optimal. In this paper, we provide some insights on understanding the trade-off between Pareto efficiency and generalization as a result of parameterization in multi-task deep learning models. As a multi-objective optimization problem, enough parameterization is needed for handling task conflicts in a constrained solution space; however, from a multi-task generalization perspective, over-parameterization undermines the benefit of learning a shared representation which helps harder tasks or tasks with limited training examples. A delicate balance between multi-task generalization and multi-objective optimization is therefore needed for finding a better trade-off between efficiency and generalization. To this end, we propose a method of under-parameterized self-auxiliaries for multi-task models to achieve the best of both worlds. It is task-agnostic and works with other multi-task learning algorithms. Empirical results show that small towers of under-parameterized self-auxiliaries can make big differences in improving Pareto efficiency in various multi-task applications.
研究动机与目标
- 研究参数化多任务深度学习模型中帕累托效率与多任务泛化能力之间的权衡。
- 解决过度参数化削弱共享表征学习优势的问题,尤其是在困难或数据量少的任务中。
- 开发一种通用的、与任务无关的方法,以提升帕累托效率,且不增加推理成本。
- 证明参数量较少的自监督辅助头可通过隐式正则化共享表征,实现优于更大模型的性能。
提出的方法
- 在与主干头相同的任务上引入小型、与任务无关的辅助头(自监督辅助头),共享相同输入但容量更低。
- 使用平均池化或瓶颈层进一步降低自监督辅助头的参数量。
- 通过主任务目标和辅助任务目标联合训练模型,其中辅助头对共享特征提供隐式正则化。
- 将该方法应用于具有ReLU激活函数的共享底座架构,保持与现有多任务学习框架的兼容性。
- 通过大规模超参数搜索(每种配置进行1000次运行)优化池化大小和网络宽度等超参数。
- 使用帕累托前沿分析评估多个目标之间的权衡,特别是在回归和分类任务中。
实验结果
研究问题
- RQ1多任务模型中的参数化水平如何影响帕累托效率与多任务泛化能力之间的权衡?
- RQ2参数量较少的辅助头是否能在不增加模型大小或推理成本的前提下提升帕累托效率?
- RQ3降低自监督辅助头的容量是否能带来更好的性能?如果是,原因是什么?
- RQ4该方法在不同模型架构和任务类型下的表现如何?
- RQ5该方法能否在不改变架构的前提下与现有多任务学习算法结合使用?
主要发现
- 在MovieLens数据集上,对自监督辅助头使用平均池化的方法显著改善了帕累托前沿,提升了观看预测和评分预测两个任务的性能。
- 进一步降低自监督辅助头的参数量可进一步提升性能,表明参数量较少是实现有效正则化的关键。
- 该方法实现的帕累托效率优于更大的模型,证明过度参数化可能损害多任务泛化能力。
- 自监督辅助头的优势在更大模型架构中更为显著,证实其在平衡优化与泛化方面的作用。
- 该方法在不同任务(回归与分类)和模型架构中均表现有效,显示出广泛的适用性。
- 该方法在训练阶段引入可忽略的参数开销,推理阶段无额外成本,适用于大规模系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。