[论文解读] Auxiliary Task Update Decomposition: The Good, The Bad and The Neutral
本文提出 ATTITTUD,一种模型无关的框架,通过基于其对主任务损失的影响,将辅助任务梯度分解为三个分量——有益、有害和中性。通过利用高效的奇异值分解和自动微分对这些分量进行重加权,该方法在低数据场景下提升了泛化性能,在视觉和文本分类任务中持续优于基线方法。
While deep learning has been very beneficial in data-rich settings, tasks with smaller training set often resort to pre-training or multitask learning to leverage data from other tasks. In this case, careful consideration is needed to select tasks and model parameterizations such that updates from the auxiliary tasks actually help the primary task. We seek to alleviate this burden by formulating a model-agnostic framework that performs fine-grained manipulation of the auxiliary task gradients. We propose to decompose auxiliary updates into directions which help, damage or leave the primary task loss unchanged. This allows weighting the update directions differently depending on their impact on the problem of interest. We present a novel and efficient algorithm for that purpose and show its advantage in practice. Our method leverages efficient automatic differentiation procedures and randomized singular value decomposition for scalability. We show that our framework is generic and encompasses some prior work as particular cases. Our approach consistently outperforms strong and widely used baselines when leveraging out-of-distribution data for Text and Image classification tasks.
研究动机与目标
- 解决在主任务数据有限的情况下选择有益辅助任务的挑战。
- 克服因辅助任务导致主任务性能下降的负面影响风险。
- 开发一种可扩展的、模型无关的方法,根据其对主任务的影响对辅助梯度进行微调。
- 实现在无需对称任务优化的前提下,灵活自适应地重加权梯度分量。
- 提供一个统一的框架,以泛化先前的方法,如 PCGrad 和经典多任务学习。
提出的方法
- 将辅助任务梯度相对于主任务的每个样本梯度子空间分解为三个正交分量:正向(有益)、负向(有害)和中性(无影响)。
- 利用主任务期望损失的泰勒展开来定义每个辅助梯度方向对主任务的影响。
- 利用随机奇异值分解(SVD)以在线、随机的方式高效估计主任务每个样本梯度张成的 k 维子空间。
- 应用自动微分(特别是 R-算子)高效计算大规模深度神经网络的雅可比-向量积。
- 使用可学习或固定的标量(例如,η_aux = (1.0, 0.0, 0.0))对三个分量进行重加权,以控制其在优化过程中的贡献。
- 将该框架集成到随机训练流水线中,以支持大规模视觉和 NLP 任务。
实验结果
研究问题
- RQ1我们能否将辅助任务梯度分解为有助于、损害或对主任务损失无影响的分量?
- RQ2如何以可扩展的方式高效估计深度神经网络中主任务梯度子空间?
- RQ3对梯度分量进行细粒度重加权是否能提升低资源主任务的泛化性能?
- RQ4所提出的框架能否统一或超越现有如 PCGrad 或标准多任务学习的非对称多任务学习方法?
- RQ5子空间维度 k 和 SVD 估计的样本大小等超参数在低数据和高数据场景下的性能影响如何?
主要发现
- 所提出的 ATTITTUD 框架在 MultiCifar100 上实现了 76.1% 的平均准确率,优于表现第二好的基线方法 PCGrad 的 75.6%。
- 在 Cat-vs-Dog Cifar10 任务中,ATTITTUD 达到 67.1% 的准确率(±1.31),超过 PCGrad(64.2%)和多任务学习(65.3%)。
- 在 ChexPert-5k 医疗影像基准上,ATTITTUD 将 AUC 从微调前的 ResNet 基线 81.4% 提升至 83.3%,展现出强大的迁移性能。
- 使用基于随机 SVD 的梯度子空间基底,平均准确率达到 62.2%,显著优于标准基底(51.42%)、随机基底(58.72%)和 unit_avg_grad 基线(59.13%)。
- 表现最佳的配置(η_aux = (1.0, 0.0, 0.0))移除了内部分量,减少了过拟合,提升了泛化性能。
- 更大的子空间估计样本量可降低方差,但准确率提升呈边际递减趋势,表明计算成本与精度保真度之间存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。