Skip to main content
QUICK REVIEW

[论文解读] Auxiliary Learning by Implicit Differentiation

Aviv Navon, Idan Achituve|arXiv (Cornell University)|Jun 22, 2020
Domain Adaptation and Few-Shot Learning参考文献 51被引用 4
一句话总结

该论文提出了一种名为AuxiLearn的新框架,用于使用隐式微分法在深度学习中实现自动化的辅助学习。该框架统一了非线性损失组合的学习与从数据中发现新型辅助任务的过程,在图像分割和少样本分类任务中显著提升了低数据量场景下的性能,相较于MAXL和STL等基线方法表现出一致的性能优势。

ABSTRACT

Training neural networks with auxiliary tasks is a common practice for improving the performance on a main task of interest. Two main challenges arise in this multi-task learning setting: (i) designing useful auxiliary tasks; and (ii) combining auxiliary tasks into a single coherent loss. Here, we propose a novel framework, AuxiLearn, that targets both challenges based on implicit differentiation. First, when useful auxiliaries are known, we propose learning a network that combines all losses into a single coherent objective function. This network can learn non-linear interactions between tasks. Second, when no useful auxiliary task is known, we describe how to learn a network that generates a meaningful, novel auxiliary task. We evaluate AuxiLearn in a series of tasks and domains, including image segmentation and learning with attributes in the low data regime, and find that it consistently outperforms competing methods.

研究动机与目标

  • 为解决在多任务学习中设计有效辅助任务的挑战,特别是在过拟合现象普遍的低数据量场景下。
  • 开发一个统一框架,学习预定义辅助损失的非线性组合,以超越线性加权方式提升泛化能力。
  • 在无需领域专业知识的前提下,仅使用输入数据和隐式微分法,自动发现有意义的辅助任务。
  • 通过学习对主任务有益的辅助任务来提升模型泛化能力,而非仅优化训练损失。

提出的方法

  • 使用隐式微分法联合优化主网络与生成新标签的辅助网络,避免在主训练集上直接优化辅助参数。
  • 采用双层优化设置:主网络在主任务和辅助任务上进行训练,而辅助网络则在独立的小型辅助数据集上进行优化,以提升泛化能力。
  • 引入深度神经网络(如CNN)来学习多个辅助损失的非线性、任务感知组合,替代简单的加权和。
  • 应用隐函数定理(IFT)反向传播通过内部优化问题,实现损失组合网络的端到端训练。
  • 使用平滑激活函数(如Softplus)和权重归一化,以确保隐式微分过程中的可微性与稳定性。
  • 采用近似方法,如Neumann级数和有限次内部优化步骤,使双层优化在计算上可行。

实验结果

研究问题

  • RQ1隐式微分能否以一种有效且非线性的方式组合多个辅助损失,从而在泛化性能上超越线性加权?
  • RQ2能否训练一个神经网络,使其在无需领域专业知识的前提下,自动生成基于数据的有意义辅助任务?
  • RQ3在独立的辅助集上学习辅助任务(而非主训练集),是否能带来更好的泛化性能并减少过拟合?
  • RQ4所提出的框架在低数据量场景下的表现如何,而这些场景正是辅助学习最有益的场景?
  • RQ5哪些理论特性决定了辅助任务的有效性,以及哪些组件最能预测性能增益?

主要发现

  • 在CUB-200-2011数据集上,使用15-shot学习时,AuxiLearn的测试准确率达到26.1% ± 0.7,显著优于MAXL(24.2% ± 0.8)和STL(22.6% ± 0.2)。
  • 在使用15%训练数据的STL-10数据集上,AuxiLearn达到81.42% ± 0.30的准确率,超过MAXL(81.37% ± 0.26)和STL(75.85% ± 0.32)。
  • 在CIFAR-10数据集上使用10%训练数据时,AuxiLearn达到76.75% ± 0.08的准确率,超过STL(72.63% ± 2.14)和MAXL(75.85% ± 0.32)。
  • 即使在使用ReLU等非光滑组件的情况下,该方法仍表现出稳定的优化与泛化性能,归因于非光滑点的零测度性质。
  • 理论分析表明,牛顿更新是预测哪些辅助任务能有效提升主任务的关键指标,为辅助任务设计提供了理论依据。
  • AuxiLearn在多种任务中(包括图像分割和少样本分类)均持续提升性能,尤其在低数据量场景下,其优势最为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。