Skip to main content
QUICK REVIEW

[论文解读] Flexible Multi-task Networks by Learning Parameter Allocation

Krzysztof Maziarz, Efi Kokiopoulou|arXiv (Cornell University)|Oct 10, 2019
Domain Adaptation and Few-Shot Learning参考文献 31被引用 8
一句话总结

该论文提出了一种灵活的多任务学习框架,通过使用Gumbel-Softmax重参数化技术,利用可微分的二值分配变量来学习细粒度的参数共享模式。通过联合优化特定任务的组件分配与模型参数,该方法在Omniglot数据集上相比最先进方法实现了17%的相对误差降低,能够根据任务相关性动态调整共享策略。

ABSTRACT

This paper proposes a novel learning method for multi-task applications. Multi-task neural networks can learn to transfer knowledge across different tasks by using parameter sharing. However, sharing parameters between unrelated tasks can hurt performance. To address this issue, we propose a framework to learn fine-grained patterns of parameter sharing. Assuming that the network is composed of several components across layers, our framework uses learned binary variables to allocate components to tasks in order to encourage more parameter sharing between related tasks, and discourage parameter sharing otherwise. The binary allocation variables are learned jointly with the model parameters by standard back-propagation thanks to the Gumbel-Softmax reparametrization method. When applied to the Omniglot benchmark, the proposed method achieves a 17% relative reduction of the error rate compared to state-of-the-art.

研究动机与目标

  • 为解决当任务无关时多任务学习中的负迁移问题,即共享参数会降低单个任务性能的情况。
  • 实现自动且自适应的参数共享,反映任务相关性,而非依赖于固定或手动设计的共享模式。
  • 通过聚合网络组件上的二值分配模式,学习稀疏且可解释的任务嵌入。
  • 使用标准反向传播联合优化模型参数与分配决策,避免昂贵的搜索或启发式调参。

提出的方法

  • 该框架将每个网络层建模为一组可重用组件(例如卷积滤波器),并通过可学习的二值分配变量将每个组件分配给任务。
  • 二值分配变量通过Gumbel-Softmax重参数化技巧实现可微分,从而支持使用标准反向传播进行端到端训练。
  • 该方法通过温度控制的Gumbel-Softmax引入预算约束,促进组件分配的稀疏性,从而鼓励高效且可解释的共享。
  • 为每个任务在已分配组件的输出上附加特定任务头,使每个任务能够使用网络组件的独特子集。
  • 分配logits与模型权重一起通过一个平衡任务特定损失与稀疏性正则化的目标函数进行联合训练。
  • 训练完成后,提取每个任务的二值分配向量,形成反映任务相关性的稀疏嵌入。

实验结果

研究问题

  • RQ1神经网络能否根据任务相关性动态分配组件给任务,从而在性能上超越固定共享模式?
  • RQ2所提出的方法是否能缓解任务无关时多任务学习中的负迁移问题?
  • RQ3所学习的二值分配模式能否形成有意义且可解释的任务嵌入,以反映潜在的任务相似性?
  • RQ4在具有不同程度任务相关性的基准测试中,该方法与强基线及最先进方法相比表现如何?
  • RQ5该框架能否用于发现多任务数据集中隐藏的结构,例如相关任务的聚类?

主要发现

  • 在Omniglot基准上,所提方法相比最先进方法实现了17%的相对误差降低,证明了其优越的泛化能力。
  • 在合成实验中,该方法成功避免了在无关任务(ρ=0)上的负迁移,优于“共享底座”和“无共享”模式。
  • 所学习的二值分配向量形成了稀疏且可解释的嵌入,准确反映了已知的任务聚类:所有MNIST任务获得相同的嵌入,Fashion-MNIST任务也表现出类似分组。
  • 任务嵌入之间的成对余弦相似度能清晰区分三个聚类(CIFAR、MNIST、Fashion-MNIST),其中MNIST与Fashion-MNIST的相似度高于任一与CIFAR的相似度。
  • 在CIFAR-100聚类内部,该方法学习到了多样的分配模式,表明其能够捕捉聚类内部的多样性,同时与其他聚类保持清晰分离。
  • 该框架无需访问任务组成信息即可发现任务结构,仅依赖训练期间的任务ID。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。