Skip to main content
QUICK REVIEW

[论文解读] Meta-Learning Multi-task Communication

Pengfei Liu, Xuanjing Huang|arXiv (Cornell University)|Oct 23, 2018
Domain Adaptation and Few-Shot Learning参考文献 25被引用 7
一句话总结

本文提出元学习多任务通信(Meta-Learning Multi-task Communication),一种通过允许任务在隐藏表示和梯度之间交换信息来增强多任务学习的框架,从而减少共享空间中的特征纠缠。通过引入梯度传递,该方法提高了参数一致性与共享表示的纯净度,进而在自然语言处理和视觉基准测试的内任务与零样本任务设置中均取得更优性能。

ABSTRACT

In this paper, we describe a general framework: Parameters Read-Write Networks (PRaWNs) to systematically analyze current neural models for multi-task learning, in which we find that existing models expect to disentangle features into different spaces while features learned in practice are still entangled in shared space, leaving potential hazards for other training or unseen tasks. We propose to alleviate this problem by incorporating an inductive bias into the process of multi-task learning, that each task can keep informed of not only the knowledge stored in other tasks but the way how other tasks maintain their knowledge. In practice, we achieve above inductive bias by allowing different tasks to communicate by passing both hidden variables and gradients explicitly. Experimentally, we evaluate proposed methods on three groups of tasks and two types of settings ( extsc{in-task} and extsc{out-of-task}). Quantitative and qualitative results show their effectiveness.

研究动机与目标

  • 为解决多任务学习中的'假装共享'问题,即尽管理论上期望解耦,共享表示仍与特定任务特征纠缠。
  • 提出一种通用框架——参数读写网络(Parameters Read-Write Networks, PRaWNs),以统一并分析现有多任务学习模型。
  • 引入归纳偏置,使任务不仅能学习共享知识,还能通过显式梯度交换学习其他任务如何维护其知识。
  • 通过在任务间强制一致的参数更新,提升模型在内任务与零样本任务设置下的泛化能力与鲁棒性。

提出的方法

  • 提出参数读写网络(PRaWNs)作为统一框架,用于建模与分析现有多任务学习架构。
  • 在前向与反向传播过程中引入任务间的显式梯度传递,使任务能够感知彼此的参数更新方向。
  • 采用两种通信机制:成对梯度传递与列表式梯度传递,后者引入任务相关性以提升一致性。
  • 在优化过程中施加一致性约束,防止私有特征污染共享空间。
  • 使用主成分分析(PCA)可视化参数演化过程,表明所提模型中共享参数更一致地整合了私有更新。
  • 采用显著性评分 $ q $ 进行神经元激活分析,以评估共享层中哪些词被识别为有用特征。

实验结果

研究问题

  • RQ1任务间显式梯度交换在多任务学习中如何影响共享表示的纯净度与一致性?
  • RQ2梯度传递在多大程度上可减少共享参数空间中特定任务特征的纠缠?
  • RQ3与标准多任务学习基线相比,所提方法是否能提升对未见任务(零样本任务设置)的泛化能力?
  • RQ4在梯度通信中引入任务相关性(列表式 vs. 成对式)对模型性能与表示质量有何影响?
  • RQ5从共享层的神经元级激活模式中,可获得关于特征共享与解耦的哪些洞见?

主要发现

  • 所提方法PGP-SR通过整合私有梯度方向,在共享空间中实现更一致的参数更新,减少了特定任务特征的污染。
  • 在参数演化可视化中,PGP-SR的共享参数在冲突的私有更新之间保持平衡路径,而SR基线则沿单一主导方向移动。
  • 在共享层分析中,LGP-SR正确识别出'excellent'与'doesnt'等高质量共享特征,而SR基线错误地将'task-specific'词汇如'Brosnan'与'sauce'分配至共享空间。
  • 对于 $ \overline{\bigcap_{i}^{5}V_{i}} $ 中的未登录词,LGP-SR更好地保留了共享语义,识别出'dissatisfied'与'overlong'为相关特征,而SR则将大量特定任务术语误判为共享。
  • 定量结果表明,该方法在三类多任务学习组别及两种设置(内任务与零样本任务)中均表现更优,证实了基于梯度通信的有效性。
  • 定性分析显示,所提方法下共享层的神经元在识别共享语言模式方面更具选择性且语义更一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。