Skip to main content
QUICK REVIEW

[论文解读] Modular Universal Reparameterization: Deep Multi-task Learning Across Diverse Domains

Elliot Meyerson, Risto Miikkulainen|arXiv (Cornell University)|May 31, 2019
Domain Adaptation and Few-Shot Learning被引用 12
一句话总结

本文提出模块化通用重参数化(MUiR),通过将任务分解为伪任务,并优化一个模块化超网络以将这些任务映射到共享的可重用组件,从而在不同深度学习架构(如视觉、自然语言处理和基因组学模型)之间共享学习到的功能。MUiR在所有评估任务中均达到最先进性能,表明即使在无架构重叠的情况下,跨架构的知识共享也是有效的。

ABSTRACT

As deep learning applications continue to become more diverse, an interesting question arises: Can general problem solving arise from jointly learning several such diverse tasks? To approach this question, deep multi-task learning is extended in this paper to the setting where there is no obvious overlap between task architectures. The idea is that any set of (architecture,task) pairs can be decomposed into a set of potentially related subproblems, whose sharing is optimized by an efficient stochastic algorithm. The approach is first validated in a classic synthetic multi-task learning benchmark, and then applied to sharing across disparate architectures for vision, NLP, and genomics tasks. It discovers regularities across these domains, encodes them into sharable modules, and combines these modules systematically to improve performance in the individual tasks. The results confirm that sharing learned functionality across diverse domains and architectures is indeed beneficial, thus establishing a key ingredient for general problem solving in the future.

研究动机与目标

  • 实现无架构重叠的深度学习模型之间的有效知识共享,例如视觉、自然语言处理和基因组学任务。
  • 解决在缺乏先前对齐的情况下,传统多任务学习方法因架构差异而失效的参数对齐挑战。
  • 开发一种框架,通过将任务统一分解为伪任务,发现并利用跨多样化领域间的隐式规律。
  • 验证通过MUiR训练的共享模块是否能在不同领域间泛化,并提升单个任务的性能。
  • 通过在异构问题类型间实现模块化、可重用的知识迁移,为人工智能的一般问题求解奠定基础。

提出的方法

  • 将每个(架构,任务)对分解为一组细粒度且大小相等的伪任务,以实现结构化的知识共享。
  • 引入一个超网络(超模块),根据来自伪任务和架构的上下文向量生成特定于任务的参数。
  • 使用一种随机优化算法(1+λ-ES)联合训练超模块和特定于任务的模型,以优化伪任务与模块之间的映射。
  • 采用一种新颖的初始化策略(分离初始化),确保模块不偏向任何特定任务或架构,从而提升泛化能力。
  • 引入上下文大小超参数 $ c $,允许在超模块中使用位置相关的上下文,从而实现更精细的参数共享。
  • 采用模块化重参数化方案,其中共享的超模块被训练以解决多个伪任务,性能通过下游任务指标进行评估。

实验结果

研究问题

  • RQ1在无架构重叠的深度学习模型(如CNN、LSTM和1D-CNN)之间,是否能有效共享学习到的功能?
  • RQ2将任务统一分解为伪任务是否能实现跨多样化领域的有效且可扩展的知识迁移?
  • RQ3初始化策略的选择如何影响跨架构学习中共享模块的性能与泛化能力?
  • RQ4超模块中上下文大小对跨多样化任务的参数共享有效性有何影响?
  • RQ5当应用于真实世界中高度调优的模型(如AWD-LSTM)时,MUiR是否能超越现有的多任务学习基线方法?

主要发现

  • MUiR在所有任务中均优于经典多任务学习和基于适配器的方法,在LeNet上达到20.51的测试误差,在Stacked LSTM上达到130.70的困惑度,在DeepBind上达到0.1464的AUC。
  • 该方法将LSTM参数从19.8M减少至8.8M,同时保持与原始AWD-LSTM基线相当的性能,证明了在调优设置下高效参数共享的可行性。
  • 采用分层初始化的性能优于标准基线,但仍不及MUiR的分离初始化,证实了所提出训练方案的价值。
  • 具有上下文大小 $ c > 0 $ 的超模块显著优于 $ c = 0 $ 的情况,表明位置相关的上下文对有效共享至关重要。
  • 该框架实现了结构化、与架构相关的共享动态,频繁共享的模块表现出更高的泛化能力。
  • MUiR在视觉、自然语言处理和基因组学任务中均达到最先进结果,证实了跨领域、跨架构知识共享的可行性与有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。