[论文解读] Parameter Transfer Unit for Deep Neural Networks
本文提出参数迁移单元(PTU),一种可学习的、可微分的模块,可在源域和目标域的深度神经网络之间实现细粒度、数据驱动的参数迁移。通过使用两个自适应门控机制在激活层面控制可迁移性,PTU 在卷积神经网络(CNNs)和循环神经网络(RNNs)中均优于启发式方法(如参数共享和微调),在低资源设置下实现了显著的准确率提升。
Parameters in deep neural networks which are trained on large-scale databases can generalize across multiple domains, which is referred as "transferability". Unfortunately, the transferability is usually defined as discrete states and it differs with domains and network architectures. Existing works usually heuristically apply parameter-sharing or fine-tuning, and there is no principled approach to learn a parameter transfer strategy. To address the gap, a parameter transfer unit (PTU) is proposed in this paper. The PTU learns a fine-grained nonlinear combination of activations from both the source and the target domain networks, and subsumes hand-crafted discrete transfer states. In the PTU, the transferability is controlled by two gates which are artificial neurons and can be learned from data. The PTU is a general and flexible module which can be used in both CNNs and RNNs. Experiments are conducted with various network architectures and multiple transfer domain pairs. Results demonstrate the effectiveness of the PTU as it outperforms heuristic parameter-sharing and fine-tuning in most settings.
研究动机与目标
- 解决现有迁移学习中启发式、离散参数迁移策略(如冻结、微调、共享)的局限性。
- 在激活层面而非层或模块层面,实现对参数可迁移性的细粒度、可学习控制。
- 开发一种通用、即插即用的模块,兼容卷积神经网络(CNNs)和循环神经网络(RNNs),以提升迁移学习的效率与性能。
- 通过端到端学习最优迁移策略,消除对离散迁移状态(如冻结、微调)进行昂贵超参数搜索的需求。
提出的方法
- PTU 是一种可微分模块,可计算源域和目标域网络激活值的非线性加权组合。
- 其采用两个可学习门控:微调门用于将源域激活适配到目标域,更新门用于控制是否从源域迁移参数。
- 门控通过具有可学习权重的神经元实现,支持迁移策略的端到端训练。
- PTU 插入在源网络与目标网络对应层之间,支持灵活集成到现有架构中。
- 该方法通过学习连续、自适应的迁移策略,涵盖传统离散迁移状态(如冻结、微调)。
- 整个模型使用标准优化方法进行端到端训练,迁移策略从数据中自动学习,无需人工调参。
实验结果
研究问题
- RQ1可学习的连续参数迁移策略是否能优于冻结或微调等启发式离散迁移状态?
- RQ2PTU 在标签数据稀缺的低资源领域中是否能提升迁移学习性能?
- RQ3PTU 是否可在无需架构修改的情况下有效应用于不同网络结构(如 CNNs 和 RNNs)?
- RQ4与标准微调和参数共享相比,PTU 在优化效率和泛化能力方面表现如何?
- RQ5PTU 是否能减少对迁移策略进行大规模超参数搜索的需求?
主要发现
- 在所有评估设置中,PTU 均优于参数共享和微调方法,在基于 RNN 的字符识别任务中,相对准确率提升范围为 6.86% 至 35.43%。
- 在 RNN 实验中,NoTL 模型在 5 个目标领域中有 4 个的表现劣于 K-NN 基线,凸显了低资源学习的挑战。
- PTU 模型达到了最高的验证准确率,并表现出对过拟合的强鲁棒性,验证准确率在训练过程中未出现下降。
- 即使在某些设置中学习率比 FT 模型大 10 倍,PTU 仍收敛更快且泛化性能更优。
- PTU 的优化动态表现出快速损失下降和验证准确率早期饱和,表明其学习效率高。
- 该方法在多个迁移领域对和网络架构中均表现出一致的性能提升,验证了其泛化能力与灵活性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。