[论文解读] Hyper-Representations as Generative Models: Sampling Unseen Neural Network Weights
本文提出了一种新颖的生成框架,通过在神经网络权重群体上进行自监督自编码训练所学习到的超表示(hyper-representations),在单次前向传播中采样出高性能且多样化的神经网络权重。通过引入逐层损失归一化和拓扑感知采样策略,该方法在多个图像数据集上的模型初始化、集成采样和迁移学习任务中均优于基线方法。
Learning representations of neural network weights given a model zoo is an emerging and challenging area with many potential applications from model inspection, to neural architecture search or knowledge distillation. Recently, an autoencoder trained on a model zoo was able to learn a hyper-representation, which captures intrinsic and extrinsic properties of the models in the zoo. In this work, we extend hyper-representations for generative use to sample new model weights. We propose layer-wise loss normalization which we demonstrate is key to generate high-performing models and several sampling methods based on the topology of hyper-representations. The models generated using our methods are diverse, performant and capable to outperform strong baselines as evaluated on several downstream tasks: initialization, ensemble sampling and transfer learning. Our results indicate the potential of knowledge aggregation from model zoos to new models via hyper-representations thereby paving the avenue for novel research directions.
研究动机与目标
- 在无需访问训练数据或标签的情况下,从模型库中生成新颖且高性能的神经网络权重。
- 通过提升重建质量和泛化能力,解决从超表示生成功能性模型的挑战。
- 开发利用超表示空间的几何与拓扑结构的采样方法,以实现多样化且高效的权重生成。
- 证明超表示可作为神经网络权重的通用生成模型,适用于下游各类任务。
- 在无需重新训练超表示的前提下,实现对未见架构和潜在因子的条件化权重生成。
提出的方法
- 在模型库中提取的展平权重向量上训练自监督自编码器,利用多头自注意力机制学习低维超表示。
- 在重建损失中引入逐层损失归一化,以稳定训练过程并提升解码权重的质量。
- 采用对称的编码器-解码器架构,结合可学习的标记嵌入和位置编码,以建模序列化的神经元表示。
- 应用多目标损失函数,结合均方误差(MSE)和对比损失,以增强潜在空间中的解耦性和鲁棒性。
- 设计基于超表示空间拓扑结构的采样策略,实现在单次前向传播中生成多样化且高性能的权重。
- 通过在学习到的超表示空间内插值或投影,实现对潜在因子或未见架构的条件化采样。
实验结果
研究问题
- RQ1在模型库上训练的超表示能否有效扩展为用于采样新颖、功能性神经网络权重的生成模型?
- RQ2与标准重建损失相比,逐层损失归一化在提升生成模型质量和性能方面有何改善作用?
- RQ3在超表示空间中采用拓扑感知采样策略,能在多大程度上生成多样化且高性能的模型,且适用于不同下游任务?
- RQ4所提出的方法能否在模型初始化、集成采样和迁移学习中均优于随机初始化和基线方法?
- RQ5超表示能否在无需重新训练的情况下,用于生成未见架构的权重?其条件化生成的有效性如何?
主要发现
- 逐层损失归一化显著提升了解码权重的质量,使得生成的模型在下游任务中表现良好。
- 所提出的采样方法能够生成多样化且性能优越的模型群体,其准确率高于随机初始化和基线超表示方法。
- 生成的模型在模型初始化、集成采样和迁移学习任务中均优于强基线方法,在四个图像数据集上均观察到性能提升。
- 即使在未见架构上,采样生成的模型在微调和迁移学习过程中仍能更快收敛,并实现统计上显著的性能提升。
- 该方法可在不重新训练超表示的前提下,实现对潜在因子和未见架构的条件化权重生成,展现出良好的泛化能力与灵活性。
- 该方法仅需一次前向传播即可实现高性能,具有高效且可扩展的优势,适用于模型生成与知识蒸馏等实际部署场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。