Skip to main content
QUICK REVIEW

[论文解读] Invertible DenseNets with Concatenated LipSwish

Yura Perugachi-Diaz, Jakub M. Tomczak|VU Research Portal|Feb 4, 2021
Domain Adaptation and Few-Shot Learning参考文献 39被引用 10
一句话总结

本文提出可逆DenseNets(i-DenseNets),一种参数高效的基于流的生成模型,通过在密集残差块上施加Lipschitz约束来强制实现可逆性。通过引入可学习的串联LipSwish激活函数和加权特征串联机制,i-DenseNets在相同参数预算下,在CIFAR10和ImageNet32上的比特每维度(bits per dimension)任务中达到最先进性能,优于Residual Flows及其他基于流的模型,在密度估计和混合分类-生成建模任务中表现更优。

ABSTRACT

We introduce Invertible Dense Networks (i-DenseNets), a more parameter efficient extension of Residual Flows. The method relies on an analysis of the Lipschitz continuity of the concatenation in DenseNets, where we enforce invertibility of the network by satisfying the Lipschitz constant. Furthermore, we propose a learnable weighted concatenation, which not only improves the model performance but also indicates the importance of the concatenated weighted representation. Additionally, we introduce the Concatenated LipSwish as activation function, for which we show how to enforce the Lipschitz condition and which boosts performance. The new architecture, i-DenseNet, out-performs Residual Flow and other flow-based models on density estimation evaluated in bits per dimension, where we utilize an equal parameter budget. Moreover, we show that the proposed model out-performs Residual Flows when trained as a hybrid model where the model is both a generative and a discriminative model.

研究动机与目标

  • 通过将残差块概念扩展到密集连接层,开发一种比Residual Flows更参数高效的替代方案。
  • 通过推导串联操作的Lipschitz连续性界,确保在DenseNets中实现可逆性。
  • 通过引入可学习的加权串联机制,提升模型性能,突出重要特征表示。
  • 提出并集成串联LipSwish(CLipSwish)激活函数,增强信号保留并提升模型性能。
  • 在纯密度估计和混合判别-生成建模任务中评估i-DenseNets,证明在相同参数预算下性能更优。

提出的方法

  • 通过将变换层的谱范数约束在1以下,强制在DenseNet模块中实现可逆性,确保Lipschitz常数有界,并支持固定点反演。
  • 引入可学习的加权串联机制,在训练过程中动态分配特征的重要性,提升表征学习能力。
  • 提出串联LipSwish(CLipSwish)激活函数,源自LipSwish,具有更紧的Lipschitz界,相比标准LipSwish能保留更多信号。
  • 对所有层应用谱归一化,以维持Lipschitz条件,通过Banach不动点定理确保整个网络的可逆性。
  • 使用变量变换公式以可计算方式计算对数似然,通过无偏估计估计雅可比行列式,提升训练稳定性。
  • 使用标准对数似然目标进行训练,结合均匀去量化,支持密度估计和混合分类任务。

实验结果

研究问题

  • RQ1残差网络中的密集连接能否被适配以构建可逆流,同时保持参数效率?
  • RQ2如何在DenseNets中对串联操作施加Lipschitz条件以确保可逆性?
  • RQ3可学习的加权串联机制是否能提升基于流模型中的表征学习能力和模型性能?
  • RQ4与标准激活函数相比,CLipSwish激活函数是否能增强可逆网络中的信号保留和性能?
  • RQ5在相同参数预算下,i-DenseNet与Residual Flows在比特每维度和混合建模性能方面有何比较?

主要发现

  • 在相同参数预算下,i-DenseNets在CIFAR10和ImageNet32上的比特每维度任务中达到最先进性能,优于Residual Flows及其他基于流的模型。
  • 所提出的可学习加权串联机制提升了模型性能,并通过指示特定特征表示的重要性,增强了可解释性。
  • CLipSwish激活函数在i-DenseNets和Residual Flows中均显著提升性能,证明其通用性和有效性。
  • 更小的i-DenseNet架构表现优于更大的模型,表明深度本身并不能提升性能,架构效率至关重要。
  • 在混合建模任务中,λ=1的i-DenseNets在分类准确率和密度估计性能上均优于Residual Flows及其对应模型。
  • 该模型展现出强大的泛化能力,在多个数据集和设置下均取得性能提升,包括在计算可行时的更高分辨率数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。