[论文解读] Interpreting and Boosting Dropout from a Game-Theoretic View
本文从博弈论角度解释了Dropout,证明其能抑制深度神经网络(DNNs)中的特征交互强度,而这种强度与过拟合密切相关。本文提出了一种交互损失,显式惩罚高阶交互,相比Dropout具有可控正则化能力,并与批量归一化兼容,尤其在更深的网络中表现更优。
This paper aims to understand and improve the utility of the dropout operation from the perspective of game-theoretic interactions. We prove that dropout can suppress the strength of interactions between input variables of deep neural networks (DNNs). The theoretic proof is also verified by various experiments. Furthermore, we find that such interactions were strongly related to the over-fitting problem in deep learning. Thus, the utility of dropout can be regarded as decreasing interactions to alleviate the significance of over-fitting. Based on this understanding, we propose an interaction loss to further improve the utility of dropout. Experimental results have shown that the interaction loss can effectively improve the utility of dropout and boost the performance of DNNs.
研究动机与目标
- 通过输入特征之间的博弈论交互视角,理解Dropout的正则化机制。
- 研究DNN中特征交互与过拟合问题之间的关系。
- 开发一种新的正则化方法——交互损失,显式控制交互强度以改善泛化性能。
- 证明交互损失在性能和与批量归一化的兼容性方面优于Dropout。
提出的方法
- 本文使用博弈论中的Shapley值定义特征交互,衡量当一个输入变量被屏蔽时,另一个变量重要性的变化。
- 数学上证明了Dropout通过以0.5的概率独立采样特征,降低了交互强度,该过程与Banzhaf值的计算一致。
- 提出一种交互损失,用于在训练过程中显式惩罚高阶交互,使用超参数λ控制正则化强度。
- 将交互损失应用于低层次卷积特征,这些特征的交互影响最为显著,并证明其与批量归一化兼容。
- 该方法将总交互分解为按阶数划分的分量,并可视化出强交互的输入区域。
- 实验在多个数据集(CIFAR-10、Tiny ImageNet、CelebA)和网络架构(AlexNet、VGG、ResNet)上对比了交互损失与Dropout。
实验结果
研究问题
- RQ1在深度神经网络中,Dropout如何影响输入特征之间交互的强度?
- RQ2DNN中特征交互与过拟合问题之间存在何种关系?
- RQ3我们能否设计一种正则化方法,显式控制交互强度以改善泛化性能?
- RQ4在性能和与批量归一化的兼容性方面,交互损失与Dropout相比如何?
主要发现
- Dropout通过以0.5的概率独立采样特征,降低了输入特征之间的交互强度,该过程在数学上等价于计算Banzhaf值。
- 过拟合样本的特征交互强度显著强于干净样本,证实了高阶交互与过拟合之间的关联。
- 在ResNet-18上,交互损失优于Dropout,在Tiny ImageNet上达到94.6%的准确率,而Dropout仅为92.1%;在CelebA上分别达到92.1%与91.5%。
- 当λ参数被合理调优时,交互损失在所有评估的模型和数据集上均获得比Dropout更高的测试准确率。
- 交互损失与批量归一化兼容,而Dropout在使用批量归一化时会降低准确率——在Tiny ImageNet上降低1.4%,在CelebA上降低0.6%。
- 当交互损失应用于低层次卷积特征时,抑制效果最显著,而在高层次全连接层中效果较弱。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。