[论文解读] An Integer Programming Approach to Deep Neural Networks with Binary Activation Functions
本文提出了一种混合整数线性规划(MILP)公式,用于训练具有二值激活函数(BDNN)的深度神经网络,通过经典整数规划求解器实现全局最优。该启发式变体在乳腺癌威斯康星数据集上的表现优于标准的ReLU-DNN,10次随机划分下准确率达到97.1%,而精确解法在大规模数据集上仍计算成本过高。
We study deep neural networks with binary activation functions (BDNN), i.e. the activation function only has two states. We show that the BDNN can be reformulated as a mixed-integer linear program which can be solved to global optimality by classical integer programming solvers. Additionally, a heuristic solution algorithm is presented and we study the model under data uncertainty, applying a two-stage robust optimization approach. We implemented our methods on random and real datasets and show that the heuristic version of the BDNN outperforms classical deep neural networks on the Breast Cancer Wisconsin dataset while performing worse on random data.
研究动机与目标
- 解决使用精确优化方法训练具有不可微分二值激活函数的深度神经网络的挑战。
- 通过将问题重新表述为混合整数线性规划(MILP),实现在BDNN训练中的全局最优。
- 开发一种启发式算法,以在精确解计算成本过高时实现BDNN的可扩展推理。
- 通过在MILP框架内采用两阶段鲁棒优化方法,提升对对抗性攻击的鲁棒性。
- 在合成数据集和真实世界数据集上评估BDNN的性能,并与标准ReLU-DNN进行比较。
提出的方法
- 将BDNN重新表述为混合整数线性规划(MILP),其中二值激活通过二值变量和大M约束进行建模。
- 该公式包含每层二值激活的可学习阈值λk,从而实现权重和阈值的端到端优化。
- 提出一种启发式算法,通过迭代固定二值变量并求解松弛后的MILP来计算局部最优解。
- 应用两阶段鲁棒优化模型以保护BDNN免受对抗性扰动影响,通过鲁棒对偶形式对输入数据中的不确定性进行建模。
- 使用列与约束生成算法求解鲁棒公式,但对较大实例收敛速度较慢。
- 所有模型均在随机数据和乳腺癌威斯康星数据集上实现并测试,性能与标准ReLU-DNN进行对比。
实验结果
研究问题
- RQ1是否可以使用混合整数规划精确训练具有可学习阈值的二值深度神经网络?
- RQ2在真实世界数据集上,基于精确MILP的BDNN与标准ReLU-DNN相比性能如何?
- RQ3BDNN的启发式算法能否在计算可行的前提下实现比标准DNN更高的准确率?
- RQ4两阶段鲁棒优化方法在多大程度上可提升BDNN的对抗性鲁棒性?
- RQ5BDNN对数据分布和超参数选择的敏感度如何,特别是在稳定性与泛化能力方面?
主要发现
- 在乳腺癌威斯康星数据集上,启发式BDNN在10次随机数据划分中达到最高97.1%的准确率,优于标准DNN的最高91.4%。
- 在同一数据集上,当d₁=25时,启发式BDNN单次运行达到95.0%的准确率,超过DNN的91.4%。
- 精确BDNN求解器在BCW数据集上找到了最优解,最优性间隙为0.0%,但运行时间显著长于启发式方法。
- 在随机数据集上,精确和启发式BDNN的准确率均低于DNN且波动更大,表明在合成数据上泛化能力较差。
- 精确和启发式BDNN方法的运行时间随样本数量线性增长,导致在包含数百万样本的大规模数据集上不可行。
- 对于d₁=20且含20个样本的实例,鲁棒BDNN公式在24小时内未完成求解,表明两阶段鲁棒问题存在可扩展性问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。