Skip to main content
QUICK REVIEW

[论文解读] DNN2LR: Interpretation-inspired Feature Crossing for Real-world Tabular Data

Zhaocheng Liu, Qiang Liu|arXiv (Cornell University)|Aug 22, 2020
Video Analysis and Summarization参考文献 67被引用 4
一句话总结

DNN2LR 提出了一种新颖的方法,通过利用深度神经网络(DNN)中的解释不一致性,自动生成全局可解释的交叉特征用于逻辑回归。通过识别由隐藏层交互作用引起的局部解释不一致的特征,该方法构建了一个紧凑的交叉特征候选集,使简单的 LR 模型在真实世界表格数据集上以高效率超越复杂 DNN 和最先进的特征交叉方法。

ABSTRACT

For sake of reliability, it is necessary for models in real-world applications to be both powerful and globally interpretable. Simple classifiers, e.g., Logistic Regression (LR), are globally interpretable, but not powerful enough to model complex nonlinear interactions among features in tabular data. Meanwhile, Deep Neural Networks (DNNs) have shown great effectiveness for modeling tabular data, but is not globally interpretable. In this work, we find local piece-wise interpretations in DNN of a specific feature are usually inconsistent in different samples, which is caused by feature interactions in the hidden layers. Accordingly, we can design an automatic feature crossing method to find feature interactions in DNN, and use them as cross features in LR. We give definition of the interpretation inconsistency in DNN, based on which a novel feature crossing method called DNN2LR is proposed. Extensive experiments have been conducted on four public datasets and two real-world datasets. The final model, i.e., a LR model empowered with cross features, generated by DNN2LR can outperform the complex DNN model, as well as several state-of-the-art feature crossing methods. The experimental results strongly verify the effectiveness and efficiency of DNN2LR, especially on real-world datasets with large numbers of feature fields.

研究动机与目标

  • 解决真实世界表格数据应用中模型性能与全局可解释性之间的权衡问题。
  • 克服逻辑回归(LR)在无需手动特征工程的情况下捕捉复杂非线性特征交互的局限性。
  • 开发一种高效、自动的特征交叉方法,在保持可解释性的同时实现 DNN 级别的性能。
  • 识别并利用 DNN 中的解释不一致性作为发现有意义特征交互的信号。
  • 生成一个紧凑且高质量的交叉特征候选集,以实现 LR 模型的有效且高效的训练。

提出的方法

  • 将 DNN 中的解释不一致性定义为某一特征在不同输入样本中基于梯度的局部解释之间的差异,这种差异由隐藏层的特征交互引起。
  • 在完整训练集上训练 DNN 以学习复杂特征交互,并通过基于梯度的显著性图提取局部解释。
  • 对于每个验证样本,通过计算不同样本间梯度的方差,为每个特征计算解释不一致性得分。
  • 筛选出不一致性较高的特征(高于分位数阈值 η),以识别特征交叉的候选。
  • 从筛选后的特征中构建全局的二阶及更高阶交叉特征字段候选集,限制为 ε = 3N 或 5N,以确保效率。
  • 在候选集上训练逻辑回归模型,并基于验证集上特征的贡献度对交叉特征进行排序,以选择最终的有用交叉特征集合。

实验结果

研究问题

  • RQ1DNN 中的解释不一致性能否作为识别有意义特征交互以生成交叉特征的可靠信号?
  • RQ2在真实世界数据集上,DNN2LR 与最先进的特征交叉方法(如 AutoCross 和 AutoFM)相比,在性能和效率方面如何?
  • RQ3分位数阈值 η 和候选集大小 ε 等超参数对 DNN2LR 性能和鲁棒性有何影响?
  • RQ4经过 DNN2LR 生成的交叉特征增强的简单 LR 模型能否在准确率和泛化能力方面超越复杂的 DNN 模型?
  • RQ5DNN2LR 在具有大量特征字段的数据集上,特别是在真实世界应用中,其可扩展性如何?

主要发现

  • DNN2LR 生成的交叉特征使简单的逻辑回归模型在全部四个公开数据集和两个真实世界数据集上均优于复杂 DNN 模型,展现出更优的泛化能力和性能。
  • 在具有大量特征字段的真实世界数据集上,DNN2LR 的运行时间相比 AutoCross 和 AutoFM 缩短了 6 倍至 50 倍,凸显其高效性。
  • 该方法在不同超参数设置下均表现出稳定性能,尤其在 η = 5% 且 ε = 3N(或小数据集时为 5N)时,表明其具有鲁棒性且对参数不敏感。
  • 最终模型仅使用 3N 到 5N 个候选交叉特征,远少于完整的组合空间,证明了该方法的高效性和可扩展性。
  • 二阶交叉特征比高阶特征更常见,但高阶特征仍对性能提升有贡献,表明特征交互存在重要性层级。
  • 在仅含 9 个特征的 Employee 数据集上,DNN2LR 在 ε = 5N 时表现出相对性能提升,表明其在低维设置下也具备适应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。