QUICK REVIEW
[论文解读] Processing of missing data by neural networks
Marek Śmieja, Łukasz Struski|arXiv (Cornell University)|May 18, 2018
Neural Networks and Applications参考文献 34被引用 68
一句话总结
该论文提出一种通用、理论上可证实的方法,通过将第一隐藏层神经元的响应替换为其在缺失数据密度上的期望来处理神经网络中的缺失数据,从而在数据不完整的情况下进行训练,并在某些基于插补的方法上取得了更好的性能。
ABSTRACT
We propose a general, theoretically justified mechanism for processing missing data by neural networks. Our idea is to replace typical neuron's response in the first hidden layer by its expected value. This approach can be applied for various types of networks at minimal cost in their modification. Moreover, in contrast to recent approaches, it does not require complete data for training. Experimental results performed on different types of architectures show that our method gives better results than typical imputation strategies and other methods dedicated for incomplete data.
研究动机与目标
- 动机并形式化神经网络在不完整数据中学习的挑战。
- 提出一种通过受观察子空间限制的条件密度来表示缺失数据的概率表示。
- 将第一层神经元的激活推广到对概率分布而非具体输入进行运算。
- 证明所提出的广义化能够保持信息并实现通用逼近性质。
- 在真实数据集上的自编码器、MLP和RBF网络上展示实际有效性。
提出的方法
- 用在对应于观测坐标的仿射子空间 S 上的条件密度 F_S 来表示每个不完整数据点 (x, J)。
- 用对角高斯混合模型(GMM)来建模缺失数据密度 F,并应用正则化以计算条件密度 F_S。
- 将第一层神经元的激活推广为计算期望输出 n(F_S) 而不是为完整数据时的 n(x)。
- 在高斯混合输入下推导广义 ReLU 和 RBF 激活的闭式表达(定理 3.1 和 定理 3.2)。
- 解释如何通过在训练中联合学习 GMM 参数与网络权重来端到端训练,使用不完整数据进行训练。
- 论证并勾画一个通用逼近结果,表明采用广义激活的 ReLU 基网络仍然保持对度量的可辨识性(定理 4.1)。
实验结果
研究问题
- RQ1神经网络如何在不对缺失值进行单值插补的情况下处理缺失数据?
- RQ2我们能否通过概率密度来表示缺失数据并在无需重大架构改动的情况下将其在网络中传播?
- RQ3广义的第一层激活是否保留实现通用函数逼近所需的信息?
- RQ4使用所提出的基于密度的方法对不完整数据进行训练,与标准插补和上下文编码器方法相比如何?
主要发现
- 该方法使神经网络能够在仅包含不完整样本的数据集上进行训练,避免对完整数据的需求。
- 在高斯混合输入下的广义 ReLU 和 RBF 激活可以通过闭式表达来计算,便于实际实现。
- 在自编码器、MLP 和 RBF 网络上的实验结果显示相对于标准插补和某些基线方法具有良好性能。
- 在基于 MNIST 的重建中,所提方法比 k-NN、均值插补、 dropout 以及某些上下文编码器基线得到更清晰的结果和更低的误差。
- 在 ESR EEG 数据上,该方法达到有竞争力的准确性,通常优于传统插补技术,并在不完整训练数据情况下达到与上下文编码器相当的性能。
- 在若干带有内部缺失属性的 UCI 数据集上,该方法经常优于传统插补和直接核方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。