Skip to main content
QUICK REVIEW

[论文解读] An approach to dealing with missing values in heterogeneous data using k-nearest neighbors

Davi E. N. Frossard, Igor O. Nunes|arXiv (Cornell University)|Aug 13, 2016
Statistical Methods and Inference参考文献 15被引用 6
一句话总结

本文提出了一种用于异质数据的k-最近邻(k-NN)插补方法,通过使用定制的距离度量处理清晰值、区间值和模糊值。在小型数据集上,该方法实现了较低的均方误差(MSE),即使在混合数据类型存在缺失值的情况下也表现出稳健的性能。

ABSTRACT

Techniques such as clusterization, neural networks and decision making usually rely on algorithms that are not well suited to deal with missing values. However, real world data frequently contains such cases. The simplest solution is to either substitute them by a best guess value or completely disregard the missing values. Unfortunately, both approaches can lead to biased results. In this paper, we propose a technique for dealing with missing values in heterogeneous data using imputation based on the k-nearest neighbors algorithm. It can handle real (which we refer to as crisp henceforward), interval and fuzzy data. The effectiveness of the algorithm is tested on several datasets and the numerical results are promising.

研究动机与目标

  • 解决包含清晰值、区间值和模糊值等混合数据类型的现实世界数据集中缺失值的挑战。
  • 克服传统插补方法(如均值替代或列表删除)可能引入偏差的局限性。
  • 通过为每种数据类型定义适当的距离度量,将k-NN插补框架扩展至异质数据。
  • 在因过拟合风险而插补尤为困难的小型现实世界决策数据集上评估该方法。
  • 证明所提出方法在存在缺失值的情况下维持数据可靠性的有效性与鲁棒性。

提出的方法

  • 使用标准欧几里得距离定义清晰数值的距离度量:$ d(a,b) = \sqrt{(a-b)^2} $。
  • 将区间数的距离度量定义为 $ d(\bar{a},\bar{b}) = \frac{1}{2}\sqrt{(a^L - b^L)^2 + (a^U - b^U)^2} $,将区间视为二维点。
  • 使用隶属函数之间的Hausdorff距离定义三角模糊数(TFNs)的距离度量,以实现对模糊值的比较。
  • 通过基于复合距离度量识别k个最近邻,然后计算其非缺失值的加权平均值,实现k-NN插补。
  • 使用基于逆距离的归一化权重计算插补值:$ \text{imputed} = \sum_{i=1}^{k} w_i \cdot x_i $,其中 $ w_i $ 为归一化的逆距离。
  • 迭代应用该方法以处理数据集中多个缺失值,后续迭代中使用已插补的值以提高准确性。

实验结果

研究问题

  • RQ1基于k-NN的插补方法能否有效同时处理包含清晰值、区间值和模糊值的混合数据类型数据集?
  • RQ2在存在缺失值的小型数据集中,该方法在插补准确性方面表现如何,尤其是在过拟合风险较高的情况下?
  • RQ3该方法在不同邻居数(k)和不同数据类型下是否能保持较低的均方误差(MSE)?
  • RQ4与标准k-NN插补方法相比,该方法在异质数据上的性能如何?
  • RQ5该方法是否对数据集中缺失值数量的增加具有鲁棒性,特别是在小规模决策矩阵中?

主要发现

  • 在小型决策矩阵中插补一到三个缺失值时,所提k-NN插补方法的均方误差(MSE)约为 $ 1.2 \times 10^{-2} $,表现出优异性能。
  • 在更大的多准则决策(MCDM)数据集中,当k=1时MSE最低,为 $ 1 \times 10^{-2} $,当k=2时MSE最高,为 $ 1.9 \times 10^{-2} $,表明对k值敏感但整体表现稳定。
  • 在具有多个缺失值的五行MCDM矩阵中,当k=4时MSE最低,为 $ 5.1 \times 10^{-3} $,当k=1时MSE最高,为 $ 5.8 \times 10^{-3} $,表明具有高准确性和鲁棒性。
  • 该方法对邻居数(k)不敏感,在不同k值下均保持一致的性能,这是实际应用中的关键优势。
  • 插补结果与同类型同质数据集报告的结果处于同一数量级,证实了该方法在异质数据上的有效性。
  • 在一项案例研究中,该算法成功重建了缺失的模糊值,与原始值的距离为0.0718,表明插补具有高保真度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。