[论文解读] Nearest Neighbor Imputation for Categorical Data by Weighting of Attributes
本文提出了一种新颖的加权最近邻插补方法 wNNSel_cat,用于分类数据,通过基于核函数的距离度量利用属性关联。通过根据属性关联对属性加权,该方法相比现有方法降低了插补误差,其中 wNNSel_dum(使用虚拟变量和相关性)在多分类数据上表现优于 wNNSel_cat,尤其在 DNA 启动子和淋巴图谱等真实数据集中表现更优。
Missing values are a common phenomenon in all areas of applied research. While various imputation methods are available for metrically scaled variables, methods for categorical data are scarce. An imputation method that has been shown to work well for high dimensional metrically scaled variables is the imputation by nearest neighbor methods. In this paper, we extend the weighted nearest neighbors approach to impute missing values in categorical variables. The proposed method, called $\mathtt{wNNSel_{cat}}$, explicitly uses the information on association among attributes. The performance of different imputation methods is compared in terms of the proportion of falsely imputed values. Simulation results show that the weighting of attributes yields smaller imputation errors than existing approaches. A variety of real data sets is used to support the results obtained by simulations.
研究动机与目标
- 解决现有针对具有缺失值的分类数据的有效插补方法稀缺的问题。
- 通过基于加权距离度量整合分类属性之间的关联,改进最近邻插补。
- 开发一种无需预先指定邻居数量(k)且降低插补误差的方法。
- 通过模拟和真实数据集,将 wNNSel_cat 的性能与模式插补、随机森林以及 wNNSel_dum 等现有方法进行比较。
提出的方法
- 提出一种加权距离度量 d_SelCat,利用核函数(高斯和三角)根据属性关联对属性加权。
- 采用交叉验证算法自动选择最优调参,避免预先固定 k。
- 利用列联表中的关联信息,在距离计算中为强相关属性分配更高权重。
- 应用核函数转换距离值,其中 q 控制带宽,并在不同核函数类型下评估性能。
- 将 wNNSel_cat 与 wNNSel_dum 进行比较,后者将分类变量转换为虚拟变量,并使用皮尔逊相关性计算距离。
- 使用最近邻的加权众数插补缺失值,其中权重来自核加权距离。
实验结果
研究问题
- RQ1将属性关联纳入距离度量是否能提升分类数据的最近邻插补性能?
- RQ2与传统的 k-NN 和模式插补相比,所提出的 wNNSel_cat 方法是否能降低插补误差?
- RQ3不同核函数(高斯 vs. 三角)和调参(q)如何影响插补性能?
- RQ4wNNSel_dum(使用虚拟变量和相关性)在多分类数据上是否优于 wNNSel_cat?
- RQ5该方法在具有不同缺失率的多样化真实数据集中表现如何?
主要发现
- wNNSel_cat 方法通过核加权距离利用属性关联,显著降低了插补误差。
- 对于多分类数据,wNNSel_dum 方法(使用虚拟变量和相关性)的插补误差低于 wNNSel_cat,尤其在 DNA 启动子和淋巴图谱数据集中表现更优。
- 在 DNA 和淋巴图谱数据中,高斯核的插补误差小于三角核,而在 SPECT 数据中两者表现相似。
- q 的取值对性能影响极小,所有数据集中 q=1 和 q=2 的结果相近。
- 在二分类数据(SPECT)中,wNNSel_cat 和 wNNSel_dum 表现几乎完全相同,证实了在低维分类设置下的稳健性。
- 在真实数据应用中,wNNSel_dum 实现了最低的 PFC(错误插补比例),尤其在 DNA 启动子数据中缺失率为 30% 时(PFC = 0.4586),甚至优于随机森林。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。