QUICK REVIEW
[论文解读] Understanding a Version of Multivariate Symmetric Uncertainty to assist in Feature Selection
Gustavo Sosa-Cabrera, Miguel García-Torres|arXiv (Cornell University)|Sep 25, 2017
Data Mining Algorithms and Applications参考文献 5被引用 4
一句话总结
本文研究了在高维数据集中进行特征选择时,多变量对称不确定性(MSU)度量中的偏差问题,发现单变量和多变量基数以及样本量对MSU的可靠性具有关键影响。本文提出了一条经验规则——样本量 ≈ 10 × |class| × ∏|fi|——以控制偏差,确保即使在存在非信息性或冗余属性的高维数据集中,也能准确检测出具有信息量的特征。
ABSTRACT
In this paper, we analyze the behavior of the multivariate symmetric uncertainty (MSU) measure through the use of statistical simulation techniques under various mixes of informative and non-informative randomly generated features. Experiments show how the number of attributes, their cardinalities, and the sample size affect the MSU. We discovered a condition that preserves good quality in the MSU under different combinations of these three factors, providing a new useful criterion to help drive the process of dimension reduction.
研究动机与目标
- 分析在高维数据集中使用MSU进行特征选择时的偏差问题。
- 识别单变量和多变量基数以及样本量如何影响MSU区分信息性特征与非信息性特征的能力。
- 制定一个实用的样本量设置准则,以最小化基于MSU的特征选择中的偏差。
- 通过蒙特卡洛模拟在不同基数和样本量组合下验证所提出的准则。
提出的方法
- 本研究使用蒙特卡洛模拟生成具有已知信息性与非信息性特征的人工数据集。
- 采用公式 MSU(X₁:n) = (n/(n−1)) × [C(X₁:n) / ΣH(Xi)] 评估MSU,其中C为总相关性,H为熵。
- 单变量基数定义为某一特征中不同标签的数量;多变量基数为包含类别在内的所有特征组合的标签组合数。
- 作者比较了在固定样本量与按规则计算的样本量下MSU的值,该规则为:样本量 ≈ 10 × |class| × ∏|fi|。
- 模拟调整类别基数(2至10)、特征基数(2至64)和样本量(1000至5000),评估MSU在信息性与非信息性特征上的表现。
- 分析重点在于检测非信息性特征的MSU偏差,并评估其在检测真实交互作用方面的能力。
实验结果
研究问题
- RQ1单变量和多变量基数如何影响非信息性特征的MSU偏差?
- RQ2在不同基数和特征数量组合下,需要多大的样本量才能确保MSU值的可靠性?
- RQ3增加低基数特征的数量是否能获得与较少高基数特征相当的MSU值?
- RQ4在不同样本量下,当特征存在交互作用(如XOR型关系)时,MSU的表现如何?
- RQ5能否通过将样本量与多变量基数关联,推导出控制MSU偏差的规则?
主要发现
- 非信息性特征的MSU值随着单变量和多变量基数的提高而增加,表明该度量存在显著偏差。
- 当样本量约为多变量基数的10倍时(即 10 × |class| × ∏|fi|),MSU表现出可控的偏差和可靠的性能。
- 对于非信息性特征,MSU值随单变量基数的增加而急剧上升,尤其是在样本量固定时。
- 在固定样本量(如1000)下,即使不存在真实相关性,非信息性特征的MSU值在单变量基数增加时也持续升高。
- 所提出的规则(样本量 ≈ 10 × |class| × ∏|fi|)能有效抑制偏差,尤其在具有大量低基数特征的高维场景中表现突出。
- 当样本量不足时,高基数特征的MSU性能会下降,但应用该规则后性能显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。