Skip to main content
QUICK REVIEW

[论文解读] Multi-view Unsupervised Feature Selection by Cross-diffused Matrix Alignment

Xiaokai Wei, Bokai Cao|arXiv (Cornell University)|May 2, 2017
Face and Expression Recognition参考文献 27被引用 5
一句话总结

本文提出了一种名为CDMA-FS的新颖无监督多视图特征选择方法,通过交叉扩散矩阵对齐技术,相比基于聚类标签的方法,能够更好地保留多视图中的丰富信息。通过将特征选择建模为使用拟牛顿法求解的约束优化问题,CDMA-FS在真实世界数据集上实现了优越的聚类性能,即使在没有真实标签的情况下,也优于当前最先进的方法。

ABSTRACT

Multi-view high-dimensional data become increasingly popular in the big data era. Feature selection is a useful technique for alleviating the curse of dimensionality in multi-view learning. In this paper, we study unsupervised feature selection for multi-view data, as class labels are usually expensive to obtain. Traditional feature selection methods are mostly designed for single-view data and cannot fully exploit the rich information from multi-view data. Existing multi-view feature selection methods are usually based on noisy cluster labels which might not preserve sufficient information from multi-view data. To better utilize multi-view information, we propose a method, CDMA-FS, to select features for each view by performing alignment on a cross diffused matrix. We formulate it as a constrained optimization problem and solve it using Quasi-Newton based method. Experiments results on four real-world datasets show that the proposed method is more effective than the state-of-the-art methods in multi-view setting.

研究动机与目标

  • 解决现有无监督多视图特征选择方法依赖于噪声聚类标签、无法充分挖掘视图间互补信息的局限性。
  • 通过利用交叉扩散构建一致性相似度图,保留多视图数据更准确和更具信息量的表示。
  • 通过直接利用交叉扩散矩阵进行矩阵对齐,实现无需依赖类别标签的有效特征选择。
  • 为在真实世界无监督场景中实际部署提供参数设置指导,其中标签不可用。

提出的方法

  • 通过交叉扩散过程构建一致性相似度图,聚合多视图信息,相比聚类标签能更好地保留更丰富的结构关系。
  • 将特征选择建模为一个约束优化问题,通过将所选特征矩阵与交叉扩散矩阵对齐,以保持数据结构。
  • 采用基于拟牛顿的优化方法求解非线性、非凸的目标函数,实现高效且稳定的收敛。
  • 在交叉扩散过程中引入正则化参数α以控制各视图的影响,并提供经验性的α设置指导。
  • 对扩散矩阵W采用0/1加权方案,以简化优化过程并提高可解释性。
  • 对数据点进行单位长度归一化,并固定σ² = 1,以在不同数据集上稳定扩散过程。

实验结果

研究问题

  • RQ1在无监督特征选择中,交叉扩散矩阵表示是否能比聚类标签更好地保留多视图数据结构?
  • RQ2与基于伪标签引导的回归方法相比,直接将特征选择与交叉扩散矩阵对齐,能否显著提升特征选择性能?
  • RQ3所提出方法对超参数α的敏感性如何?是否可在无监督条件下可靠调优?
  • RQ4在未使用真实标签进行参数调优的情况下,CDMA-FS是否在聚类准确率和NMI指标上优于当前最先进的无监督多视图特征选择方法?
  • RQ5该方法是否能在具有不同特征维度和视图结构的多样化真实世界数据集上保持稳健性能?

主要发现

  • 在BBCSport和BlogCatalog数据集上,CDMA-FS仅使用400个特征时,聚类准确率分别提升了26%和15%,显著优于使用全部特征的结果。
  • 在全部四个真实世界数据集上,CDMA-FS的性能与最佳调优基线方法相当或更优,尽管其未使用真实标签进行参数调优。
  • 该方法对正则化参数α的选择具有鲁棒性,在α > 10⁻⁵时均能保持良好性能,而基线方法对参数值高度敏感。
  • 基线方法的中位性能显著低于其最佳性能,凸显了在无标签条件下调优参数的实际局限性——CDMA-FS通过稳定且无需标签的参数设置克服了这一挑战。
  • 采用交叉扩散矩阵对齐可比基于聚类标签的方法更好地保留数据结构,从而实现更具信息量的特征选择。
  • 所提方法在不同数据集上表现出强大的泛化能力,包括高维、噪声较大的社交媒体和新闻内容数据,证实了其实际应用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。