Skip to main content
QUICK REVIEW

[论文解读] Noisy and Incomplete Boolean Matrix Factorizationvia Expectation Maximization

Lifan Liang, Songjian Lu|arXiv (Cornell University)|May 29, 2019
Error Correcting Code Techniques参考文献 16被引用 4
一句话总结

该论文提出了一种基于期望最大化(Expectation Maximization)的新型概率布尔矩阵分解算法,通过使用贝塔分布对连续参数进行建模,消除了对潜在因子形状的假设,并通过重参数化实现梯度上升。该方法在处理噪声和不完整数据方面优于最先进的方法(如LoM和消息传递算法),尤其在因子大小显著不同时表现更优,已在合成数据和真实世界应用(包括基因表达分析和脑部分割)中得到验证。

ABSTRACT

Probabilistic approach to Boolean matrix factorization can provide solutions robustagainst noise and missing values with linear computational complexity. However,the assumption about latent factors can be problematic in real world applications.This study proposed a new probabilistic algorithm free of assumptions of latentfactors, while retaining the advantages of previous algorithms. Real data experimentshowed that our algorithm was favourably compared with current state-of-the-artprobabilistic algorithms.

研究动机与目标

  • 解决现有布尔矩阵分解(BMF)方法对潜在因子形状强假设的局限性,这些假设在真实世界数据中往往不切实际。
  • 开发一种稳健且可扩展的BMF算法,无需对因子结构施加先验假设,即可有效处理噪声和不完整数据。
  • 在基因表达分析和脑区分割等真实世界应用中提升性能,这些应用的数据本质上存在不完整性和噪声。
  • 通过连续参数化放松对因子大小和形状的约束,实现对多样化因子模式的有效学习。

提出的方法

  • 该方法使用[0,1]区间内的连续参数对潜在因子进行建模,这些参数来自贝塔分布,从而实现灵活表示,无需假设固定形状。
  • 将参数从[0,1]重参数化为(−∞, +∞),以支持高效的梯度上升优化。
  • 该算法在期望最大化(EM)框架内联合估计潜在因子和均匀噪声模型。
  • 生成过程对观测矩阵、因子矩阵及其通过OR-AND运算组合的每个元素使用独立的伯努利分布。
  • 通过EM最大化似然函数,其中E步计算后验概率,M步通过梯度上升更新参数。
  • 由于使用了连续且可微的参数,该方法在大规模布尔矩阵上具有良好的可扩展性和有效性。

实验结果

研究问题

  • RQ1布尔矩阵分解算法是否能在不假设潜在因子形状均匀或固定的前提下,实现对噪声和不完整数据的鲁棒性能?
  • RQ2放松对潜在因子结构的假设,对在存在缺失值和噪声的真实世界生物医学数据集中的性能有何影响?
  • RQ3所提出的基于EM的连续参数化与梯度上升方法是否优于现有概率BMF方法(如LoM和消息传递)?
  • RQ4该算法在缺乏因子大小或形状先验知识的情况下,能够在基因表达数据和空间转录组数据中恢复出有意义的生物模式到何种程度?

主要发现

  • 在因子大小各异且噪声水平为低至中等的合成数据上,所提出的EM算法在因子大小差异显著时,显著优于消息传递和LoM方法。
  • 在MovieLens数据集上,EM算法在95%数据被观测时达到68.2%的准确率,优于消息传递(66.4%)和OrM(64.7%)在100K数据集中的表现。
  • 在乳腺癌亚型分类任务中,EM算法达到81.3%的准确率,显著优于LoM(77.8%)和消息传递(77.7%),尤其在区分Her2和正常样亚型方面表现更优。
  • 在使用空间转录组数据进行海马体区域分割时,该算法在未使用空间先验的情况下,成功识别出具有空间一致性的聚类(2至15个因子),表明其对缺失数据和噪声具有强鲁棒性。
  • 当观测数据比例降至1%时,EM算法保持了稳定的性能,而LoM在观测比例低于30%时性能显著下降。
  • 通过避免对因子大小施加限制性假设,该方法在捕捉数据中细微且高方差的模式方面表现出色,这在生物异质性亚型分类性能提升中得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。