[论文解读] Scalable Boolean Tensor Factorizations using Random Walks
该论文提出 Walk'n'Merge 算法,一种用于大规模稀疏二值张量的布尔 CP 和 Tucker 张量分解的可扩展算法,结合随机游走与后处理。该方法能够准确重构潜在的布尔结构,并通过最小描述长度原则自动选择分解秩,相较于先前方法在可扩展性方面表现更优,且能有效处理真实世界数据(如 Enron 和 YPSS 数据集)。
Tensors are becoming increasingly common in data mining, and consequently, tensor factorizations are becoming more and more important tools for data miners. When the data is binary, it is natural to ask if we can factorize it into binary factors while simultaneously making sure that the reconstructed tensor is still binary. Such factorizations, called Boolean tensor factorizations, can provide improved interpretability and find Boolean structure that is hard to express using normal factorizations. Unfortunately the algorithms for computing Boolean tensor factorizations do not usually scale well. In this paper we present a novel algorithm for finding Boolean CP and Tucker decompositions of large and sparse binary tensors. In our experimental evaluation we show that our algorithm can handle large tensors and accurately reconstructs the latent Boolean structure.
研究动机与目标
- 为解决大规模稀疏二值张量中布尔张量分解(BTF)缺乏可扩展算法的问题。
- 实现对现实世界数据(如 RDF、文本和通信日志)中潜在布尔结构(如逻辑或集合关系)的发现。
- 开发一种可扩展至大规模张量的方法,以应对现有 BTF 算法因计算复杂度而失效的问题。
- 将最小描述长度(MDL)原则集成到布尔分解中,实现分解秩的自动选择。
- 为数据挖掘者提供一种实用且高效的工具,以探索超越传统分解方法的布尔结构。
提出的方法
- 该方法的核心是 Walk'n'Merge,一种基于随机游走的算法,用于探索张量结构并识别潜在的布尔分量。
- 通过随机游走对高维张量纤维进行采样与聚类,以可扩展的方式识别候选秩-1 分量。
- 后处理步骤对初始输出进行优化,确保因子为二值并实现布尔和重构,从而满足 BTF 约束条件。
- 应用最小描述长度(MDL)原则,通过最小化编码长度来选择最优分解秩。
- 该算法支持布尔 CP 和 Tucker 分解,且扩展支持核心张量与因子矩阵的恢复。
- 通过聚焦非零元素并使用高效数据结构,该方法被设计用于处理稀疏性和大规模数据。
实验结果
研究问题
- RQ1随机游走能否有效用于发现大规模稀疏二值张量中的布尔分量?
- RQ2Walk'n'Merge 在真实世界数据集上的可扩展性与现有 BTF 算法相比如何?
- RQ3MDL 原理在布尔张量分解中自动选择最优秩的程度如何?
- RQ4该算法是否能保持真实世界数据(如 RDF 或文本三元组数据)的布尔结构?
- RQ5使用所提出的分解方法重构潜在布尔事实(如实体-关系三元组)的准确性如何?
主要发现
- Walk'n'Merge 在 YPSS 数据集中成功重构了潜在布尔结构,正确识别出 Claude-Nicolas-Guillaume de Lorimier 出生于魁北克省 Lachine。
- 在 Enron 数据集中,该算法以 9×11×9 的核心张量实现了 1775 的重构误差,尽管未进行显式误差优化,仍表现出较强准确性。
- 该算法在处理大规模 Facebook 数据集(最高秩达 3300)时耗时 85 至 277 分钟,具体取决于密度阈值,其可扩展性优于 cp_apr 和 ParCube。
- Walk'n'Merge 在 YPSS 数据集(39,500×8,000×21,000,含 804,000 个非零元素)上运行耗时 52 分钟,Tucker 分解额外耗时 3 小时。
- 该方法在真实世界数据上表现出稳健性能,即使数据不完全符合布尔结构,也显示出实际应用价值。
- 该算法性能对参数敏感并引入随机性,提示可能需要调参及多次运行以获得稳定结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。