Skip to main content
QUICK REVIEW

[论文解读] Fast Scalable and Accurate Discovery of DAGs Using the Best Order Score Search and Grow-Shrink Trees

Bryan Andrews, Joseph Ramsey|PubMed|Oct 26, 2023
Rough Sets and Fuzzy Logic被引用 7
一句话总结

本文提出最佳顺序评分搜索(BOSS)与增长-修剪树(GSTs),一种可扩展且准确的学习高维数据中有向无环图(DAG)的方法。BOSS利用GSTs缓存的评分指导贪婪排列搜索,在合成数据和高达1,000个变量的fMRI数据上,其准确率和速度均优于组合方法与基于梯度的方法,尤其在高连通性场景下表现突出。

ABSTRACT

Learning graphical conditional independence structures is an important machine learning problem and a cornerstone of causal discovery. However, the accuracy and execution time of learning algorithms generally struggle to scale to problems with hundreds of highly connected variables-for instance, recovering brain networks from fMRI data. We introduce the best order score search (BOSS) and grow-shrink trees (GSTs) for learning directed acyclic graphs (DAGs) in this paradigm. BOSS greedily searches over permutations of variables, using GSTs to construct and score DAGs from permutations. GSTs efficiently cache scores to eliminate redundant calculations. BOSS achieves state-of-the-art performance in accuracy and execution time, comparing favorably to a variety of combinatorial and gradient-based learning algorithms under a broad range of conditions. To demonstrate its practicality, we apply BOSS to two sets of resting-state fMRI data: simulated data with pseudo-empirical noise distributions derived from randomized empirical fMRI cortical signals and clinical data from 3T fMRI scans processed into cortical parcels. BOSS is available for use within the TETRAD project which includes Python and R wrappers.

研究动机与目标

  • 解决现有DAG结构学习算法在高维、高度连通数据(如fMRI脑网络)中面临的可扩展性与准确性限制。
  • 开发一种新型缓存机制——增长-修剪树(GSTs),通过消除冗余评分计算,加速基于排列的DAG学习。
  • 设计一种新算法——最佳顺序评分搜索(BOSS),在更少调参条件下实现优于GRaSP等先前方法的最先进性能,且运行时间更优。
  • 在包含伪经验噪声的合成数据以及来自3T扫描的真实临床fMRI数据上验证BOSS,证明其实际应用价值。
  • 在TETRAD项目中提供开源实现,支持Python与R,促进更广泛的应用。

提出的方法

  • BOSS通过在变量排列上进行贪婪搜索,寻找得分最高的DAG,使用最佳顺序评分作为引导搜索的准则。
  • 增长-修剪树(GSTs)是一种新型数据结构,在排列处理过程中缓存中间评分计算,显著减少基于排列学习中的冗余计算。
  • GSTs通过树形结构组织排列,支持增量更新与次优分支的剪枝,实现高效的评分重用。
  • 算法使用BICλ与∆BIC评分评估由每种排列生成的DAG,其中BICλ偏好稀疏性,∆BIC衡量相对模型拟合度。
  • BOSS集成GSTs以加速候选DAG的评分过程,使在1,000个变量、平均度数20的条件下仍能可扩展地探索搜索空间。
  • 该方法渐近正确,支持基于评分与基于约束的模型选择,已在TETRAD中实现。

实验结果

研究问题

  • RQ1基于排列的DAG学习方法是否能在包含最多1,000个变量的密集高维图上同时实现高准确率与可扩展性?
  • RQ2如增长-修剪树(GSTs)这样的新型缓存机制是否能显著降低基于排列的DAG学习的计算成本,同时不损失准确性?
  • RQ3在合成数据与真实fMRI数据上,BOSS与最先进组合方法和基于梯度的方法(如GRaSP、fGES、DAGMA、LiNGAM)相比,在准确率、运行时间与模型拟合度方面表现如何?
  • RQ4在具有复杂伪经验噪声分布(源自真实皮层信号)的真实fMRI数据上,BOSS是否仍能保持优异性能?
  • RQ5BOSS能否高效应用于经处理为379个皮层区域的临床fMRI数据,实现可靠且可解释的脑网络发现?

主要发现

  • 在模拟fMRI数据上,BOSS的平均邻接精确率达0.99(0.005),召回率达0.94(0.009),在两项指标上均优于DAGMA、fGES与LiNGAM。
  • 在1,000个变量、平均度数20的高维合成数据上,BOSS耗时599.24秒(±43.804),∆BIC为29,520.77(±1,101.301),运行时间显著优于GRaSP,同时保持相近的准确率。
  • 在171次扫描的临床fMRI数据中,BOSS的BIC为98,752.23(±25,139.907),总边数为2,644.61(±430.419),在模型拟合度与边数准确性上优于fGES。
  • 在500个变量的数据集上,BOSS相比GRaSP将运行时间减少50%以上,耗时1,012.22秒(±60.835),而GRaSP耗时2,331.55秒(±249.112)。
  • 使用GSTs显著减少了冗余评分计算,使BOSS能够扩展至1,000个变量、平均度数20的规模,而在此类高密度场景下,许多先前方法因计算不可行而失效。
  • BOSS在合成数据与真实fMRI数据上均表现出色,实现了最先进水平的准确率与速度,尤其在高密度、高维设置下优势显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。