Skip to main content
QUICK REVIEW

[论文解读] EchoGNN: Explainable Ejection Fraction Estimation with Graph Neural Networks

Masoud Mokhtari, Teresa S.M. Tsang|arXiv (Cornell University)|Aug 30, 2022
Cardiac Imaging and Diagnostics被引用 4
一句话总结

EchoGNN 是一种基于图神经网络(GNN)的模型,通过在视频帧上学习潜在图结构,从超声心动图视频中估计射血分数(EF),并利用学习到的帧权重和边权重实现可解释的预测。该模型在参数量显著减少的情况下实现了最先进的 EF 预测性能,并且无需使用真实标注的收缩末期/舒张末期(ES/ED)帧标签。

ABSTRACT

Ejection fraction (EF) is a key indicator of cardiac function, allowing identification of patients prone to heart dysfunctions such as heart failure. EF is estimated from cardiac ultrasound videos known as echocardiograms (echo) by manually tracing the left ventricle and estimating its volume on certain frames. These estimations exhibit high inter-observer variability due to the manual process and varying video quality. Such sources of inaccuracy and the need for rapid assessment necessitate reliable and explainable machine learning techniques. In this work, we introduce EchoGNN, a model based on graph neural networks (GNNs) to estimate EF from echo videos. Our model first infers a latent echo-graph from the frames of one or multiple echo cine series. It then estimates weights over nodes and edges of this graph, indicating the importance of individual frames that aid EF estimation. A GNN regressor uses this weighted graph to predict EF. We show, qualitatively and quantitatively, that the learned graph weights provide explainability through identification of critical frames for EF estimation, which can be used to determine when human intervention is required. On EchoNet-Dynamic public EF dataset, EchoGNN achieves EF prediction performance that is on par with state of the art and provides explainability, which is crucial given the high inter-observer variability inherent in this task.

研究动机与目标

  • 为解决手动从超声心动图中估计射血分数(EF)时存在的高观察者间差异,开发一种可靠且可解释的机器学习模型。
  • 实现实时 EF 估计,以支持临床决策,特别是在经验较少的用户使用的床旁超声(POCUS)环境中。
  • 通过识别在 echo-graph 中对 EF 预测有贡献的关键帧和边,提供可解释性,减少对专家干预的依赖。
  • 在不直接监督 ES/ED 帧标签的情况下训练模型,提高对临床标注噪声的鲁棒性。
  • 降低模型复杂度和内存需求,以实现对移动临床设备的部署。

提出的方法

  • 该模型从一个或多个超声心动图电影序列的帧中构建潜在的 echo-graph,以表示帧之间的时序关系。
  • 通过基于 GNN 的注意力机制学习节点和边权重,表明单个帧及其帧间转换对 EF 估计的重要性。
  • GNN 回归器利用加权图进行 EF 预测,模型仅使用 EF 标签和弱监督进行训练。
  • 该框架采用弱监督训练流程,避免对 ES/ED 帧位置的直接监督,转而依赖 EF 标签和针对低频 EF 群组的分类头。
  • 模型使用数据增强和预训练技术以提高泛化能力,并减少低 EF 案例的误差。
  • 最终预测通过一个 GNN 完成,该 GNN 在加权图上聚合特征,从而实现准确的 EF 估计和可解释性。

实验结果

研究问题

  • RQ1图神经网络能否有效应用于超声心动图视频数据以实现射血分数估计?
  • RQ2EchoGNN 中学习到的图结构能否提供有意义且可解释的见解,揭示哪些帧对 EF 预测最为关键?
  • RQ3该模型是否能在不依赖真实 ES/ED 帧标注的情况下实现具有竞争力的 EF 预测性能?
  • RQ4该模型是否能在远少于先前最先进模型的参数量下保持高精度?
  • RQ5该模型的可解释性机制是否有助于识别出需要人工审查的病例,特别是在低 EF 情况下?

主要发现

  • EchoGNN 在 EchoNet-Dynamic 数据集上实现了 4.45 的 MAE,优于 [21] 的基于 Transformer 的模型,并与 [12] 的性能相当,但仅使用了 170 万个参数。
  • 模型的 R² 得分为 0.76,表明其能很好地解释方差,对识别 EF < 40% 的 F₁ 得分为 0.78,该值是关键临床阈值。
  • EchoGNN 显著优于 EchoNet (AF),后者对所有 32 帧剪辑进行采样,导致内存需求过高,使本研究中难以训练和评估。
  • 消融实验证实,结合数据增强、分类损失和预训练可将 MAE 降低至 4.45,并将 F₁ 得分提升至 0.78。
  • 通过学习到的图权重实现的可解释性成功识别出关键帧和边,可视化结果显示在 LV 边界变化明显的帧上权重更高,而在模糊或质量差的帧上权重更低。
  • 该模型参数量极低(170 万个),使其在临床环境中高度适用于移动设备和边缘设备的部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。