Skip to main content
QUICK REVIEW

[论文解读] Tensor Networks for Medical Image Classification

Raghavendra Selvan, Erik B. Dam|arXiv (Cornell University)|Apr 21, 2020
Tensor decomposition and applications参考文献 19被引用 10
一句话总结

该论文提出LoTeNet,一种局部无序张量网络模型,通过保留局部邻域统计信息来保持全局图像结构,将矩阵乘积态(MPS)张量网络适配于医学图像分类。与CNN及先前的张量网络模型相比,LoTeNet在PCam和LIDC-IDRI数据集上实现了最先进性能,且超参数更少、GPU显存占用显著降低。

ABSTRACT

With the increasing adoption of machine learning tools like neural networks across several domains, interesting connections and comparisons to concepts from other domains are coming to light. In this work, we focus on the class of Tensor Networks, which has been a work horse for physicists in the last two decades to analyse quantum many-body systems. Building on the recent interest in tensor networks for machine learning, we extend the Matrix Product State tensor networks (which can be interpreted as linear classifiers operating in exponentially high dimensional spaces) to be useful in medical image analysis tasks. We focus on classification problems as a first step where we motivate the use of tensor networks and propose adaptions for 2D images using classical image domain concepts such as local orderlessness of images. With the proposed locally orderless tensor network model (LoTeNet), we show that tensor networks are capable of attaining performance that is comparable to state-of-the-art deep learning methods. We evaluate the model on two publicly available medical imaging datasets and show performance improvements with fewer model hyperparameters and lesser computational resources compared to relevant baseline methods.

研究动机与目标

  • 解决现有张量网络模型中将2D医学图像展平为1D向量所导致的全局空间结构破坏问题。
  • 通过引入分层的、局部无序的特征表示,克服现有张量网络方法在低分辨率图像处理上的限制。
  • 通过降低计算和内存开销,实现高效可扩展的高分辨率医学图像分类。
  • 证明张量网络可在保持与深度学习基线模型相当性能的同时,显著减少超参数数量和GPU显存使用量。

提出的方法

  • 将矩阵乘积态(MPS)张量网络适配于直接处理2D图像块,将局部图像邻域视为无序区域。
  • 引入局部无序特征编码,捕捉小图像块的统计特性,且与像素顺序无关,从而在多尺度下保持全局结构。
  • 构建分层张量网络架构,每一层通过基于MPS的收缩操作逐步压缩并分类图像特征。
  • 通过张量网络结构端到端优化模型,支持基于梯度的反向传播学习。
  • 使用键维数(β)作为控制模型容量的主要超参数,实验表明即使在低β值(如β=5)下也具有鲁棒性。
  • 在LoTeNet架构上对PCam和LIDC-IDRI数据集应用标准深度学习训练协议(Adam优化器、交叉熵损失、早停法)。

实验结果

研究问题

  • RQ1张量网络能否在不展平输入的情况下有效适配于高分辨率医学图像分类?
  • RQ2与标准展平方式相比,局部无序图像表示是否能更好地保留张量网络中的全局结构信息?
  • RQ3LoTeNet在医学图像分类任务中的性能与DenseNet和旋转等变CNN等最先进深度学习模型相比如何?
  • RQ4与卷积神经网络及先前的张量网络模型相比,LoTeNet在GPU显存消耗方面降低了多少?
  • RQ5LoTeNet对键维数β的变化敏感程度如何?其能否在低β值下保持高精度?

主要发现

  • 在PCam组织病理学数据集上,LoTeNet的AUC达到0.943,与最先进模型Rotation Eq-CNN(AUC 0.963)和DenseNet(AUC 0.962)相当。
  • 在LIDC-IDRI胸部CT数据集上,LoTeNet的AUC达到0.874,优于DenseNet(AUC 0.829)和单层MPS模型Tensor Net-X(AUC 0.847)。
  • 在PCam上,LoTeNet仅使用0.8 GB GPU显存,在LIDC-IDRI上仅使用0.7 GB,显著低于DenseNet(10.5 GB)和Rotation Eq-CNN(11.0 GB),尽管其参数量更多(100万 vs. 12万)。
  • 在相同超参数配置(学习率、批量大小)下,模型在不同数据集上均表现稳健,表明其具有强迁移能力且对超参数不敏感。
  • 在不同键维数β值下性能保持稳定,即使在β=5时波动极小,表明低秩近似已足以实现高性能。
  • 在PCam上每轮训练仅需3分钟,在LIDC-IDRI上仅需30秒,表明尽管处于高维特征空间,计算效率依然很高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。