Skip to main content
QUICK REVIEW

[논문 리뷰] Tensor Networks for Medical Image Classification

Raghavendra Selvan, Erik B. Dam|arXiv (Cornell University)|2020. 04. 21.
Tensor decomposition and applications참고 문헌 19인용 수 10
한 줄 요약

이 논문은 국소적 이웃 통계를 통해 전반적인 이미지 구조를 유지하면서 행렬 곱 상태(MPS) 텐서 네트워크를 의료 영상 분류에 적응시킨 로컬로 순서 없는 텐서 네트워크(LoTeNet)를 제안한다. 이는 CNN 및 이전의 텐서 네트워크 모델에 비해 더 적은 초모수와 훨씬 적은 GPU 메모리 사용량으로 PCam 및 LIDC-IDRI 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

With the increasing adoption of machine learning tools like neural networks across several domains, interesting connections and comparisons to concepts from other domains are coming to light. In this work, we focus on the class of Tensor Networks, which has been a work horse for physicists in the last two decades to analyse quantum many-body systems. Building on the recent interest in tensor networks for machine learning, we extend the Matrix Product State tensor networks (which can be interpreted as linear classifiers operating in exponentially high dimensional spaces) to be useful in medical image analysis tasks. We focus on classification problems as a first step where we motivate the use of tensor networks and propose adaptions for 2D images using classical image domain concepts such as local orderlessness of images. With the proposed locally orderless tensor network model (LoTeNet), we show that tensor networks are capable of attaining performance that is comparable to state-of-the-art deep learning methods. We evaluate the model on two publicly available medical imaging datasets and show performance improvements with fewer model hyperparameters and lesser computational resources compared to relevant baseline methods.

연구 동기 및 목표

  • 텐서 네트워크 모델에서 2D 의료 영상을 1D 벡터로 평탄화하는 것의 한계를 해결하여 전반적인 공간적 구조를 유지한다.
  • 계층적이고 국소적으로 순서 없는 특징 표현을 도입함으로써 기존 텐서 네트워크 방법의 저해상도 영상 처리 제약을 극복한다.
  • 계산 및 메모리 오버헤드를 줄여 고해상도 의료 영상의 효율적이고 확장 가능한 분류를 가능하게 한다.
  • 딥 러닝 기준 모델과 경쟁 가능한 성능을 달성하면서도 더 적은 초모수와 더 적은 GPU 메모리가 필요한지 입증한다.

제안 방법

  • 국소적 영상 이웃을 순서 없는 영역으로 간주하여 2D 영상 패치에 직접 작동하는 행렬 곱 상태(MPS) 텐서 네트워크를 적응시킨다.
  • 픽셀 순서에 영향을 받지 않는 작은 영상 패치의 통계적 성질을 캡처하는 국소적으로 순서 없는 특징 인코딩을 도입하여 스케일 간 전반적인 구조를 유지한다.
  • 각 층이 MPS 기반 수축을 적용하여 점진적으로 압축하고 분류하는 계층적 텐서 네트워크 아키텍처를 구성한다.
  • 텐서 네트워크 구조를 거쳐 백프로파게이션을 통해 전체 모델을 종단 간 최적화하여 기울기 기반 학습을 가능하게 한다.
  • 모델 용량을 제어하는 주요 초모수로 결합 차원(β)을 사용하며, 실험 결과 저차원(예: β=5)에서도 강건한 성능을 보임을 확인하였다.
  • PCam 및 LIDC-IDRI 데이터셋 모두에 대해 표준 딥 러닝 학습 프로토콜(Adam 옵timizer, 교차 엔트로피 손실, 조기 정지)을 LoTeNet 아키텍처에 적용하였다.

실험 결과

연구 질문

  • RQ1입력을 평탄화하지 않고도 고해상도 의료 영상 분류에 효과적으로 텐서 네트워크를 적응시킬 수 있는가?
  • RQ2기존의 평탄화 방식에 비해 국소적으로 순서 없는 영상 표현이 전반적인 구조적 정보를 더 잘 유지하는가?
  • RQ3DenseNet 및 회전 등변성 CNN과 같은 최신 기술 수준의 딥 러닝 모델과 비교해 LoTeNet의 성능은 어떠한가?
  • RQ4CNN 및 이전의 텐서 네트워크 모델에 비해 LoTeNet은 얼마나 많은 GPU 메모리 소비를 줄일 수 있는가?
  • RQ5LoTeNet의 성능는 결합 차원 β의 변화에 얼마나 민감한가? 낮은 β 값에서도 높은 정확도를 유지할 수 있는가?

주요 결과

  • PCam 히스토파스절로지 데이터셋에서 LoTeNet은 AUC 0.943을 달성하여 Rotation Eq-CNN(AUC 0.963) 및 DenseNet(AUC 0.962)와 유사한 최신 기술 수준의 성능을 보였다.
  • LIDC-IDRI 체질 CT 데이터셋에서 LoTeNet은 AUC 0.874를 기록하여 DenseNet(AUC 0.829)과 단일층 MPS 모델인 Tensor Net-X(AUC 0.847)를 모두 능가했다.
  • PCam에서는 0.8 GB, LIDC-IDRI에서는 0.7 GB의 GPU 메모리만 사용하였으며, 이는 DenseNet(10.5 GB) 및 Rotation Eq-CNN(11.0 GB)보다 훨씬 적은 메모리 사용량임에도 불구하고 더 많은 파라미터(1M 대비 120K)를 가짐에도 불구하고 성능이 뛰어났다.
  • 동일한 초모수 설정(학습률, 배치 크기)으로 다양한 데이터셋에서 우수한 성능을 보이며 강력한 전이 가능성과 낮은 초모수 민감도를 나타냈다.
  • 결합 차원(β) 값의 변화에 관계없이 성능가 안정적이었으며, β=5에서도 최소한의 변동만 관찰되어 낮은 랭크 근사가 높은 성능을 위해 충분함을 시사했다.
  • PCam에서는 1에포크당 3분, LIDC-IDRI에서는 30초로 계산이 매우 효율적이었으며, 이는 고차원적 특징 공간에도 불구하고 효율적인 계산을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.