Skip to main content
QUICK REVIEW

[논문 리뷰] Representation-Aggregation Networks for Segmentation of Multi-Gigapixel Histology Images

Abhinav Agarwalla, Muhammad Shaban|arXiv (Cornell University)|2017. 07. 27.
AI in cancer detection참고 문헌 9인용 수 18
한 줄 요약

이 논문은 다기가피트럴 히스토로지 전체 슬라이드 이미지(WSI)에서 종양 세그멘테이션을 향상시키기 위해 파이프레벨 특징 표현과 공간적 맥락 집약을 결합하는 표현-집약 네트워크(RANs)를 제안한다. 국소 표현을 위해 CNN을 사용하고, 이웃한 패치들 사이의 맥락 집약을 위해 CNN 또는 2D-LSTM를 사용함으로써, RANs는 표준 패치 기반 CNN보다 유의미하게 뛰어난 성능을 보이며, F1-스코어 0.83을 달성한다. 이는 전반적인 종양 구조를 보다 잘 포착하고 예측의 불연속성을 줄이는 데서 유의미한 성능 향상을 보여준다.

ABSTRACT

Convolutional Neural Network (CNN) models have become the state-of-the-art for most computer vision tasks with natural images. However, these are not best suited for multi-gigapixel resolution Whole Slide Images (WSIs) of histology slides due to large size of these images. Current approaches construct smaller patches from WSIs which results in the loss of contextual information. We propose to capture the spatial context using novel Representation-Aggregation Network (RAN) for segmentation purposes, wherein the first network learns patch-level representation and the second network aggregates context from a grid of neighbouring patches. We can use any CNN for representation learning, and can utilize CNN or 2D-Long Short Term Memory (2D-LSTM) for context-aggregation. Our method significantly outperformed conventional patch-based CNN approaches on segmentation of tumour in WSIs of breast cancer tissue sections.

연구 동기 및 목표

  • 계산 자원 제약과 전반적 맥락 정보 손실로 인해 표준 CNN이 실패하는 다기가피트럴 전체 슬라이드 이미지(WSI)에서 종양 세그멘테이션 문제를 해결한다.
  • 이웃한 패치들 사이의 공간적 의존성을 모델링하여 맥락 정보를 손상시키는 패치 기반 접근법의 한계를 극복한다.
  • 대규모 조직병리학 이미지에서 세그멘테이션 정확도를 향상시키기 위해 표현 학습과 맥락 집약을 통합하는 일반적인 딥러닝 프레임워크를 개발한다.
  • 전역 종양 구조를 포착하는 데서 2D-LSTM나 CNN 기반 맥락 집약 아키텍처의 효과를 평가한다.

제안 방법

  • WSI의 개별 이미지 패치에서 고차원 특징 표현을 추출하기 위해 사전 학습된 CNN(예: AlexNet, GoogLeNet, VGGNet, ResNet)을 사용한다.
  • 패치 수준의 특징을 2차원 격자로 정렬하여 공간 레이아웃을 유지하고 이웃한 패치들 사이의 맥락 모델링을 가능하게 한다.
  • 2차원 격자로 정렬된 특징에 대해 맥락 집약 네트워크(2D-CNN(RAN-CNN) 또는 2D-LSTM(RAN-LSTM))를 적용하여, 공간적 맥락을 활용해 각 패치의 종양 확률을 예측한다.
  • RAN-LSTM의 경우, 격자의 각 모서리에서 시작하여 대각선으로 작동하는 네 개의 2D-LSTM 네트워크를 사용하여 장거리 의존성을 포착하고, 최종 출력을 위해 예측값을 평균화한다.
  • 클래스 불균형을 완화하기 위해 종양 양성 및 음성 격자 수가 동일한 28,000개의 2차원 격자로 구성된 균형 잡힌 데이터셋을 사용하여 맥락 집약 네트워크를 훈련시킨다.
  • 학습률 스케줄링과 데이터 증강을 적용한 Adam 옵timizer를 사용하여 훈련하며, AlexNet의 FC6 레이어에서 추출한 특징을 사용해 단일 GPU에서 학습한다.

실험 결과

연구 질문

  • RQ1패치 단위 처리에 의존하지 않고 다기가피트럴 히스토로지 WSI에서 장거리 공간적 맥락을 효과적으로 모델링할 수 있는 딥러닝 프레임워크가 존재하는가?
  • RQ22D-LSTM나 CNN 기반 맥락 집약 방식을 통한 전역 맥락 통합이 표준 패치 기반 CNN보다 종양 세그멘테이션 성능을 향상시키는가?
  • RQ3다양한 표현 네트워크(예: AlexNet, ResNet)와 맥락 집약 아키텍처(RAN-CNN 대 RAN-LSTM) 간의 세그멘테이션 정확도 및 내구성은 어떻게 비교되는가?
  • RQ4맥락 집약이 얼마나 예측의 불연속성을 줄이고 종양 영역 세그멘테이션의 연속성을 향상시키는가?
  • RQ5다양한 백본 네트워크와 맥락 모듈을 통합함으로써 일반적인 RAN 아키텍처가 조직병리학 세그멘테이션에 효과적으로 적용될 수 있는가?

주요 결과

  • RANs는 표준 패치 기반 CNN보다 유의미하게 뛰어나며, AlexNet 단독 사용 시 F1-스코어 0.40 대비 0.83을 달성함으로써 맥락 집약의 가치를 입증한다.
  • 두 개의 2D-LSTM 레이어를 가진 RAN-LSTM가 가장 높은 F1-스코어 0.83을 기록했으며, 이는 전역 공간적 의존성을 더 잘 모델링하기 때문이며, RAN-CNN 변종보다 뛰어난 성능을 보였다.
  • RAN-LSTM는 AlexNet이 생성하는 조각나고 덩어리 같은 예측과는 달리 더 매끄럽고 연속적인 종양 영역 예측을 생성했다.
  • 5개의 컨볼루션 레이어와 드롭아웃을 포함한 RAN-CNN 변종(RAN-CNN-FC6-5L-D)은 정밀도 0.81, 재현도 0.83, F1-스코어 0.82를 기록하여 국소에서 전역 맥락으로의 전이 성능가 뛰어났다.
  • RAN-LSTM 모델은 정밀도 0.85, 재현도 0.81을 기록하여 종양 탐지에서 정밀도와 민감도 사이의 균형 잡힌 성능을 보였다.
  • 제거 분석 결과, 더 깊은 맥락 집약 네트워크(예: 이중 레이어 RAN-LSTM)가 얕은 네트워크보다 우수한 성능을 보였으며, 맥락을 효과적으로 모델링하기 위해 충분한 모델링 용량이 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.