[논문 리뷰] Weakly-Supervised Deep Learning Model for Prostate Cancer Diagnosis and Gleason Grading of Histopathology Images
이 논문은 전체 슬라이드 이미지(WSIs)를 사용하여 전립선암 갈레슨 등급 분류를 위한 약한 감독형 딥러닝 프레임워크를 제안한다. 트랜스포머 기반의 멀티플 인스턴스 학습(MIL) 모델을 활용해 특징적인 패치를 식별하고, 고점수 패치들로부터 그래프를 구성하며, 게이트드 어텐션 그래프 컨볼루션 네트워크를 통해 등급을 분류한다. 모델은 TCGA-PRAD, PANDA, 그리고 갈레슨 2019 챌린지 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 정확도는 최대 0.912, 코헨의 카파는 0.892를 기록하였다.
Prostate cancer is the most common cancer in men worldwide and the second leading cause of cancer death in the United States. One of the prognostic features in prostate cancer is the Gleason grading of histopathology images. The Gleason grade is assigned based on tumor architecture on Hematoxylin and Eosin (H&E) stained whole slide images (WSI) by the pathologists. This process is time-consuming and has known interobserver variability. In the past few years, deep learning algorithms have been used to analyze histopathology images, delivering promising results for grading prostate cancer. However, most of the algorithms rely on the fully annotated datasets which are expensive to generate. In this work, we proposed a novel weakly-supervised algorithm to classify prostate cancer grades. The proposed algorithm consists of three steps: (1) extracting discriminative areas in a histopathology image by employing the Multiple Instance Learning (MIL) algorithm based on Transformers, (2) representing the image by constructing a graph using the discriminative patches, and (3) classifying the image into its Gleason grades by developing a Graph Convolutional Neural Network (GCN) based on the gated attention mechanism. We evaluated our algorithm using publicly available datasets, including TCGAPRAD, PANDA, and Gleason 2019 challenge datasets. We also cross validated the algorithm on an independent dataset. Results show that the proposed model achieved state-of-the-art performance in the Gleason grading task in terms of accuracy, F1 score, and cohen-kappa. The code is available at https://github.com/NabaviLab/Prostate-Cancer.
연구 동기 및 목표
- 전립선암 진단을 위한 전체 슬라이드 이미지(WSIs)의 완전한 애너테이션에 따른 높은 비용과 시간 부담을 완화하기 위해.
- 분류 과정의 자동화를 통해 갈레슨 등급 분류에서의 관찰자 간 변동성을 줄이기 위해.
- WSI 내 악성 패치들 간의 공간적 및 상관관계적 특성을 모델링하여 분류 정확도를 향상시키기 위해.
- 패치 수준의 애너테이션을 회피하면서도 높은 성능을 유지하는 약한 감독형 접근법을 개발하기 위해.
- 다양한 공개 데이터셋과 독립적인 교차검증 세트에서 모델의 성능을 검증하기 위해.
제안 방법
- WSI 수준의 레이블에 기여하는 데 기여도가 높은 패치들에 대해 어텐션 점수를 할당하기 위해 트랜스포머 기반의 멀티플 인스턴스 학습(MIL) 모델을 활용한다.
- 패치들로부터 압축된 특징 표현을 추출하기 위해 오토에인코더를 사용하여 계산 부담을 감소시킨다.
- 노드는 고점수 패치들로 구성되고, 각 패치는 공간적 근접성 기반으로 K개의 가장 가까운 이웃과 간선으로 연결되는 그래프를 구성한다.
- 노드 특징과 그래프 구조를 기반으로 WSI를 갈레슨 등급으로 분류하기 위해 게이트드 어텐션 그래프 신경망(GNN)을 적용한다.
- 패치 수준의 애너테이션을 요구하지 않고, 백 수준의 레이블(WSI 레이블)을 기반으로 모델을 엔드 투 엔드로 훈련한다.
- MIL 모듈에서 도출된 상위 점수 패치들을 그래프 구축의 입력으로 사용하여 특징적인 영역에 집중한다.
실험 결과
연구 질문
- RQ1패치 수준의 애너테이션을 요구하지 않으면서도 높은 정확도를 달성할 수 있는 약한 감독형 딥러닝 모델이 갈레슨 등급 분류에서 성능을 낼 수 있는가?
- RQ2특징적인 패치들 간의 공간적 관계를 모델링하면 분류 성능가 개선되는가?
- RQ3이 설정에서 그래프 구축을 위한 최적의 ASG 모듈 수와 K-최근접 이웃 수는 얼마인가?
- RQ4선택된 고점수 패치의 비율이 모델의 강건성과 정확도에 미치는 영향은 어떠한가?
- RQ5제안된 프레임워크가 공개된 전립선암 WSI 데이터셋에서 기존 최신 기술 수준의 모델을 초월하는가?
주요 결과
- 제안된 모델은 갈레슨 2019 챌린지 데이터셋에서 정확도 0.912와 코헨의 카파 0.892를 기록하여 베이스라인 모델을 능가하였다.
- PANDA 데이터셋에서는 정확도 0.957과 코헨의 카파 0.885를 달성하여 다양한 데이터셋 간의 강력한 일반화 능력을 입증하였다.
- 아블레이션 연구에서 고점수 패치의 60%를 선택할 경우, 10% 대비 정확도가 약 75%에서 약 90%로 크게 향상됨을 확인하였다.
- 8개의 ASG 모듈을 사용할 경우 다양한 데이터셋에서 최적의 성능을 기록하였으며, 12개 모듈는 높은 계산 비용에 비해 유의미한 성능 향상 뿐 아니라 거의 없었다.
- KNN 파라미터는 성능에 미미한 영향을 미쳤으며, 모든 데이터셋에서 K=10이 가장 우수한 결과를 제공하였다.
- t-SNE 시각화 결과, 모델이 서로 다른 갈레슨 등급에 대해 특징적으로 잘 분리된 표현을 학습한 것으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.