Skip to main content
QUICK REVIEW

[논문 리뷰] Multiple Instance Learning Framework with Masked Hard Instance Mining for Whole Slide Image Classification

Wenhao Tang, Sheng Huang|arXiv (Cornell University)|2023. 07. 28.
Image Retrieval and Classification TechniquesComputer Science인용 수 3
한 줄 요약

이 논문은 Siamese teacher-student 구조와 모멘텀 업데이트, 일致성 정규화를 사용한 마스크된 하드 인스턴스 마이닝(MHIM)을 통해 분류가 어려운 인스턴스를 암묵적으로 마이닝하는 방식으로, 전장 슬라이드 이미지(WSI) 분류 성능을 향상시키는 새로운 다중 인스턴스 학습(MIL) 프레임워크인 MHIM-MIL를 제안한다. 주로 주목력이 높은 인스턴스들만을 고려하는 기존 방법들과는 달리, 덜 두드러진 분류가 어려운 패치들에 초점을 맞춤으로써, CAMELYON-16 및 TCGA 폐암 데이터셋에서 더 낮은 학습 비용으로 최신 기술(SOTA) 성능을 달성한다.

ABSTRACT

The whole slide image (WSI) classification is often formulated as a multiple instance learning (MIL) problem. Since the positive tissue is only a small fraction of the gigapixel WSI, existing MIL methods intuitively focus on identifying salient instances via attention mechanisms. However, this leads to a bias towards easy-to-classify instances while neglecting hard-to-classify instances. Some literature has revealed that hard examples are beneficial for modeling a discriminative boundary accurately. By applying such an idea at the instance level, we elaborate a novel MIL framework with masked hard instance mining (MHIM-MIL), which uses a Siamese structure (Teacher-Student) with a consistency constraint to explore the potential hard instances. With several instance masking strategies based on attention scores, MHIM-MIL employs a momentum teacher to implicitly mine hard instances for training the student model, which can be any attention-based MIL model. This counter-intuitive strategy essentially enables the student to learn a better discriminating boundary. Moreover, the student is used to update the teacher with an exponential moving average (EMA), which in turn identifies new hard instances for subsequent training iterations and stabilizes the optimization. Experimental results on the CAMELYON-16 and TCGA Lung Cancer datasets demonstrate that MHIM-MIL outperforms other latest methods in terms of performance and training cost. The code is available at: https://github.com/DearCaat/MHIM-MIL.

연구 동기 및 목표

  • 기존 MIL 방법들이 주목력이 높고 분류가 쉬운 인스턴스들에 과도하게 치중되어 일반화 능력이 떨어지는 문제를 해결하기 위해.
  • 약한 감독 하에 WSI 분류에서 분류가 어려운 인스턴스들을 암묵적으로 식별하고 초점을 맞춤으로써 모델의 구분 능력을 향상시키기 위해.
  • 추가 파라미터나 복잡한 기울기 업데이트 없이도 안정성과 효율성을 향상시키는 학습 프레임워크를 개발하기 위해.
  • 일致성 제약과 마스크된 인스턴스 마이닝 전략을 통합하여 과적합을 완화하고 강건성을 향상시키기 위해.
  • 실세계 WSI 데이터셋에서 다양한 주목력 기반 MIL 모델에 대해 MHIM-MIL의 일반성과 효과성을 입증하기 위해.

제안 방법

  • MHIM-MIL는 학생 모델이 모멘텀으로 업데이트된 테이처에 의해 마이닝된 하드 인스턴스를 사용하여 훈련되는 시아미즈 테이처-학생 아키텍처를 사용한다.
  • 모멘텀 테이처는 학생 모델의 파라미터에 대한 지수이동평균(EMA)을 통해 업데이트되어 안정적이고 점진적인 지식 전이를 보장한다.
  • 주목력 점수를 바탕으로 인스턴스 마스킹 전략을 적용한다—높은 주목력 점수를 가진 패치들은 마스킹되어 학생 모델이 덜 두드러진, 분류가 어려운 인스턴스들에 집중하도록 유도된다.
  • 세 가지 하이브리드 마스킹 전략을 도입하여 하드 인스턴스 분포의 다양성을 높이고 학습 효율성을 향상시키며 과적합 위험을 감소시킨다.
  • 버킷 수준의 레이블 외에도 추가적인 감독 신호를 활용하기 위해 학생과 테이처 예측 간 일치 제약 조건을 강제로 적용한다.
  • 이 프레임워크는 주목력 기반 MIL 모델이라면 어떤 것과도 호환되어 플러그 앤 플레이 통합이 가능하며 광범위한 적용 가능성을 지닌다.

실험 결과

연구 질문

  • RQ1주목력이 높은 인스턴스들 대신 분류가 어려운 인스턴스들에 초점을 맞추는 것이 MIL 기반 WSI 분류기의 일반화 능력과 구분 능력을 향상시키는가?
  • RQ2WSI 분류에서 인스턴스 수준의 레이블이 없을 경우 하드 인스턴스들을 효과적으로 마이닝할 수 있는가?
  • RQ3모멘텀 기반 테이처-학생 프레임워크와 일치성 정규화가 MIL에서 하드 인스턴스 마이닝의 안정성과 성능을 향상시키는가?
  • RQ4기존의 주목력 기반 MIL 방법들과 비교해 마스크된 하드 인스턴스 마이닝이 과적합을 줄이고 학습 효율성을 향상시키는가?
  • RQ5MHIM-MIL는 다양한 주목력 기반 MIL 모델과 WSI 데이터셋에 대해 얼마나 일반화되는가?

주요 결과

  • MHIM-MIL는 CAMELYON-16 데이터셋에서 최신 기술(SOTA) 성능을 달성하여 기준 모델인 AB-MIL 대비 AUC에서 0.97% 향상된 성과를 보였다.
  • TCGA 폐암 데이터셋에서는 기준 모델인 AB-MIL 대비 AUC에서 1.00% 향상되어 다양한 모델 간 일관된 성능 향상을 입증했다.
  • EMA 업데이트 전략을 사용한 모멘텀 테이처가 가장 높은 성능을 기록했으며, 고정 초기화 및 비배치 기울기 업데이트 테이처보다 뛰어난 성능을 보였다.
  • 시각화 결과는 MHIM-MIL가 더 포괄적이고 정확한 종양 확률 지ap을 생성함을 보여주었으며, 진짜 종양 영역을 더 잘 커버하고 비종양 영역의 임의 경고를 줄였다.
  • 이 프레임워크는 주목력이 높은 패치들에 대한 의존도를 감소시키고 미세한, 분류가 어려운 종양 영역의 탐지 능력을 향상시켜 모델의 강건성과 일반화 능력을 향상시켰다.
  • 추가 파라미터 없이도 더 낮은 학습 비용으로 더 높은 성능을 달성하여 효율성과 안정성이 향상된 것을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.