[논문 리뷰] ACROBAT -- a multi-stain breast cancer histological whole-slide-image data set from routine diagnostics for computational pathology
ACROBAT는 1,153명의 초기 유방암 환자로부터 routine 진료에서 수집한 총 4,212개의 일치된 H&E 및 IHC 염색 전체 슬라이드 이미지(WSI)로 구성된 대규모 공개 전체 슬라이드 이미지(WSI) 데이터셋이다. 이 데이터셋은 이미지 정렬, 염색 유도 학습, 가상 염색, 결함 탐지 분야의 계산 병리학 연구를 가능하게 하며, 13명의 평가자가 수작업으로 작성한 37,000개의 수동 랜드마크 쌍을 통해 성능 기준 평가가 가능하다.
The analysis of FFPE tissue sections stained with haematoxylin and eosin (H&E) or immunohistochemistry (IHC) is an essential part of the pathologic assessment of surgically resected breast cancer specimens. IHC staining has been broadly adopted into diagnostic guidelines and routine workflows to manually assess status and scoring of several established biomarkers, including ER, PGR, HER2 and KI67. However, this is a task that can also be facilitated by computational pathology image analysis methods. The research in computational pathology has recently made numerous substantial advances, often based on publicly available whole slide image (WSI) data sets. However, the field is still considerably limited by the sparsity of public data sets. In particular, there are no large, high quality publicly available data sets with WSIs of matching IHC and H&E-stained tissue sections. Here, we publish the currently largest publicly available data set of WSIs of tissue sections from surgical resection specimens from female primary breast cancer patients with matched WSIs of corresponding H&E and IHC-stained tissue, consisting of 4,212 WSIs from 1,153 patients. The primary purpose of the data set was to facilitate the ACROBAT WSI registration challenge, aiming at accurately aligning H&E and IHC images. For research in the area of image registration, automatic quantitative feedback on registration algorithm performance remains available through the ACROBAT challenge website, based on more than 37,000 manually annotated landmark pairs from 13 annotators. Beyond registration, this data set has the potential to enable many different avenues of computational pathology research, including stain-guided learning, virtual staining, unsupervised pre-training, artefact detection and stain-independent models.
연구 동기 및 목표
- 일반 진료에서 수집된 일치된 H&E 및 IHC 염색을 포함한 대규모 고품질 공개 WSI 데이터셋의 부족 문제를 해결하기 위해.
- H&E 및 IHC 전체 슬라이드 이미지를 정렬하기 위한 이미지 정렬 알고리즘의 개발과 기준 평가를 지원하기 위해.
- 염색 유도 학습, 가상 염색, 염색에 영향을 받지 않는 모델 훈련과 같은 다양한 계산 병리학 연구를 가능하게 하기 위해.
- 13명의 평가자가 수작업으로 작성한 37,000개의 랜드마크 쌍을 활용한 정렬 성능 기준 평가를 위한 표준화된 기준 제공하기 위해.
제안 방법
- 여러 임상 기관에서 수술 제거 조직에서 확보한 여성의 초기 유방암 환자로부터 전체 슬라이드 이미지 수집.
- 각 환자에 대해 진단 품질과 임상적 관련성을 유지하면서 일치된 H&E 및 IHC 염색 WSI 확보.
- 이미지 정렬 알고리즘의 정량적 평가를 가능하게 하기 위해 13명의 평가자가 수작업으로 작성한 37,000개의 랜드마크 쌍을 확보.
- arXiv 및 ACROBAT 챌린지 웹사이트를 통한 데이터셋 배포로 접근성과 재현 가능성 확보.
- 정렬 외에도 비지도 사전 훈련 및 결함 탐지와 같은 다양한 계산 병리학 작업을 지원하도록 데이터셋 설계.
- 표준화된 데이터 정제 및 품질 관리로 연구 응용 분야에서의 일관성과 신뢰성 확보.
실험 결과
연구 질문
- RQ1이 데이터셋을 활용하여 딥러닝 모델이 H&E 및 IHC 전체 슬라이드 이미지 간 정확하고 강력한 정렬을 달성할 수 있는가?
- RQ2염색 유도 학습은 어떤 정도 다양한 염색 프로토콜 간 모델 일반화를 향상시킬 수 있는가?
- RQ3이 다중 염색, 임상적으로 확보된 WSI 데이터셋을 기반으로 훈련된 가상 염색 방법의 효과는 어떠한가?
- RQ4이 데이터셋을 기반으로 한 비지도 사전 훈련이 생물표지자 점수 평가의 후행 분류 성능을 향상시킬 수 있는가?
- RQ5실제 진료용 WSI를 사용할 때 염색에 영향을 받지 않는 모델 개발의 주요 과제는 무엇인가?
주요 결과
- ACROBAT 데이터셋은 1,153명의 환자로부터 확보한 총 4,212개의 전체 슬라이드 이미지로 구성되어 있으며, 일치된 H&E 및 IHC 염색을 포함하여 유방암 병리학 분야에서 가장 큰 공개된 다중 염색 WSI 데이터셋이다.
- 13명의 평가자가 수작업으로 작성한 37,000개의 랜드마크 쌍이 포함되어 있어 이미지 정렬 알고리즘의 고정밀 기준 평가가 가능하다.
- 염색 유도 학습, 가상 염색, 결함 탐지 등 다양한 계산 병리학 응용을 지원한다.
- 일반 진료 워크플로우에서 수집되어 높은 임상적 관련성과 실제 세계의 변동성을 반영한다.
- arXiv 및 ACROBAT 챌린지 웹사이트를 통해 공개되어 있으며, 알고리즘 평가를 위한 성능 지표도 접근 가능하다.
- 염색 방식 간 일관된 해부학적 대응을 제공하므로 염색에 영향을 받지 않는 모델 개발이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.