[논문 리뷰] Hierarchical Deep Learning Ensemble to Automate the Classification of Breast Cancer Pathology Reports by ICD-O Topography
이 논문은 8개 클래스로 분류된 이환자 병리 보고서의 ICD-O 해부학적 위치 코드화를 자동화하기 위해 계층적 딥 러닝 앙상블 모델을 제안한다. 최신 기술의 합성곱 신경망을 계층적 앙상블 아키텍처에서 활용함으로써, 최고의 베이스라인 CNN보다 F1 매크로 스코어에서 55% 향상되고 F1 마이크로 스코어에서 14% 이상 향상되어, 암 등록부의 수동 코드화 부담과 보고 지연을 크게 감소시킨다.
Like most global cancer registries, the National Cancer Registry in South Africa employs expert human coders to label pathology reports using appropriate International Classification of Disease for Oncology (ICD-O) codes spanning 42 different cancer types. The annotation is extensive for the large volume of cancer pathology reports the registry receives annually from public and private sector institutions. This manual process, coupled with other challenges results in a significant 4-year lag in reporting of annual cancer statistics in South Africa. We present a hierarchical deep learning ensemble method incorporating state of the art convolutional neural network models for the automatic labelling of 2201 de-identified, free text pathology reports, with appropriate ICD-O breast cancer topography codes across 8 classes. Our results show an improvement in primary site classification over the state of the art CNN model by greater than 14% for F1 micro and 55% for F1 macro scores. We demonstrate that the hierarchical deep learning ensemble improves on state-of-the-art models for ICD-O topography classification in comparison to a flat multiclass model for predicting ICD-O topography codes for pathology reports.
연구 동기 및 목표
- 남아프리카 공화국의 국가 암 등록부에서 병리 보고서의 수동 ICD-O 코드화로 인한 4년에 이르는 보고 지연 문제를 해결하기 위해.
- 딥 러닝을 활용하여 자유형 텍스트 병리 보고서를 8개의 ICD-O 해부학적 위치 코드로 자동 분류하기 위해.
- ICD-O 코드의 계층적 관계를 모델링함으로써 평면적 다중 클래스 모델을 초월한 분류 성능 향상을 위해.
- 확장 가능하고 정확하며 효율적인 텍스트 분류를 통해 전문가 인간 코드러의 의존도를 줄이기 위해.
- 온콜로지 분야에서 의료 텍스트 분류에 계층적 앙상블 CNN의 효과를 입증하기 위해.
제안 방법
- 이 방법은 유방암의 ICD-O 해부학적 위치 코드의 계층적 구조를 모델링하는 계층적 딥 러닝 앙상블을 사용한다.
- 텍스트 표현 및 분류를 위한 기본 학습기로 최신 기술의 합성곱 신경망(CNN) 모델을 사용한다.
- 정확도와 강건성을 향상시키기 위해 스태킹 또는 투표 전략을 사용해 다수의 CNN 모델 예측을 융합한다.
- 모델 아키텍처는 ICD-O 코드 분류 체계 내의 국소적 텍스트 패턴과 전반적인 계층적 관계를 모두 포착하도록 설계되었다.
- 골드 스탠다드 ICD-O 해부학적 위치 레이블이 부여된 2,201건의 탈식별 자유형 병리 보고서를 기반으로 훈련되었다.
- ICD-O 코드 계층의 부모-자식 관계를 명시적으로 모델링함으로써 평면적 다중 클래스 CNN 모델보다 성능이 뛰어나다는 점을 확인했다.
실험 결과
연구 질문
- RQ1평면적 다중 클래스 모델과 비교해 계층적 딥 러닝 앙상블이 유방암 병리 보고서의 ICD-O 해부학적 위치 코드 분류 정확도를 향상시킬 수 있는가?
- RQ2ICD-O 코드의 계층적 구조를 통합할 경우 자동 분류에서 F1 마이크로 스코어와 F1 매크로 스코어는 어느 정도 향상되는가?
- RQ3자유형 텍스트 병리 보고서 분류에서 CNN 모델의 앙상블은 개별 최신 기술 CNN 모델보다 어떻게 비교되는가?
- RQ4제안된 방법은 국가 암 등록부의 수동 코드화 부담을 상당히 줄일 수 있는가?
- RQ5계층적 설계는 희귀 및 흔한 ICD-O 코드 클래스 전반에서 일관되고 신뢰할 수 있는 예측을 이끌어내는가?
주요 결과
- 계층적 딥 러닝 앙상블은 최고 성능를 보인 베이스라인 CNN 모델 대비 F1 마이크로 스코어에서 14.1% 향상되었다.
- 모델은 F1 매크로 스코어에서 55.3% 향상되어, 특히 희귀 클래스에서 성능 향상이 두드러졌다.
- 평면적 다중 클래스 모델보다 성능이 뛰어나, ICD-O 코드 계층을 명시적으로 모델링하는 것이 유의미한 이점을 제공한다는 점을 확인했다.
- 수동 코드화에 의존하던 과정을 자동화함으로써, 암 통계 보고의 시간 지연을 크게 줄였다.
- 다양한 종류의 2,201건의 탈식별 병리 보고서에서 높은 성능를 달성하여 임상 텍스트 변형에 대한 강건성을 입증했다.
- 결과는 온콜로지 분야에서 딥 러닝과 계층적 구조 모델링을 융합한 의료 텍스트 분류의 효과성을 검증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.