Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Classification of Pathology Reports using TF-IDF Features

Shivam Kalra, Larry Li|arXiv (Cornell University)|2019. 03. 05.
Biomedical Text Mining and Ontologies참고 문헌 14인용 수 14
한 줄 요약

이 연구는 SVM, XGBoost 및 로지스틱 회귀를 사용하여 TF-IDF 기반 기계학습 접근법을 제안하여 암 병리 보고서를 ICD-O 진단 카테고리로 자동 분류한다. XGBoost를 사용할 경우 92%의 정확도를 달성하여, TF-IDF가 계산 병리학 및 암 감시에 있어 핵심 진단 용어를 효과적으로 강조함을 보여준다.

ABSTRACT

A Pathology report is arguably one of the most important documents in medicine containing interpretive information about the visual findings from the patient's biopsy sample. Each pathology report has a retention period of up to 20 years after the treatment of a patient. Cancer registries process and encode high volumes of free-text pathology reports for surveillance of cancer and tumor diseases all across the world. In spite of their extremely valuable information they hold, pathology reports are not used in any systematic way to facilitate computational pathology. Therefore, in this study, we investigate automated machine-learning techniques to identify/predict the primary diagnosis (based on ICD-O code) from pathology reports. We performed experiments by extracting the TF-IDF features from the reports and classifying them using three different methods---SVM, XGBoost, and Logistic Regression. We constructed a new dataset with 1,949 pathology reports arranged into 37 ICD-O categories, collected from four different primary sites, namely lung, kidney, thymus, and testis. The reports were manually transcribed into text format after collecting them as PDF files from NCI Genomic Data Commons public dataset. We subsequently pre-processed the reports by removing irrelevant textual artifacts produced by OCR software. The highest classification accuracy we achieved was 92\% using XGBoost classifier on TF-IDF feature vectors, the linear SVM scored 87\% accuracy. Furthermore, the study shows that TF-IDF vectors are suitable for highlighting the important keywords within a report which can be helpful for the cancer research and diagnostic workflow. The results are encouraging in demonstrating the potential of machine learning methods for classification and encoding of pathology reports.

연구 동기 및 목표

  • 암 등록부가 비정형 병리 보고서를 수작업으로 분류하는 데 소요되는 시간을 줄이기 위한 과제를 해결한다.
  • 자유형 텍스트 병리 보고서에서 주요 진단(ICC-O 코드)을 자동으로 스케일러블하게 추출할 수 있도록 한다.
  • 기계학습 모델과 결합된 TF-IDF 기능의 진단 분류 효과성을 평가한다.
  • 4개 주요 암 부위에 걸쳐 1,949건의 수작업으로 전사된 병리 보고서를 포함한 새로운 공개 데이터셋을 구축한다.
  • TF-IDF가 진단 및 연구 용도로 임상적으로 관련성이 높은 关련어를 강조할 수 있음을 입증한다.

제안 방법

  • 미국 국립암연구소(NCI) 유전체 데이터 공용 저장소에서 확보한 1,949건의 수작업 전사 병리 보고서에서 TF-IDF 기능을 추출하였다.
  • 특성 품질 향상을 위해 OCR에 의해 생성된 잡음 요소를 제거하고 텍스트를 표준화하여 보고서를 사전 처리하였다.
  • TF-IDF 특성 벡터를 기반으로 SVM(선형 및 RBF), 로지스틱 회귀, XGBoost의 세 가지 분류기 모델을 훈련하고 비교하였다.
  • 해석 가능성과 임상적 관련성을 높이기 위해 LDA를 사용해 잠재 주제를 추출하고, 상위 50개의 TF-IDF 가중치를 가진 키워드를 색상으로 표시하였다.
  • 모델 성능 평가를 위해 마이크로 및 매크로 F-스코어 지표를 사용하였으며, 정밀한 성능 평가를 위해 전략적 훈련-테스트 분할을 적용하였다.
  • 추출된 키워드와 주제 간의 일치 여부를 정성적으로 점검하여 임상적 해석 가능성의 타당성을 검증하였다.

실험 결과

연구 질문

  • RQ1TF-IDF 기능은 기계학습 분류를 위한 비정형 병리 보고서의 진단 내용을 효과적으로 표현할 수 있는가?
  • RQ2SVM, 로지스틱 회귀, XGBoost 중 어떤 기계학습 분류기가 병리 보고서에서 ICD-O 진단 코드를 예측할 때 가장 높은 정확도를 달성하는가?
  • RQ3TF-IDF와 LDA가 병리 보고서에서 임상적으로 관련성이 높은 키워드와 바이오마커를 공동으로 어떻게 강조할 수 있는가?
  • RQ4이 분류 작업에서 선형 및 비선형 커널을 사용한 SVM의 성능은 어떻게 다를까?
  • RQ5제안된 방법은 고도의 진단 정확도를 유지하면서도 암 등록 보고의 수작업을 줄일 수 있는가?

주요 결과

  • XGBoost 분류기가 가장 높은 마이크로 F-스코어 0.92와 매크로 F-스코어 0.31를 기록하여 다른 모든 모델을 압도하였다.
  • 선형 커널을 사용한 SVM는 87%의 테스트 정확도를 기록하여 RBF 커널(75%)보다 유의미하게 높은 성능을 보였다.
  • 로지스틱 회귀는 78%의 테스트 정확도를 기록하였고, 선형 SVM는 87%의 정확도를 기록하여 선형 모델의 강력한 성능을 확인하였다.
  • TF-IDF 기능은 'epithelial'(상피), 'presence'(존재), 'necrosis'(괴사), 'tumor'(종양) 등의 핵심 진단 용어를 높은 가중치로 효과적으로 강조하였다.
  • LDA를 활용한 키워드 색상 표시 기법은 'tumor necrosis'(종양 괴사) 및 'lymph node involvement'(림프절 침범)와 같은 임상적으로 의미 있는 주제를 드러내어 해석 가능성을 향상시켰다.
  • 본 연구는 37개 ICD-O 카테고리에 걸쳐 1,949건의 병리 보고서를 포함한 새로운 공개 데이터셋을 구축하여 향후 자동 병리 보고서 분석 연구를 지원하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.