Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Deep Learning Ensemble to Automate the Classification of Breast Cancer Pathology Reports by ICD-O Topography

Waheeda Saib, David Sengeh|arXiv (Cornell University)|Aug 28, 2020
AI in cancer detection参考文献 13被引用数 5
ひとこと要約

本論文は、8つのクラスに分類される非識別化された乳がん病理報告書をICD-O解剖部位コードに自動分類する階層的ディープラーニングアンサンブルモデルを提案する。階層的アンサンブルアーキテクチャにおいて最先端の畳み込みニューラルネットワーク(CNN)を活用することで、最良のベースラインCNNに比べてF1マクロスコアで55%の向上、F1ミクロスコアで14%以上の向上を達成し、がん登録における手動コード作成の負担と報告遅延を顕著に低減した。

ABSTRACT

Like most global cancer registries, the National Cancer Registry in South Africa employs expert human coders to label pathology reports using appropriate International Classification of Disease for Oncology (ICD-O) codes spanning 42 different cancer types. The annotation is extensive for the large volume of cancer pathology reports the registry receives annually from public and private sector institutions. This manual process, coupled with other challenges results in a significant 4-year lag in reporting of annual cancer statistics in South Africa. We present a hierarchical deep learning ensemble method incorporating state of the art convolutional neural network models for the automatic labelling of 2201 de-identified, free text pathology reports, with appropriate ICD-O breast cancer topography codes across 8 classes. Our results show an improvement in primary site classification over the state of the art CNN model by greater than 14% for F1 micro and 55% for F1 macro scores. We demonstrate that the hierarchical deep learning ensemble improves on state-of-the-art models for ICD-O topography classification in comparison to a flat multiclass model for predicting ICD-O topography codes for pathology reports.

研究の動機と目的

  • 南アフリカの国立がん登録における4年間の報告遅延を引き起こす病理報告書のICD-Oコードの手動処理を是正すること。
  • ディープラーニングを用いて、8つのICD-O解剖部位コードに分類される乳がん病理報告書を自動化すること。
  • ICD-Oコードの階層的関係をモデル化することで、平坦なマルチクラスモデルを超える分類性能を向上させること。
  • スケーラブルで正確かつ効率的なテキスト分類により、エキスパート人間のコード作成に依存するのを減らすこと。
  • 腫瘍学分野における医療テキスト分類において、CNNの階層的アンサンブルの有効性を実証すること。

提案手法

  • 本手法は、乳がんのICD-O解剖部位コードの階層的構造をモデル化する階層的ディープラーニングアンサンブルを採用する。
  • テキスト表現と分類のためのベースラーナーとして、最先端の畳み込みニューラルネットワーク(CNN)モデルを用いる。
  • スティッキングまたはボーリング戦略を用いて、複数のCNNモデルの予測を統合することで、耐性性と正確性を向上させる。
  • アーキテクチャは、ICD-Oコード分類の分類体系における局所的テキストパターンとグローバルな階層的関係を両方捉えるように設計されている。
  • 2,201件の非識別化された自由記述型病理報告書を、ゴールドスタンダードのICD-O解剖部位ラベルとともに学習に使用した。
  • ICD-Oコード階層の親子関係を明示的にモデル化することで、平坦なマルチクラスCNNモデルに比べて優れた性能を示した。

実験結果

リサーチクエスチョン

  • RQ1平坦なマルチクラスモデルと比較して、階層的ディープラーニングアンサンブルは、乳がん病理報告書のICD-O解剖部位コード分類の正確性を向上させることができるか?
  • RQ2ICD-Oコードの階層的構造を組み込むことで、自動分類におけるF1ミクロスコアとF1マクロスコアはどの程度向上するか?
  • RQ3CNNのアンサンブルは、個々の最先端CNNと比較して、自由記述型病理報告書の分類においてどのように異なるか?
  • RQ4提案手法は、国営がん登録における手動コード作成の負担を顕著に低減できるか?
  • RQ5階層的設計は、希少なクラスと一般的なクラスの両方において、より一貫性があり信頼性の高い予測をもたらすか?

主な発見

  • 階層的ディープラーニングアンサンブルは、最良のベースラインCNNモデルに比べてF1ミクロスコアで14.1%の向上を達成した。
  • モデルはF1マクロスコアで55.3%の向上を示し、特に希少なクラスにおいて顕著な性能向上を確認した。
  • 階層的アンサンブルは平坦なマルチクラスモデルを上回り、ICD-Oコード階層を明示的にモデル化することの利点を裏付けた。
  • エキスパート人間のコード作成に依存していたプロセスを自動化することで、がん統計の報告までの時間を顕著に短縮した。
  • 多様な2,201件の非識別化病理報告書において高い性能を達成し、臨床的テキストのばらつきに対しても頑健であることを示した。
  • 結果は、ディープラーニングと階層的構造モデリングを組み合わせることで、腫瘍学分野における医療テキスト分類の有効性を検証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。