Skip to main content
QUICK REVIEW

[論文レビュー] Extracting Thyroid Nodules Characteristics from Ultrasound Reports Using Transformer-based Natural Language Processing Methods

Aman Pathak, Zehao Yu|PubMed|Mar 31, 2023
Topic Modeling参考文献 22被引用数 7
ひとこと要約

本研究では、整理されたコーパスと微調整されたモデル(GatorTronを含む)を用いて、超音波レポートから16の臨床的関連性のある甲状腺腫瘍特徴を抽出するトランスフォーマー基盤のNLPフレームワークを提案する。GatorTronは、厳密基準(strict)でF1スコア0.8851、緩和基準(lenient)でF1スコア0.9495を達成し、BERT、RoBERTa、LongFormer、DeBERTaを上回り、臨床的テキストにおける包括的甲状腺腫瘍特徴の包括的抽出に大規模NLPを体系的かつ初の試みとして応用した。

ABSTRACT

The ultrasound characteristics of thyroid nodules guide the evaluation of thyroid cancer in patients with thyroid nodules. However, the characteristics of thyroid nodules are often documented in clinical narratives such as ultrasound reports. Previous studies have examined natural language processing (NLP) methods in extracting a limited number of characteristics (<9) using rule-based NLP systems. In this study, a multidisciplinary team of NLP experts and thyroid specialists, identified thyroid nodule characteristics that are important for clinical care, composed annotation guidelines, developed a corpus, and compared 5 state-of-the-art transformer-based NLP methods, including BERT, RoBERTa, LongFormer, DeBERTa, and GatorTron, for extraction of thyroid nodule characteristics from ultrasound reports. Our GatorTron model, a transformer-based large language model trained using over 90 billion words of text, achieved the best strict and lenient F1-score of 0.8851 and 0.9495 for the extraction of a total number of 16 thyroid nodule characteristics, and 0.9321 for linking characteristics to nodules, outperforming other clinical transformer models. To the best of our knowledge, this is the first study to systematically categorize and apply transformer-based NLP models to extract a large number of clinical relevant thyroid nodule characteristics from ultrasound reports. This study lays ground for assessing the documentation quality of thyroid ultrasound reports and examining outcomes of patients with thyroid nodules using electronic health records.

研究の動機と目的

  • 超音波レポートから16の臨床的関連性のある甲状腺腫瘍特徴を特定し、体系的に分類すること。
  • NLP専門家と甲状腺専門家による共同作業を通じて、標準化されたアノテーションガイドラインを策定すること。
  • NLPモデルの学習と評価に適した高品質で多職種連携のアノテート済みコーパスを構築すること。
  • 非構造化臨床ナラティブから多数の甲状腺腫瘍特徴を抽出する際の、最先端のトランスフォーマー基盤モデルの性能を比較すること。
  • 今後の電子的健康記録ベースの甲状腺腫瘍管理に関する成果研究およびドキュメンテーション品質評価の支援を可能にすること。

提案手法

  • NLP専門家と甲状腺専門家からなる多職種チームが、臨床意思決定に関連する16の主要な甲状腺腫瘍特徴を定義した。
  • 標準化されたガイドラインに従って、整理された超音波レポートコーパスがアノテートされ、一貫性と臨床的関連性が確保された。
  • BERT、RoBERTa、LongFormer、DeBERTa、GatorTronの5つの最先端トランスフォーマー・モデルを、アノテート済みコーパス上で序列ラベル付けタスクに微調整した。
  • 16の特徴の抽出における適合率と再現率を評価するために、厳密基準と緩和基準の両方のF1スコアを用いてモデルのパフォーマンスを評価した。
  • 複数の腫瘍を含むレポートにおける、抽出された特徴を正しい腫瘍に関連付ける能力を評価するための別個のリンクタスクを実施した。
  • 900億語以上の語彙で事前学習された大規模言語モデルGatorTronは、抽出およびリンクタスクの両方で優れたパフォーマンスを示したため、採用された。

実験結果

リサーチクエスチョン

  • RQ1どのトランスフォーマー基盤NLPモデルが、超音波レポートから包括的な16の臨床的関連性のある甲状腺腫瘍特徴を抽出する際に最も優れた性能を示すか?
  • RQ2GatorTronのような大規模言語モデルは、BERT や RoBERTa のような小規模モデルと比較して、この臨床的NLPタスクでどの程度優れているか?
  • RQ3標準化されたアノテーションガイドラインは、放射線科レポートからの甲状腺腫瘍特徴のラベリングの一貫性と信頼性を向上させることができるか?
  • RQ4NLPモデルは、複数の腫瘍を記載するレポートにおいて、抽出された特徴を正しい甲状腺腫瘍にどの程度正確に関連付けることができるか?
  • RQ5このフレームワークは、電子的健康記録ベースの甲状腺腫瘍管理に関する成果研究およびドキュメンテーション品質評価の支援に、どの程度の可能性を秘めているか?

主な発見

  • GatorTronは、超音波レポートから16の甲状腺腫瘍特徴を抽出する際、厳密基準でF1スコア0.8851、緩和基準でF1スコア0.9495を達成し、最高のスコアを記録した。
  • GatorTronは、抽出およびリンクタスクの両方において、BERT、RoBERTa、LongFormer、DeBERTaを含む他のすべてのモデルを上回った。
  • 複雑なレポートにおいても強力な一般化能力を示し、腫瘍への関連付けタスクでF1スコア0.9321を達成した。
  • 本研究では、多様な超音波レポートにおいて臨床的関連特徴を一貫してラベリングできる標準化されたアノテーションフレームワークを確立した。
  • 本研究は、非構造化臨床テキストから包括的かつ臨床的に包括的な甲状腺腫瘍特徴を抽出するため、トランスフォーマー基盤NLPを体系的かつ初の試みとして応用した。
  • 結果として、超音波レポートの品質自動評価および甲状腺腫瘍管理におけるEHRベースの成果研究の基盤が築かれた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。