Skip to main content
QUICK REVIEW

[論文レビュー] shs-nlp at RadSum23: Domain-Adaptive Pre-training of Instruction-tuned LLMs for Radiology Report Impression Generation

Sanjeev Kumar Karn, Rikhiya Ghosh|arXiv (Cornell University)|Jun 5, 2023
Topic Modeling被引用数 5
ひとこと要約

本論文は、医療画像診断文書の要約生成を改善するために、MIMIC-IVに収録された放射線科特化型テキストを用いて、インstructチューニング済み大規模言語モデル(Bloomz)をさらに事前学習する、新しいドメイン適応型事前学習手法—general-pretrain-prompt-tune-and-special-pretrain—を提案する。この手法は、タスク固有の微調整を施さずに、生のゼロショット性能で、BioNLP 2023ワークショップのTask 1Bで1位を達成し、最先端の性能を達成した。

ABSTRACT

Instruction-tuned generative Large language models (LLMs) like ChatGPT and Bloomz possess excellent generalization abilities, but they face limitations in understanding radiology reports, particularly in the task of generating the IMPRESSIONS section from the FINDINGS section. They tend to generate either verbose or incomplete IMPRESSIONS, mainly due to insufficient exposure to medical text data during training. We present a system which leverages large-scale medical text data for domain-adaptive pre-training of instruction-tuned LLMs to enhance its medical knowledge and performance on specific medical tasks. We show that this system performs better in a zero-shot setting than a number of pretrain-and-finetune adaptation methods on the IMPRESSIONS generation task, and ranks 1st among participating systems in Task 1B: Radiology Report Summarization at the BioNLP 2023 workshop.

研究の動機と目的

  • インstructチューニング済み大規模言語モデルが、医療テキストへの露出が不十分なために、正確で簡潔な放射線科レポートの要約を生成する能力に制限を受ける問題に対処する。
  • リソースが限られた医療NLP環境における、標準的な事前学習+微調整アプローチの欠点を克服する。
  • インstructチューニング後にドメイン特化型テキストで追加の事前学習を施すことで、放射線科レポート要約タスクにおけるゼロショット性能が向上するかどうかを検証する。
  • タスク固有の適応なしに、ドメイン適応型事前学習が微調整ベースの手法を上回ることを実証する。

提案手法

  • 自然言語の指示に従う能力を、多様なNLPタスクで事前に学習済みの、事前学習済みでインストラクションチューニング済みの大規模言語モデル(Bloomz)を出発点とする。
  • 放射線科用語やレポート構造に適応させるために、大規模な放射線科レポートコーパス(MIMIC-IV)を用いて、追加のドメイン特化型事前学習を実施する。
  • すべての学習段階(一般事前学習、プロンプトチューニング、ドメイン特化型事前学習)において、同一の言語モデリング目的を維持することで一貫性を確保する。
  • 得られたモデル(RadBloomz)を、追加の微調整なしに、ゼロショット推論に用い、放射線科レポート要約生成を実行する。
  • MIMIC-IIIおよびMIMIC-CXRのテストセットで、標準的な指標(ROUGE-L、BERTScore、F1-RadGraph、F1-CheXbert)を用いて性能を評価する。
  • 同じ評価データ上で、ドメイン適応型モデルのゼロショット性能を、標準的な事前学習+微調整ベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1インストラクションチューニング済み大規模言語モデルを、ドメイン特化型の放射線科テキストでさらに事前学習することで、放射線科レポート要約タスクにおけるゼロショット性能が向上するか?
  • RQ2提案された general-pretrain-prompt-tune-and-special-pretrain パラダイムは、ゼロショット設定において、従来の事前学習+微調整アプローチを上回る性能を示すか?
  • RQ3ドメイン適応型モデルの性能は、放射線科レポート要約の標準的評価指標において、微調整済みモデルと比べてどうなるか?
  • RQ4ドメイン適応型事前学習は、医療NLPタスクにおけるタスク固有の微調整の必要性をどの程度低減するか?
  • RQ5異常なしのレポートやスタイルが異なるレポートに対して、モデルの要約生成における失敗モードや制限は何か?

主な発見

  • 提案されたドメイン適応型事前学習手法は、BioNLP 2023ワークショップのTask 1B:放射線科レポート要約において、すべての提出システムの中で最高の性能を達成し、非公開テストセットで1位を獲得した。
  • ゼロショットモデルは、MIMIC-IIIテストセットにおいて、ROUGE-L、BERTScore、F1-RadGraph、F1-CheXbertの指標すべてで、いくつかの事前学習+微調整ベースラインを上回った。
  • 微調整により一部の指標(例:ROUGE-L)が向上したが、F1-RadGraphおよびF1-CheXbertでは性能が劣ったことから、意味的整合性の観点では、微調整なしのドメイン適応型事前学習がより効果的であることが示された。
  • MIMIC-CXRテストセットにおいても、テキストのみのシステムの中で4位を記録し、マルチモodal環境でも堅牢な汎化性能を示した。
  • 誤差解析から、ROUGEのようなn-gramベースの指標は、『normal MRI』と『negative study』のようなケースで意味的類似性を捉えられず、評価プロトコルの限界を示した。
  • 検査所見が曖昧であったり、明確な異常がなければ、モデルはしばしば幻覚的または不完全な要約を生成する傾向があり、事実の整合性向上の余地があることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。