Skip to main content
QUICK REVIEW

[論文レビュー] Adding more data does not always help: A study in medical conversation summarization with PEGASUS

Varun Nair, Namit Katariya|arXiv (Cornell University)|Nov 15, 2021
Topic Modeling被引用数 4
ひとこと要約

本研究では、PEGASUSモデルを用いた医療会話要約におけるデータスケールおよび反復ラベル付け戦略の影響を調査する。性能は1,000例のラベル付き例からすでに飽和し、アクティブラーニングや偽ラベル付け戦略が単純なデータ量の増加よりも顕著な改善をもたらさないことが判明した。これは、モデル容量とドメイン特異的用語が、より多くのデータからの利益を制限していることを示唆している。

ABSTRACT

Medical conversation summarization is integral in capturing information gathered during interactions between patients and physicians. Summarized conversations are used to facilitate patient hand-offs between physicians, and as part of providing care in the future. Summaries, however, can be time-consuming to produce and require domain expertise. Modern pre-trained NLP models such as PEGASUS have emerged as capable alternatives to human summarization, reaching state-of-the-art performance on many summarization benchmarks. However, many downstream tasks still require at least moderately sized datasets to achieve satisfactory performance. In this work we (1) explore the effect of dataset size on transfer learning medical conversation summarization using PEGASUS and (2) evaluate various iterative labeling strategies in the low-data regime, following their success in the classification setting. We find that model performance saturates with increase in dataset size and that the various active-learning strategies evaluated all show equivalent performance consistent with simple dataset size increase. We also find that naive iterative pseudo-labeling is on-par or slightly worse than no pseudo-labeling. Our work sheds light on the successes and challenges of translating low-data regime techniques in classification to medical conversation summarization and helps guides future work in this space. Relevant code available at \\url{https://github.com/curai/curai-research/tree/main/medical-summarization-ML4H-2021}.

研究の動機と目的

  • PEGASUSを医療会話要約タスクに微調整する際のデータセットサイズが性能に与える影響を評価すること。
  • 低データ環境下における要約生成タスクにおいて、アクティブラーニングおよび偽ラベル付け戦略が性能を向上させるかどうかを評価すること。
  • 医療対話要約において、反復ラベル付け戦略が単純なデータスケーリングを上回るかを検証すること。
  • ドメイン特異的でリソースが限られた医療NLPタスクにおける、PEGASUSを用いたトランスファーラーニングの限界を理解すること。

提案手法

  • 人為的にアノテートされた要約を複数の量で用意した医療会話データセット上で、PEGASUSの要約生成モデルを微調整した。
  • モデルの信頼度を用いて選択をガイドする、2つのラベル付け戦略(専門家ラベル付け:HL、偽ラベル付け:PL)を用いた反復的自己学習を実装した。
  • HL用の複数のサンプリング戦略を検討:モデルの不確実性に基づき、未ラベルデータの上位1%、下位1%、およびランダム1%を選択した。
  • 異なるトレーニングセットサイズとラベル付けイテレーションにおいて、医療用語、肯定文、ROUGEスコアのF1スコアを用いて性能を評価した。
  • Chintaguntaら(2021年)の先行研究と比較し、より大きなラベル付きデータセットを用いた場合の性能相対的評価を実施した。
  • 偽ラベル付けおよび専門家ラベル付けの影響を隔離するためのアブレーションスタディを実施した。これには、追加のラベル付けを行わないケースも含めた。

実験結果

リサーチクエスチョン

  • RQ1PEGASUSを用いた医療会話要約において、ラベル付きデータセットのサイズを増やすことで性能が一貫して向上するか?
  • RQ2アクティブラーニング戦略(例:高信頼度または不確実性の高いサンプルを選択)が、低データ環境下で単純なデータスケーリングを上回るか?
  • RQ3反復的自己学習と組み合わせた場合、偽ラベル付けは要約性能を向上させるのに有効か?
  • RQ4モデル性能はデータセットサイズに対してどのように飽和するか? さらにラベル付けを行うことが無意味になるのはどの段階か?
  • RQ5サンプリング戦略(上位1%、下位1%、ランダム1%)が低データ環境下での最終性能に与える影響はどの程度か?

主な発見

  • 医療会話要約タスクにおけるモデル性能は、1,250サンプルのトレーニングセットで早くも飽和し、6,400サンプルのセットでは0.43のF1スコアにとどまるため、小さなデータセット以降は収益逓減が顕著である。
  • 初期に1,000例の例を用い、未ラベルデータの1%を1回の偽ラベル付けイテレーションで追加したモデルは、6,400件の人的ラベル付きデータを1回のイテレーションで使用したモデル(0.43 F1)を上回り、0.44の概念F1を達成した。
  • 偽ラベル付けは、ラベルなしの条件と同等またはわずかに劣り、最大の性能向上は最初の自己学習イテレーション後に観察された。
  • 上位1%、下位1%、ランダム1%のすべての人的ラベル付け戦略が同程度の性能を示し、サンプリング戦略の選択が最終的な性能にほとんど影響しなかった。
  • 性能は理論的最大値(例:概念F1 0.44 対 0.63)と顕著に乖離しており、最適化の問題ではなく、モデル自体やデータの制限が原因であると考えられる。
  • ハイパーパramータチューニングを経ても追加データによる改善が得られなかったことから、PEGASUSは医療対話のドメイン特異的用語に適応するのが困難な高バイアスモデルである可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。