Skip to main content
QUICK REVIEW

[論文レビュー] AutoTrial: Prompting Language Models for Clinical Trial Design

Zifeng Wang, Cao Xiao|arXiv (Cornell University)|May 19, 2023
Artificial Intelligence in Healthcare and Education被引用数 4
ひとこと要約

AutoTrial は、指示微調整、リtrieval-augmented generation (RAG)、多段階推論監視を用いて、臨床的に正確で、流暢で、一貫性のある治験登録基準を生成するファインチューニング済み言語モデルです。GPT-3.5 よりも 60% の人間評価で勝利する一方、大幅に少ないパラメータ数を用いており、制御可能で知識に基づいた、解釈可能な臨床治験設計における優れたパフォーマンスを示しています。

ABSTRACT

Clinical trials are critical for drug development. Constructing the appropriate eligibility criteria (i.e., the inclusion/exclusion criteria for patient recruitment) is essential for the trial's success. Proper design of clinical trial protocols should consider similar precedent trials and their eligibility criteria to ensure sufficient patient coverage. In this paper, we present a method named AutoTrial to aid the design of clinical eligibility criteria using language models. It allows (1) controllable generation under instructions via a hybrid of discrete and neural prompting, (2) scalable knowledge incorporation via in-context learning, and (3) explicit reasoning chains to provide rationales for understanding the outputs. Experiments on over 70K clinical trials verify that AutoTrial generates high-quality criteria texts that are fluent and coherent and with high accuracy in capturing the relevant clinical concepts to the target trial. It is noteworthy that our method, with a much smaller parameter size, gains around 60% winning rate against the GPT-3.5 baselines via human evaluations.

研究の動機と目的

  • 不適切な登録基準設計が原因で臨床治験の失敗率が高くなる問題に対処し、しばしば参加者獲得の問題や高額な修正を引き起こすことを防ぐ。
  • 言語モデルを用いて高品質な登録基準を自動生成することで、治験プロトコル作成にかかる時間とコストを削減する。
  • 指示微調整と明示的な推論監視を用いて、制御可能で知識に基づき、解釈可能な臨床治験基準の生成を可能にする。
  • 大規模な再訓練に依存することを最小限に抑え、ニューラルプロンプティングと外部リトリーブを用いて、段階的な知識更新を可能にする。
  • リトリーブ・オーバーライド生成を介して先行治験データと分野特化型知識を統合することで、生成された基準の臨床的関連性と正確性を向上させる。

提案手法

  • ユーザーが指定する疾患および治療法に関する指示に正確に従うように、登録基準を生成する言語モデルを指示微調整する。
  • 外部の高密度リトリーバーと統合されたリトリーブ・オーバーライド生成 (RAG) を用い、生成中に過去の成功治験からの関連する登録基準を動的に統合する。
  • ニューラルプロンプティングを用いて、内部の知識表現を維持・更新し、完全な再訓練なしに効率的な段階的学習を可能にする。
  • 多段階推論監視を適用し、各生成基準に対して明確な根拠を生成することで、解釈可能性と臨床的信頼性を向上させる。
  • 離散的指示テンプレートと連続的ニューラルプロンプトを組み合わせたハイブリッドプロンプティングフレームワークを用い、生成の制御性と流暢さの両立を図る。
  • 70,000件以上の臨床治験プロトコルからなる大規模データセット上で、段階的学習と評価のための指示タイプに分割して、モデルをエンドツーエンドで訓練する。
Figure 1: The workflow of the proposed AutoTrial . Step I: pre-train on unlabeled trial documents with prompts to mimic the multi-step reasoning. Step II: finetune the model to generate criteria under instructions. Step III: generate diverse target criteria by instructions with large-scale sampling
Figure 1: The workflow of the proposed AutoTrial . Step I: pre-train on unlabeled trial documents with prompts to mimic the multi-step reasoning. Step II: finetune the model to generate criteria under instructions. Step III: generate diverse target criteria by instructions with large-scale sampling

実験結果

リサーチクエスチョン

  • RQ1指示とリトリーブに基づく知識のみを用いて、ファインチューニング済み言語モデルが臨床的に正確で、流暢で、一貫性のある臨床治験登録基準を生成できるか?
  • RQ2リトリーブ・オーバーライド生成と多段階推論監視の統合が、生成された臨床基準の品質と解釈可能性をどのように向上させるか?
  • RQ3より小さな、指示微調整済みモデルが、GPT-3.5 などの大規模で汎用的な LLM よりも、臨床治験設計タスクでどれほど優れたパフォーマンスを示せるか?
  • RQ4完全な再訓練なしに新しい指示タイプが導入された場合、段階的学習メカニズムの効果はどの程度であるか?
  • RQ5推論監視、RAG、ニューラルプロンプティングの各コンポonentが、モデル全体のパフォーマンスに果たす相対的寄与度は何か?

主な発見

  • AutoTrial は、臨床的正確性 F1 スコア 0.91、精度 0.91、再現率 0.92、ジャコーデスコア 0.84 を達成し、すべてのベースライン(これらの指標で 0.5 未満)を大きく上回りました。
  • 人間評価では、AutoTrial が GPT-3.5-turbo-0301 よりも 60% の勝利率を記録し、パrameter数がはるかに少ないにもかかわらず、優れたパフォーマンスを示しました。
  • アブレーションスタディの結果、RAG やニューラルプロンプティングを削除すると性能が著しく低下し、知識統合と生成制御においてこれらが果たす重要な役割が確認されました。
  • 段階的学習版 AutoTrial は、災難的忘却を軽減し、再訓練ベースラインよりも時間が経っても強いパフォーマンスを維持していますが、4倍以上のデータで更新した後はやや劣ります。
  • 多段階推論監視により、モデルの解釈可能性が向上し、入局基準と除外基準の両方のパフォーマンスがバランスが取れました。全モデルと比較して除外基準の品質はわずかに低下しました。
  • モデルは知識統合においてスケーラビリティと効率性を示し、完全な再訓練なしにニューラルプロンプティングによる継続的更新が可能であり、進化する臨床データベースにおける実世界の展開に適しています。
AutoTrial: Prompting Language Models for Clinical Trial Design

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。