Skip to main content
QUICK REVIEW

[논문 리뷰] AutoTrial: Prompting Language Models for Clinical Trial Design

Zifeng Wang, Cao Xiao|arXiv (Cornell University)|2023. 05. 19.
Artificial Intelligence in Healthcare and Education인용 수 4
한 줄 요약

AutoTrial은 지시 희소화, 검색 기반 증강 생성(RAG), 다단계 추론 감독을 통해 임상 시험의 임상적으로 정확하고 유창하며 일관된 자격 기준을 생성하는 최적화된 언어 모델입니다. GPT-3.5보다 인간 평가에서 60%의 승리 비율을 기록하면서도 훨씬 적은 파라미터를 사용하여 제어 가능하고 지식 기반이며 해석 가능한 임상 시험 설계에서 뛰어난 성능을 보입니다.

ABSTRACT

Clinical trials are critical for drug development. Constructing the appropriate eligibility criteria (i.e., the inclusion/exclusion criteria for patient recruitment) is essential for the trial's success. Proper design of clinical trial protocols should consider similar precedent trials and their eligibility criteria to ensure sufficient patient coverage. In this paper, we present a method named AutoTrial to aid the design of clinical eligibility criteria using language models. It allows (1) controllable generation under instructions via a hybrid of discrete and neural prompting, (2) scalable knowledge incorporation via in-context learning, and (3) explicit reasoning chains to provide rationales for understanding the outputs. Experiments on over 70K clinical trials verify that AutoTrial generates high-quality criteria texts that are fluent and coherent and with high accuracy in capturing the relevant clinical concepts to the target trial. It is noteworthy that our method, with a much smaller parameter size, gains around 60% winning rate against the GPT-3.5 baselines via human evaluations.

연구 동기 및 목표

  • 부적절한 자격 기준 설계로 인한 임상 시험의 높은 실패율을 해결하여 모집 문제와 비용이 많이 드는 수정 사례를 줄입니다.
  • 언어 모델을 활용해 고품질의 자격 기준을 자동화함으로써 시험 프rotocol 개발에 소요되는 시간과 비용을 줄입니다.
  • 지시 희소화와 명시적 추론 감독을 통해 제어 가능하고 지식 기반이며 해석 가능한 임상 시험 기준 생성을 가능하게 합니다.
  • 대규모 재학습에 의존하는 것을 최소화하기 위해 신경 펌프링과 외부 검색을 통해 점진적인 지식 업데이트를 지원합니다.
  • 검색 기반 증강 생성을 통해 이전 임상 시험 데이터와 도메인 특화 지식을 통합함으로써 생성된 기준의 임상적 관련성과 정확성을 향상시킵니다.

제안 방법

  • 사용자가 지정한 질환 및 치료에 대해 정확히 따라야 하는 지시를 기반으로 언어 모델을 희소화하여 자격 기준을 생성합니다.
  • 외부 밀도 검색기와 함께 검색 기반 증강 생성(RAG)을 통합하여 생성 과정 중 이전에 성공한 시험의 관련 자격 기준을 동적으로 통합합니다.
  • 신경 펌프링을 활용해 내부 지식 표현을 유지하고 업데이트함으로써 전체 재학습 없이도 효율적인 점진적 학습을 가능하게 합니다.
  • 다단계 추론 감독을 적용하여 각 생성된 기준에 대해 명시적인 근거를 생성함으로써 해석 가능성과 임상적 신뢰도를 향상시킵니다.
  • 제어력과 유창성을 균형 있게 유지하기 위해 이산 지시 템플릿과 연속 신경 펌프링을 조합한 하이브리드 펌프링 프레임워크를 사용합니다.
  • 70,000건 이상의 임상 시험 프rotocol로 구성된 대규모 데이터셋에서 종합적으로 모델을 훈련하며, 데이터를 지시 유형별로 분할하여 점진적 학습과 평가를 수행합니다.
Figure 1: The workflow of the proposed AutoTrial . Step I: pre-train on unlabeled trial documents with prompts to mimic the multi-step reasoning. Step II: finetune the model to generate criteria under instructions. Step III: generate diverse target criteria by instructions with large-scale sampling
Figure 1: The workflow of the proposed AutoTrial . Step I: pre-train on unlabeled trial documents with prompts to mimic the multi-step reasoning. Step II: finetune the model to generate criteria under instructions. Step III: generate diverse target criteria by instructions with large-scale sampling

실험 결과

연구 질문

  • RQ1지시와 검색 기반 지식만을 사용하여 최적화된 언어 모델이 임상적으로 정확하고, 자연스럽고, 일관된 임상 시험 자격 기준을 생성할 수 있는가?
  • RQ2검색 기반 증강 생성과 다단계 추론 감독의 통합이 생성된 임상 기준의 품질과 해석 가능성에 어떻게 기여하는가?
  • RQ3더 작은, 지시 희소화된 모델이 GPT-3.5와 같은 더 큰 일반 목적 언어 모델보다 임상 시험 설계 과제에서 얼마나 뛰어난 성능을 보이는가?
  • RQ4전체 재학습 없이도 새로운 지시 유형이 도입되었을 때 점진적 학습 메커니즘이 성능 유지에 얼마나 효과적인가?
  • RQ5추론 감독, RAG, 신경 펌프링 각 구성 요소가 모델의 총성능에 기여하는 상대적 기여도는 얼마인가?

주요 결과

  • AutoTrial은 임상 정확도 F1 스코어 0.91, 정밀도 0.91, 재현율 0.92, 재현율 점수(Jaccard) 0.84를 기록하여 모든 베이스라인보다 유의미하게 뛰어나며, 이들 메트릭스에서 0.5 이하의 점수를 기록한 바 있습니다.
  • 인간 평가에서 AutoTrial은 GPT-3.5-turbo-0301보다 시험 설계 과제에서 60%의 승리 비율을 기록하여, 훨씬 적은 파라미터 수에도 불구하고 뛰어난 성능을 보였습니다.
  • 제거 실험 결과, RAG나 신경 펌프링을 제거하면 성능에 심각한 하락이 발생하여, 이들이 지식 통합과 생성 제어에 핵심적인 역할을 한다는 점을 확인했습니다.
  • AutoTrial의 점진적 학습 변형은 카오스틱 포그로팅을 완화하고, 전체 재학습 베이스라인보다는 시간이 지남에 따라 뒤처지긴 하지만, 네 배 이상의 데이터 업데이트 후에도 강력한 성능을 유지합니다.
  • 다단계 추론 감독은 모델의 해석 가능성 향상과 포함/배제 기준 간의 성능 균형을 개선하며, 전체 모델 대비 배제 기준 품질 저하가 미미합니다.
  • 모델는 지식 통합에서 확장성과 효율성을 입증하였으며, 전체 재학습 없이도 신경 펌프링을 통한 지속적인 업데이트를 지원하여 변화하는 임상 데이터베이스 환경에서의 실질적 구현에 적합합니다.
AutoTrial: Prompting Language Models for Clinical Trial Design

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.