[논문 리뷰] CTBench: A Comprehensive Benchmark for Evaluating Language Model Capabilities in Clinical Trial Design
CTBench는 임상시험의 기초 특징을 메타데이터를 활용하여 예측하는 데 있어 언어모델(LMs)의 성능을 평가하기 위한 새로운 벤치마크를 제안한다. 두 데이터셋—CT-Repo(임상시험.gov에서 추출한 1,690宗의 임상시험)와 CT-Pub(공개된 논문에서 인간 코딩을 통해 확보한 기준 특징을 가진 100宗의 임상시험)—을 기반으로 하며, 자동화된 평가 방법 두 가지—ListMatch-LM(GPT-4o 사용) 및 ListMatch-BERT—를 통해 LM이 생성한 기초 특징을 평가한다. 인간의 참여를 통한 검증 결과, GPT-4o는 맥락 이해 능력이 뛰어나 0.7 임계값에서 BERT를 능가함을 입증하였다.
CTBench is introduced as a benchmark to assess language models (LMs) in aiding clinical study design. Given study-specific metadata, CTBench evaluates AI models' ability to determine the baseline features of a clinical trial (CT), which include demographic and relevant features collected at the trial's start from all participants. These baseline features, typically presented in CT publications (often as Table 1), are crucial for characterizing study cohorts and validating results. Baseline features, including confounders and covariates, are also necessary for accurate treatment effect estimation in studies involving observational data. CTBench consists of two datasets: "CT-Repo," containing baseline features from 1,690 clinical trials sourced from clinicaltrials.gov, and "CT-Pub," a subset of 100 trials with more comprehensive baseline features gathered from relevant publications. Two LM-based evaluation methods are developed to compare the actual baseline feature lists against LM-generated responses. "ListMatch-LM" and "ListMatch-BERT" use GPT-4o and BERT scores (at various thresholds), respectively, for evaluation. To establish baseline results, advanced prompt engineering techniques using LLaMa3-70B-Instruct and GPT-4o in zero-shot and three-shot learning settings are applied to generate potential baseline features. The performance of GPT-4o as an evaluator is validated through human-in-the-loop evaluations on the CT-Pub dataset, where clinical experts confirm matches between actual and LM-generated features. The results highlight a promising direction with significant potential for improvement, positioning CTBench as a useful tool for advancing research on AI in CT design and potentially enhancing the efficacy and robustness of CTs.
연구 동기 및 목표
- 임상시험 설계에서 기초 특징을 예측하기 위한 표준화되고 AI 평가가 가능한 벤치마크의 부재 문제를 해결하기 위해.
- 연구자들이 관련된 인구통계학적, 임상적, 혼란 변수를 식별함으로써 편향을 줄이고 연구의 탄력성을 향상시키기 위해.
- 실제 임상시험 데이터와 전문가가 애너테이션한 기준 표준을 기반으로 재현 가능하고 확장 가능한 벤치마크를 구축하기 위해.
- 최신 언어모델(LMs)이 최소한의 메타데이터로부터 정확한 기초 특징 목록을 생성하는 능력을 평가하기 위해.
- 임상 전문가의 참여를 통한 인간-중심 평가를 통해 평가 방법의 타당성을 검증하기 위해.
제안 방법
- 두 데이터셋을 구축: CT-Repo(임상시험.gov에서 추출한 1,690개의 이행시험(RCTs))와 CT-Pub(공개된 논문에서 인간 코딩을 통해 기초 특징을 추출한 100개의 임상시험).
- 자동화된 평가 방법 두 가지 개발: ListMatch-LM(GPT-4o를 사용해 예측된 특징과 실제 특징 간 유사도 점수를 산정) 및 ListMatch-BERT(BERT 임베딩을 사용하고 임계값 기반 매칭).
- LLaMa3-70B-Instruct와 GPT-4o를 사용해 zero-shot 및 few-shot 프롬프팅을 적용하여 CT 메타데이터에서 기초 특징 목록을 생성.
- 모델 간 일관성과 재현 가능성을 확보하기 위해 고정된 시드와 온도=0.0을 사용하여 결정론적 생성 및 평가를 수행.
- 임상 전문가가 확인한 매칭 결과와 비교하여 GPT-4o의 평가 성능을 인간-중심 평가를 통해 검증하며, CT-Pub 서브셋에서 수행.
- 정밀도와 재현율의 균형을 고려해 다수의 임계값을 평가한 결과, BERT 점수의 최적 임계값으로 0.7을 선택.

실험 결과
연구 질문
- RQ1언어모델은 전체 연구 프rotocol에 접근하지 않고도 메타데이터만으로 임상시험의 기초 특징을 정확히 예측할 수 있는가?
- RQ2ListMatch-LM과 ListMatch-BERT와 같은 LLM 기반 평가 방법은 예측된 기초 특징과 실제 기초 특징 간의 유사도를 어떻게 측정하는가?
- RQ3GPT-4o는 임상 특징 기술의 미묘한 의미적 유사성을 포착하는 데서 BERT 기반 점수보다 얼마나 뛰어나게 성능을 발휘하는가?
- RQ4인간-중심 평가 환경에서 임상 전문가의 검증을 통해 자동화된 평가 지표의 신뢰성은 어느 정도인가?
- RQ5현재 언어모델에서 유도되는 사회적 편향이 기초 특징 예측을 통해 임상시험 설계에 전이될 경우, 그 위험과 제한점은 무엇인가?
주요 결과
- GPT-4o 기반 평가(ListMatch-LM)는 0.7 임계값에서 BERT 기반 평가(ListMatch-BERT)를 일관되게 능가하여 더 뛰어난 맥락 이해 능력과 유사도 탐지 능력을 보였다.
- BERT 점수의 0.7 임계값은 정밀도와 재현율의 최적 균형을 이룩하여, 특징 매칭에서 임의의 양성 및 음성 결과를 최소화하였다.
- 인간-중심 평가 결과, 전문가가 확인한 매칭 결과와 GPT-4o의 예측 간 높은 일치도를 확인하여, GPT-4o의 평가 신뢰성을 입증하였다.
- LLaMa3-70B-Instruct와 GPT-4o 모두 few-shot 프롬프팅을 통해 타당한 기초 특징 목록을 생성하여 AI 기반 임상시험 설계의 가능성을 입증하였다.
- 벤치마크 분석 결과, 현재 언어모델은 관련 기초 특징을 생성할 수 있지만, 일반적인 패tern에 과도하게 맞추거나 기능 누락을 보이는 경향이 있어 개선이 필요함을 확인하였다.
- 언어모델 내에 존재하는 사회적 편향이 기초 특징 예측을 통해 임상시험의 코hort 구성에 영향을 미칠 수 있으며, 이는 연구의 일반화 능력을 저해할 수 있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.