[논문 리뷰] Utilizing ChatGPT to Enhance Clinical Trial Enrollment
이 연구는 비정형 임상 노트에서 환자별 정보를 추출하고 임상 시험에 적합한 환자를 식별하기 위한 고품질 검색 쿼리를 생성하기 위해 ChatGPT를 사용하는 것을 제안한다. 이 방법은 최신 기술 및 인간이 생성한 쿼리와 비교해 검색 성능을 크게 향상시키며, 환자 개인정보를 보호하면서도 임상 시험 등록을 자동화하고 향상시킬 수 있는 ChatGPT의 잠재력을 입증한다.
Clinical trials are a critical component of evaluating the effectiveness of new medical interventions and driving advancements in medical research. Therefore, timely enrollment of patients is crucial to prevent delays or premature termination of trials. In this context, Electronic Health Records (EHRs) have emerged as a valuable tool for identifying and enrolling eligible participants. In this study, we propose an automated approach that leverages ChatGPT, a large language model, to extract patient-related information from unstructured clinical notes and generate search queries for retrieving potentially eligible clinical trials. Our empirical evaluation, conducted on two benchmark retrieval collections, shows improved retrieval performance compared to existing approaches when several general-purposed and task-specific prompts are used. Notably, ChatGPT-generated queries also outperform human-generated queries in terms of retrieval performance. These findings highlight the potential use of ChatGPT to enhance clinical trial enrollment while ensuring the quality of medical service and minimizing direct risks to patients.
연구 동기 및 목표
- 환자 EHR 데이터를 활용해 적합한 임상 시험을 자동으로 식별하여 낮은 임상 시험 등록률 문제를 해결하기 위해.
- ChatGPT와 같은 대규모 언어 모델을 활용해 비정형 임상 노트에서 의미 있는 구조화된 정보를 추출하기 위해.
- 더 효과적이고 의미적으로 풍부한 쿼리를 생성함으로써 임상 시험 검색의 검색 성능을 향상시키기 위해.
- LLM에 의해 생성된 쿼리가 인간이 생성한 쿼리 및 최신 기술 기반 AI 쿼리 생성 방법보다 우수한지 평가하기 위해.
- 정보 추출 및 쿼리 생성 과정에서 환자 개인정보 및 데이터 보안을 확보하기 위해.
제안 방법
- 비정형 임상 노트를 처리하고 환자 관련 핵심 정보(질병, 인구통계학적 정보, 가족력 등)를 추출하기 위해 GPT-3.5 모델(즉, ChatGPT)을 활용한다.
- 정보 추출 및 쿼리 구성 향상을 위해 역할 기반 및 작업 특화 프롬프트(예: IEMT)와 같은 전문화된 프롬프팅 전략을 설계한다.
- 추출된 환자 데이터를 임상 시험 검색 시스템에 적합한 간결하고 의미 있는 검색 쿼리로 변환한다.
- 표준 검색 메트릭(예: MAP 및 P@10)을 사용해 쿼리 효과성을 평가하기 위해 벤치마크 검색 컬렉션(CLEF 및 TREC 등)을 활용한다.
- 기준선과의 성능 비교를 위해 BM25 및 RM3와 같은 검색 모델을 적용하여 ChatGPT에 의해 생성된 쿼리의 성능을 평가한다.
- 환자 기밀성 확보를 위해 데이터 익명화 및 HIPAA 준수와 같은 개인정보 보호 조치를 시행한다.

실험 결과
연구 질문
- RQ1ChatGPT는 비정형 임상 노트에서 임상 시험 검색을 지원하기 위해 관련 환자 정보를 효과적으로 추출할 수 있는가?
- RQ2ChatGPT에 의해 생성된 쿼리는 인간이 생성한 쿼리보다 관련 임상 시험을 더 잘 검색하는가?
- RQ3ChatGPT에 의해 생성된 쿼리의 성능은 최신 기술 기반 AI 기반 쿼리 생성 방법과 비교해 어떻게 되는가?
- RQ4LLM를 사용한 임상 시험 검색에서 검색 성능을 최대화하기 위해 어떤 프롬프팅 전략이 가장 효과적인가?
- RQ5LLM에 의해 생성된 쿼리에서 환각, 의미의 왜곡, 오해(예: 否정문 오해) 등의 위험은 무엇이며, 이를 어떻게 완화할 수 있는가?
주요 결과
- ChatGPT가 전문 분야 역할을 부여받고 구체적인 작업 기술을 제공받는 IEMT 프롬프팅 전략은 두 벤치마크 컬렉션 모두에서 검색 성능을 크게 향상시켰다.
- ChatGPT에 의해 생성된 쿼리는 최신 기술 기반 AI 기반 쿼리 생성 방법보다 더 높은 평균 평균 정밀도(MAP) 및 P@10 점수를 기록했다.
- ChatGPT에 의해 생성된 쿼리는 인간이 생성한 쿼리보다 검색 효과성 면에서 뛰어나 의미적으로 풍부하고 관련성이 높은 결과를 보였다.
- IEMT 및 IEMT+RM3 설정 모두에서 검색 성능 향상이 통계적으로 유의미하게 나타났으며, 이는 구조화된 프롬프팅의 가치를 확인했다.
- ChatGPT는 복잡한 의학 용어와 약어를 정확히 이해하고 해석하는 데 강력한 의미 해석 능력을 보였다.
- 강력한 성능에도 불구하고, 모델은 응답 확장을 요청받을 경우 종종 주제의 왜곡을 유발했고, 부정문을 잘못 해석하는 경우가 있어 향후 완화가 필요한 위험 요소를 드러냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.