[논문 리뷰] Zero-shot information extraction from radiological reports using ChatGPT
이 연구는 애초에 레이디오그래픽 보고서에서 구조화된 임상 정보를 추출하기 위해 ChatGPT를 사용하는 제로샷 정보 추출 프레임워크를 제안한다. 이는 레이블이 부여된 데이터나 모델 미세조정 없이도 가능하다. 프롬프트 템플릿을 설계하고 후처리를 적용함으로써 ChatGPT는 종양 위치와 크기와 같은 단순한 IE 작업에서 경쟁적인 성능을 달성하지만, 종양 밀도나 림프절 상태와 같은 복잡한 쿼리에서는 추론 및 일관성의 한계로 인해 어려움을 겪는다.
Electronic health records contain an enormous amount of valuable information, but many are recorded in free text. Information extraction is the strategy to transform the sequence of characters into structured data, which can be employed for secondary analysis. However, the traditional information extraction components, such as named entity recognition and relation extraction, require annotated data to optimize the model parameters, which has become one of the major bottlenecks in building information extraction systems. With the large language models achieving good performances on various downstream NLP tasks without parameter tuning, it becomes possible to use large language models for zero-shot information extraction. In this study, we aim to explore whether the most popular large language model, ChatGPT, can extract useful information from the radiological reports. We first design the prompt template for the interested information in the CT reports. Then, we generate the prompts by combining the prompt template with the CT reports as the inputs of ChatGPT to obtain the responses. A post-processing module is developed to transform the responses into structured extraction results. We conducted the experiments with 847 CT reports collected from Peking University Cancer Hospital. The experimental results indicate that ChatGPT can achieve competitive performances for some extraction tasks compared with the baseline information extraction system, but some limitations need to be further improved.
연구 동기 및 목표
- 대규모 언어 모델(Large Language Models)인 ChatGPT가 레이블이 부여된 데이터나 미세조정 없이도 레이디오그래픽 보고서에서 제로샷 정보 추출을 수행할 수 있는지 조사하는 것.
- 기존 정보 추출 시스템에서 데이터 레이블링의 한계를 해결하기 위해 LLM의 제로샷 능력을 활용하는 것.
- 자유형 텍스트 CT 보고서에서 구조화된 임상 엔티티를 추출하도록 ChatGPT를 이끌기 위한 효과적인 프롬프트 템플릿을 설계하는 것.
- 실제 폐암 CT 보고서에서 기준 IE 시스템과의 성능을 비교 평가하는 것.
- 임상적 구현을 위한 ChatGPT의 추론, 일관성, 개인정보 처리 측면에서의 한계를 규명하는 것.
제안 방법
- 종양 위치, 크기, 자극성, 림프절 상태와 같은 핵심 영상학적 엔티티를 위한 작업별 프롬프트 템플릿 설계.
- 실제 CT 보고서와 템플릿을 조합하여 입력 프롬프트를 생성하고, ChatGPT의 응답 생성을 유도하는 것.
- 모델 출력을 표준화된 구조화된 추출 결과로 변환하기 위해 후처리 모듈 적용.
- 베이징대학암병원에서 확보한 847건의 실제 CT 보고서를 평가에 사용.
- ChatGPT 출력의 신뢰성 평가를 위해 상호 평가자 간 일致성 분석을 수행.
- 모호하거나 복잡한 쿼리에서 정확도 향상을 위해 프롬프트에 추가 지침을 통합.
실험 결과
연구 질문
- RQ1ChatGPT는 높은 정확도와 신뢰성으로 레이디오그래픽 보고서에서 제로샷 정보 추출을 수행할 수 있는가?
- RQ2ChatGPT의 성능는 임상적으로 관련 있는 엔티티에서 기존 기계학습 기반 IE 시스템과 비교해 어떻게 다른가?
- RQ3ChatGPT는 종양 밀도나 림프절 상태와 같은 복잡한 영상학적 개념을 추출할 때 주로 어떤 실패 유형을 보이는가?
- RQ4동일한 입력에 대해 여러 번 추론을 수행했을 때 ChatGPT의 출력은 얼마나 일관성 있는가?
- RQ5프롬프트 엔지니어링을 통해 ChatGPT의 정확도를 향상시키고 환상(hallucination)을 줄일 수 있는가?
주요 결과
- ChatGPT는 종양 위치, 긴 축과 짧은 축의 길이, 복강막 침범과 같은 단순한 IE 작업에서 높은 일관성과 낮은 오류율을 기록하며 경쟁적인 성능를 보였다.
- 종양 밀도나 림프절 상태와 같은 복잡한 쿼리에서는 추가 프롬프트 지시가 있음에도 불구하고 심각한 한계를 보였으며, 종종 일관성 없거나 잘못된 응답을 생성했다.
- ChatGPT는 유사어를 자주 잘못 분류했으며, 예를 들어 '점상'을 '자극성'으로, '복강막 두꺼움'을 '복강막 침범'으로 오인하는 등 의미적 구분에서 어려움을 겪었다.
- 동일한 프롬프트에 대해 여러 번의 추론 실행에서 출력이 변동성이 있었으며, 이는 신뢰성과 재현 가능성에 대한 우려를 제기했다.
- ChatGPT는 동의어를 인식하지 못했으며, 예를 들어 '엽간막 분리선'과 '엽간막 복강막'을 구분하지 못해 의료 용어의 추론에서 격차를 드러냈다.
- 외부 LLM에 원시 임상 데이터를 전송함으로써 개인정보 유출 위험이 발생했으며, 이는 더 작은 국소화된 LLM을 현장에 구축할 필요가 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.