[논문 리뷰] Large Language Models Leverage External Knowledge to Extend Clinical Insight Beyond Language Boundaries
이 연구는 외부 임상 지식과 소수 예시를 통합함으로써 비영어 의료 환경에서 대규모 언어 모델(Large Language Models, LLMs)의 성능을 향상시키기 위해 지식 및 소수 예시 강화 인컨텍스트 학습(Knowledge and Few-shot Enhancement in-context Learning, KFE) 프레임워크를 도입한다. KFE는 중국 국립 의료 자격 시험(CNMLE-2022)에서 성능을 크게 향상시켜 GPT-4가 82.59/100점을 기록하게 하였으며, 이는 인간 평균 점수(68.70)를 초월하고, 13B 파라미터 모델조차도 시험에 합격하게 하여 자원이 부족한 언어적 환경에서의 강건성과 확장성을 입증한다.
$ extbf{Objectives}$: Large Language Models (LLMs) such as ChatGPT and Med-PaLM have excelled in various medical question-answering tasks. However, these English-centric models encounter challenges in non-English clinical settings, primarily due to limited clinical knowledge in respective languages, a consequence of imbalanced training corpora. We systematically evaluate LLMs in the Chinese medical context and develop a novel in-context learning framework to enhance their performance. $ extbf{Materials and Methods}$: The latest China National Medical Licensing Examination (CNMLE-2022) served as the benchmark. We collected 53 medical books and 381,149 medical questions to construct the medical knowledge base and question bank. The proposed Knowledge and Few-shot Enhancement In-context Learning (KFE) framework leverages the in-context learning ability of LLMs to integrate diverse external clinical knowledge sources. We evaluated KFE with ChatGPT(GPT3.5), GPT4, Baichuan2(BC2)-7B, and BC2-13B in CNMLE-2022 and investigated the effectiveness of different pathways for incorporating LLMs with medical knowledge from 7 perspectives. $ extbf{Results}$: Directly applying ChatGPT failed to qualify for the CNMLE-2022 at a score of 51. Cooperated with the KFE, the LLMs with varying sizes yielded consistent and significant improvements. The ChatGPT's performance surged to 70.04 and GPT-4 achieved the highest score of 82.59. This surpasses the qualification threshold (60) and exceeds the average human score of 68.70. It also enabled a smaller BC2-13B to pass the examination, showcasing the great potential in low-resource settings. $ extbf{Conclusion}$: By synergizing medical knowledge through in-context learning, LLM can extend clinical insight beyond language barriers, significantly reducing language-related disparities of LLM applications and ensuring global benefit in healthcare.
연구 동기 및 목표
- 영어 중심의 LLM 성능이 비영어 임상 환경에서 불균형한 훈련 데이터와 제한된 多국어 임상 지식으로 인해 떨어지는 문제를 해결하기 위해.
- 외부 의료 지식과 예시 사례를 활용한 인컨텍스트 학습을 통해 훈련 없이도 확장 가능한 프레임워크를 개발하기 위해.
- 중국어에서 고위험 의료 시험에서 LLM 성능 향상을 위한 다양한 지식 통합 경로의 효과를 평가하기 위해.
- 정제된 임상 지식과 소수 예시를 통합함으로써 더 작은, 자원이 부족한 LLM이 전문가 수준의 성능을 달성할 수 있음을 입증하기 위해.
- 언어적 및 자원 제약이 있는 환경에서 AI 기반 의료 접근성 격차를 줄이기 위해 전 세계적 접근성을 보장하기 위해.
제안 방법
- CNMLE-2022에 대응하는 381,149道의 질문을 포함한 53본의 의학 교과서에서 종합적인 의료 지식 기반을 구축하였다.
- KFE 프레임워크를 설계하여 관련 임상 지식과 유사한 과거 질문을 검색하여 인컨텍스트 학습을 위한 맥락 인식형 프롬프트를 구성하였다.
- 특정 지시사항, 검색된 지식, 예시 사례, 대상 질문을 하나의 프롬프트에 통합하여 LLM의 추론를 이끌었다.
- 모델 미세조정이나 재훈련 없이도 LLM의 인컨텍스트 학습 능력을 활용하여 동적으로 새로운 입력에 적응하도록 하였다.
- GPT-3.5, GPT-4, Baichuan2-7b, Baichuan2-13b를 포함한 여러 LLM을 KFE 프레임워크 하에서 CNMLE-2022 벤치마크에서 평가하였다.
- 성능 향상에 가장 효과적인 구성 요소를 도출하기 위해 지식 통합 경로 7종을 체계적으로 분석하였다.

실험 결과
연구 질문
- RQ1외부 임상 지식과 소수 예시가 중국어와 같은 비영어 언어에서 고위험 의료 자격 시험에서 LLM 성능을 크게 향상시킬 수 있는가?
- RQ2KFE 프레임워크는 모델의 미세조정이나 재훈련 없이 LLM의 임상 추론 능력을 어떻게 향상시키는가?
- RQ3다양한 의료 지식 소스를 LLM에 통합하기 위한 가장 효과적인 경로는 무엇인가?
- RQ4정제된 지식과 소수 예시를 통합한 더 작은, 자원이 부족한 LLM이 의료 시험에서 전문가 수준의 성능을 달성할 수 있는가?
- RQ5KFE 프레임워크는 AI 기반 의료 응용 분야에서 언어적 및 자원 기반 격차를 어느 정도 줄일 수 있는가?
주요 결과
- KFE 프레임워크를 통해 GPT-4는 CNMLE-2022에서 82.59점의 성적을 기록하여 인간 평균 점수(68.70)를 초월하고, 60점 합격 기준선을 넘어서게 되었다.
- ChatGPT(GPT-3.5)는 KFE 적용 후 낙제점이었던 51점에서 70.04점으로 향상되어 일관되고 뚜렷한 성능 향상을 보였다.
- Baichuan2-13B 모델은 더 작은 크기이자 의료 작업에 덜 사전 훈련된 상태였음에도 불구하고 KFE 통합 후 CNMLE-2022에 합격하여 자원이 부족한 환경에서의 잠재력을 입증하였다.
- KFE 프레임워크는 70억에서 1.7조 파라미터에 이르는 다양한 크기의 LLM에서 뛰어난 성능을 보였으며, 광범위한 확장성과 일반화 능력을 보여주었다.
- 다양한 지식 통합 경로는 성능 향상에 차이를 보였으며, 최적의 구성은 지식 검색, 예시 선택, 구조화된 프롬프팅의 조합이었다.
- 본 연구는 외부 지식을 통한 인컨텍스트 학습이 언어 경계를 초월해 임상 통찰력을 효과적으로 확장할 수 있음을 확인하였으며, AI 의료 접근성 격차를 줄이는 데 기여한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.