Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge-tuning Large Language Models with Structured Medical Knowledge Bases for Reliable Response Generation in Chinese

Haochun Wang, Sendong Zhao|arXiv (Cornell University)|2023. 09. 08.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 구조화된 중화 의료 지식 기반을 대규모 언어 모델(Large Language Models, LLMs)에 통합하여 의료 맥락에서의 환각 현상(Hallucination)을 줄이고 응답 신뢰도를 향상시키는 지식 튜닝(Knowledge-tuning)을 제안한다. 지식 기반에서 의료 질문-답변(QA) 쌍을 생성하고, 이를 통해 LLM을 미세조정하여 이 지식을 검색하고 추론하도록 하는 방식으로, 특히 소수 샘플(few-shot) 및 제로 샘플(-zero-shot) 설정에서 더 높은 사실적 정확도와 일관성을 달성한다. 이는 새로 공개된 cMedKnowQA 데이터셋을 통해 검증되었다.

ABSTRACT

Large Language Models (LLMs) have demonstrated remarkable success in diverse natural language processing (NLP) tasks in general domains. However, LLMs sometimes generate responses with the hallucination about medical facts due to limited domain knowledge. Such shortcomings pose potential risks in the utilization of LLMs within medical contexts. To address this challenge, we propose knowledge-tuning, which leverages structured medical knowledge bases for the LLMs to grasp domain knowledge efficiently and facilitate reliable response generation. We also release cMedKnowQA, a Chinese medical knowledge question-answering dataset constructed from medical knowledge bases to assess the medical knowledge proficiency of LLMs. Experimental results show that the LLMs which are knowledge-tuned with cMedKnowQA, can exhibit higher levels of accuracy in response generation compared with vanilla instruction-tuning and offer a new reliable way for the domain adaptation of LLMs.

연구 동기 및 목표

  • LLM이 생성한 의료 응답에서 환각 현상이 발생하는 문제, 특히 도메인 특화 지식이 부족한 중국어 맥락에서 이를 해결하기 위해.
  • LLM이 훈련 및 추론 과정에서 구조화된 의료 지식 기반에 효과적으로 액세스하고 추론할 수 있도록 하는 방법을 개발하기 위해.
  • LLM 성능을 평가하기 위한 고품질의 중국어 의료 지식 질문-답변 데이터셋인 cMedKnowQA를 구축하기 위해.
  • 표준 지표를 넘어서 신뢰성, 정확도 및 일반화 능력을 평가하기 위해.
  • 지식 튜닝이 응답 품질을 향상시키면서도 추적 가능한 지식 소스를 제공하여 의료 AI 응용 프로그램의 신뢰도를 높이는 것을 입증하기 위해.

제안 방법

  • 지식 튜닝은 GPT-4를 활용해 구조화된 의료 지식 기반에서 질문과 답변을 생성함으로써 의료 QA 쌍을 구성한다.
  • 이 방법은 추론 과정에서 외부 지식 기반에서 관련 의료 사실을 검색할 수 있는 쿼리 매개변수(키워드 및 속성)를 생성하도록 LLM을 훈련시킨다.
  • 추론 과정에서 검색된 지식을 활용해 LLM의 응답을 기반화하고 보완함으로써 사실의 일관성과 추적 가능성을 확보한다.
  • 응답 생성 중 외부 검색 모듈로 작동하는 플러그인 스타일의 의료 지식 기능을 활용한다.
  • 지식 검색 정확도, 응답 유용성, 무해성 등을 포함한 종합적인 메트릭 세트를 사용해 평가한다.
  • cMedKnowQA 데이터셋은 실제 의료 지식 기반에서 유래했으며, 훈련 및 평가를 위한 다양한 의료 실체와 속성을 포함한다.

실험 결과

연구 질문

  • RQ1표준 지시 튜닝 대비 지식 튜닝이 중국어 의료 응답 생성에서 환각 현상을 유의미하게 줄일 수 있는가?
  • RQ2제한된 데이터로 미세조정한 후 지식 튜닝이 미리 보지 못한 의료 실체에 대해 얼마나 잘 일반화되는가?
  • RQ3구조화된 의료 지식 기반에서 검색할 때 지식 튜닝이 응답 정확도와 신뢰도를 얼마나 향상시키는가?
  • RQ4추적 가능한 지식 소스 통합이 LLM이 생성한 의료 조언의 신뢰성과 해석 가능성에 기여하는가?
  • RQ5라벨이 부족한 소수 샘플 시나리오에서도 지식 튜닝된 LLM이 높은 성능을 유지할 수 있는가?

주요 결과

  • cMedKnowQA 전체 데이터셋으로 훈련한 지식 튜닝된 LLM은 의료 실체 생성에서 86.7%의 정확도를 기록하여 지식 검색 및 응답 생성 능력이 뛰어나다는 것을 보여주었다.
  • 훈련 세트에 포함된 고유한 의료 실체의 최소 0.05%만으로도 모델이 강력한 일반화 능력을 유지함을 입증하였다.
  • 소수 샘플 설정에서 실체 생성 정확도는 100개의 인스턴스일 때 60.1%에서 200개일 때 80.7%로 향상되어 높은 샘플 효율성을 보였다.
  • 지식 튜닝된 모델은 일반 지시 튜닝된 모델 및 기준 LLM보다 응답 정확도에서 뛰어나며, 환각되거나 불필요한 증상을 포함하는 경우가 적었다.
  • 표준 LLM과 비교해 잘못되거나 근거 없는 주장(예: 간담도 결석에 Rifampicin를 추천하는 것)이 크게 감소했다.
  • 지식 튜닝을 적용한 모델은 입력된 의료 지식에 존재하지 않는 검증되지 않은 증상을 추가하지 않고, 원천 지식과 더 일관된 응답을 생성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.