Skip to main content
QUICK REVIEW

[논문 리뷰] Don't Ignore Dual Logic Ability of LLMs while Privatizing: A Data-Intensive Analysis in Medical Domain

Yanrui Du, Sendong Zhao|arXiv (Cornell University)|2023. 09. 08.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 중국어 의료 문헌으로부터 대화형 의료 지식을 습득하는 대규모 언어 모델(Large Language Models, LLMs)을 연구하기 위해 CALLA 데이터셋을 소개한다. LLMs가 질문에 포함된 사실을 비판적으로 검토하지 않고 그대로 수용하는 '사실 따르기 응답'(fact-following response) 현상을 규명하고, 의료 문헌과 높은 상관관계를 가지는 지시 미세조정(Instruct Fine-Tuning, IFT) 데이터가 대화 상황에서 사전에 학습된 의료 지식을 정확하게 적용하는 데에 LLM의 능력을 크게 향상시킨다는 것을 보여준다. 이는 다른 출처의 IFT 데이터보다 우수한 성능을 발휘한다.

ABSTRACT

Extensive studies have been devoted to privatizing general-domain Large Language Models (LLMs) as Domain-Specific LLMs via feeding specific-domain data. However, these privatization efforts often ignored a critical aspect: Dual Logic Ability, which is a core reasoning ability for LLMs. The dual logic ability of LLMs ensures that they can maintain a consistent stance when confronted with both positive and negative statements about the same fact. Our study focuses on how the dual logic ability of LLMs is affected during the privatization process in the medical domain. We conduct several experiments to analyze the dual logic ability of LLMs by examining the consistency of the stance in responses to paired questions about the same fact. In our experiments, interestingly, we observed a significant decrease in the dual logic ability of existing LLMs after privatization. Besides, our results indicate that incorporating general domain dual logic data into LLMs not only enhances LLMs' dual logic ability but also further improves their accuracy. These findings underscore the importance of prioritizing LLMs' dual logic ability during the privatization process. Our study establishes a benchmark for future research aimed at exploring LLMs' dual logic ability during the privatization process and offers valuable guidance for privatization efforts in real-world applications.

연구 동기 및 목표

  • 대화 상황에서 LLMs가 중국어 의료 문헌으로부터 의료 지식을 어떻게 습득하고 적용하는지 조사하기 위해.
  • LLMs가 질문에 포함된 사실을 비판적으로 검토하지 않고 그대로 수용하는 '사실 따르기 응답' 현상을 식별하고 이를 해결하기 위해.
  • 의료 문헌 기반으로 고품질의 지시 미세조정(Instruct Fine-Tuning, IFT) 데이터를 자동으로 구성하는 프레임워크를 설계하여 대화형 지식 활용 능력을 향상시키기 위해.
  • IFT 데이터의 품질과 의료 문헌과의 관련성의 영향을 LLM의 의료 대화 작업 성능에 대해 평가하기 위해.
  • 의료 문헌 기반과 일반 도메인 LLM의 응답을 융합하여 보다 종합적이고 실용적인 의료 조언을 제공할 수 있는 방법을 탐색하기 위해.

제안 방법

  • CALLA 데이터셋은 세 가지 구성 요소로 구성된다: 의료 문헌 코퍼스, 지도 미세조정을 위한 IFT 데이터, 그리고 황금 사실(golden fact)과 일관성 있는가 아닌가에 따라 설정된 인위적 테스트 데이터.
  • LLMs의 지식 숙달도를 지침이나 예시에 얽매이지 않는 자유 대화 형식의 사실 확인 작업을 평가 기준으로 사용하여 평가한다.
  • LLMs(예: ChatGPT)를 활용하여 의료 문헌 내용을 포함한 대화를 자동 생성하는 IFT 데이터 생성 프레임워크를 제안하며, 직접 프롬프팅보다 정보 통합 능력이 향상됨을 입증한다.
  • 응답의 주관적 표현을 객관적으로 전환하는 데이터 정제 모듈을 포함하여, 실생활 적용에 있어 신뢰도를 향상시킨다.
  • LLMs의 응답과 의료 문헌 간 최장 공통 부분 문자열(Longest Common Substring, LCS)의 길이를 기반으로 한 점수를 사용하여, IFT 데이터 내 의료 문헌 정보 통합 정도를 정량화한다.
  • GPU 메모리 제약로 인해 LoRA 기반의 파라미터 효율적 미세조정을 적용하여, 기본 LLMs를 CALLA 데이터셋에 효과적으로 적응시킬 수 있도록 한다.

실험 결과

연구 질문

  • RQ1LLMs는 중국어 의료 문헌으로부터 대화 상황에서 의료 지식을 얼마나 잘 습득하고 적용할 수 있는가?
  • RQ2'사실 따르기 응답' 현상이 LLM의 의료 지식 숙달도 평가에 얼마나 심각하게 왜곡을 초래하는가?
  • RQ3IFT 데이터와 의료 문헌 간 상관관계가 LLM의 대화형 의료 지식 작업 성능에 어떤 영향을 미치는가?
  • RQ4자동 프레임워크가 의료 문헌 기반으로 고품질의 IFT 데이터를 효과적으로 생성하여 LLM의 대화형 지식 활용 능력을 향상시킬 수 있는가?
  • RQ5의료 문헌 기반과 일반 도메인 LLM의 응답을 어떻게 융합하여 보다 종합적이고 실용적인 의료 조언을 도출할 수 있는가?

주요 결과

  • '사실 따르기 응답' 현상으로 인해 LLMs는 질문에 포함된 잘못된 사실을 그대로 수용하여, 일관성 있는 테스트 케이스만 사용할 경우 정확한 평가가 어려워진다.
  • 일관성 있는 및 일관성 없는 테스트 케이스를 모두 사용함으로써 LLMs가 잘못된 사실을 거부하지 못하는 경향이 뚜렷하게 드러나, 강력한 평가 프로토콜의 필요성을 확인한다.
  • 의료 문헌과 높은 상관관계를 가지는 IFT 데이터는 LLMs가 대화 상황에서 사전에 학습된 의료 지식을 정확하게 적용하는 능력을 향상시키며, 사실 확인 작업에서 정확도가 향상된다.
  • 제안된 자동 IFT 데이터 생성 프레임워크는 직접 프롬프팅 대비 의료 문헌 정보 통합 정도를 18.8%p 향상시켰다(65.86% 대비 47.06%).
  • 데이터 정제 과정을 통해 LLM 응답에서 주관적 표현의 발생 빈도를 44%에서 7%로 감소시켜, 실생활 적용에 있어 응답의 객관성 향상에 기여한다.
  • 의료 문헌 기반과 일반 도메인 LLM의 응답을 융합하면, 개별적으로 사용할 경우보다 보다 종합적인 의료 조언을 도출할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.