Skip to main content
QUICK REVIEW

[논문 리뷰] Applying BERT and ChatGPT for Sentiment Analysis of Lyme Disease in Scientific Literature

Teo Sušnjak|arXiv (Cornell University)|2023. 02. 07.
Topic Modeling참고 문헌 7인용 수 7
한 줄 요약

이 논문은 BERT와 ChatGPT를 활용하여 만성 라임병에 관한 과학문헌의 정서 분석을 위한 실용적인 NLP 파이프라인을 제시한다. 설명 가능한 AI(SHAP)를 통해 과학적 논의에서의 편향을 탐지할 수 있음을 보여주며, 사전 훈련된 언어 모델과 설명 가능한 AI가 만성 라임병에 대한 논의에서 편향을 탐지하는 데 어떻게 기여할 수 있는지 보여준다. 이는 BERT와 LLM 기반 검증을 조합함으로써 5,643개의 과학적 초록에서 정서 분류의 해석 가능성과 일관성이 향상됨을 시사한다.

ABSTRACT

This chapter presents a practical guide for conducting Sentiment Analysis using Natural Language Processing (NLP) techniques in the domain of tick-borne disease text. The aim is to demonstrate the process of how the presence of bias in the discourse surrounding chronic manifestations of the disease can be evaluated. The goal is to use a dataset of 5643 abstracts collected from scientific journals on the topic of chronic Lyme disease to demonstrate using Python, the steps for conducting sentiment analysis using pre-trained language models and the process of validating the preliminary results using both interpretable machine learning tools, as well as a novel methodology of using emerging state-of-the-art large language models like ChatGPT. This serves as a useful resource for researchers and practitioners interested in using NLP techniques for sentiment analysis in the medical domain.

연구 동기 및 목표

  • 논란이 있는 주제인 만성 라임병과 같은 의료 문헌에서 재현 가능한 NLP 워크플로우를 개발하는 것.
  • 컴퓨터 기반 방법을 활용해 후기 치료 라임병 증후군(PTLDS)에 관한 과학적 논의에서 편향의 존재를 평가하는 것.
  • 모델의 해석 가능성과 인간과 유사한 텍스트 해석을 위해 SHAP를 활용해 정서 예측을 검증하는 것.
  • 사전 훈련된 모델과 LLM을 조합한 하이브리드 접근 방식이 논란이 있는 의료 주제의 과학적 텍스트 정서 분석에서 신뢰도를 향상시킬 수 있음을 보여주는 것.

제안 방법

  • 2000~2021년 동안 저널에서 수집한 5,643개의 만성 라임병 관련 과학적 초록으로 구성된 데이터셋을 활용하였다.
  • 장문의 초록을 처리하기 위해 토크나이제이션과 가중 평균을 활용한 'nlptown/bert-base-multilingual-uncased-sentiment'이라는 사전 훈련된 BERT 모델을 정서 분류에 적용하였다.
  • 특성 수준의 해석 가능성을 제공하기 위해 SHAP(SHapley Additive exPlanations)를 사용하여 정서 예측에 기여하는 단어 수준 기여도를 시각화하였다.
  • GPT-3를 통해 ChatGPT를 활용하여 모델 출력을 검증하였으며, 정서(1~5점)를 분류하고 주관적으로 강한 어휘를 식별하도록 프롬프트를 제공하였다.
  • 모델 추론 및 해석 가능성에 대해 Hugging Face Transformers와 SHAP 라이브러리를 사용한 파이썬을 활용하였다.
  • 일반적인 목적의 BERT 모델이 의료 텍스트 외의 데이터로 훈련되어 있어 의료 용어를 잘못 분류할 수 있음을 고려하여 도메인 불일치 문제를 다루었다 (예: 의학적 맥락에서 'pathology'는 중립이지만 비즈니스 맥락에선 부정적이다).

실험 결과

연구 질문

  • RQ1BERT와 같은 사전 훈련된 언어 모델이 객관성을 추구하는 과학적 초록에서 정서를 신뢰성 있게 탐지할 수 있는가?
  • RQ2ChatGPT와 같은 대규모 언어 모델을 사용해 교차 검증할 경우 BERT의 정서 예측은 얼마나 일관성이 있는가?
  • RQ3SHAP 값이 의료 텍스트의 정서 예측에 기여하는 개별 단어의 기여도를 어느 정도 설명할 수 있는가?
  • RQ4사전 훈련된 모델(리뷰 데이터로 훈련됨)과 의료 텍스트 사이의 도메인 불일치가 정서 분류 정확도에 어떤 영향을 미치는가?
  • RQ5LLM과 설명 가능한 AI 도구를 조합한 하이브리드 접근 방식이 논란이 있는 의료 주제의 정서 분석에서의 해석 가능성과 신뢰도를 향상시킬 수 있는가?

주요 결과

  • 의료 문헌의 일반적인 중립적인 어조에도 불구하고 BERT 모델은 5,643개의 과학적 초록에 대해 정서 점수를 성공적으로 할당하였다.
  • SHAP 분석을 통해 특정 의료 용어와 어구가 정서 예측에 의미 있는 기여를 한다는 것이 밝혀졌으며, 이는 모델의 투명성을 향상시켰다.
  • ChatGPT의 정서 분류(1~5점 척도) 및 주관성 식별 결과는 BERT 예측과 강한 일치를 보였으며, 모델 출력의 타당성을 검증하였다.
  • 연구는 도메인 불일치 문제가 여전히 도전 과제임을 확인하였으며, 'pathology'와 같은 의료 용어가 비의료 텍스트로 훈련된 데이터로 인해 잘못 분류될 수 있음을 보여주었다.
  • ChatGPT와 같은 LLM을 활용한 검증은 과학적 텍스트의 정서 분석 결과를 교차 확인하는 데 실용적이고 해석 가능한 방법을 제공한다.
  • 저자들은 BERT와 LLM, SHAP를 조합함으로써 의료 논의에서 강력하고 해석 가능하며 확장 가능한 정서 분석 접근 방식을 확보할 수 있다고 결론 내렸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.