[논문 리뷰] On the Generation of Medical Dialogues for COVID-19
이 논문은 코로나19 진료를 위한 双語(영어 및 중국어) 의료 대화 데이터셋인 CovidDialog을 소개하고, 사전 훈련된 Transformer, GPT, BERT-GPT 아키텍처를 활용해 미세조정된 대화 생성 모델을 개발한다. 이러한 모델들은 의사처럼 들리며 관련성 있고 임상적으로 유용한 응답을 생성하는 데 높은 성능을 보이며, 패닉 기간 동안 인공지능 기반 가상 의료 상담의 가능성을 입증한다.
Under the pandemic of COVID-19, people experiencing COVID19-related symptoms or exposed to risk factors have a pressing need to consult doctors. Due to hospital closure, a lot of consulting services have been moved online. Because of the shortage of medical professionals, many people cannot receive online consultations timely. To address this problem, we aim to develop a medical dialogue system that can provide COVID19-related consultations. We collected two dialogue datasets -- CovidDialog -- (in English and Chinese respectively) containing conversations between doctors and patients about COVID-19. On these two datasets, we train several dialogue generation models based on Transformer, GPT, and BERT-GPT. Since the two COVID-19 dialogue datasets are small in size, which bear high risk of overfitting, we leverage transfer learning to mitigate data deficiency. Specifically, we take the pretrained models of Transformer, GPT, and BERT-GPT on dialog datasets and other large-scale texts, then finetune them on our CovidDialog tasks. We perform both automatic and human evaluation of responses generated by these models. The results show that the generated responses are promising in being doctor-like, relevant to the conversation history, and clinically informative. The data and code are available at https://github.com/UCSD-AI4H/COVID-Dialogue.
연구 동기 및 목표
- 코로나19 패닉 기간 동안 의료 전문가의 부족을 해결하기 위해 온라인 상담을 위한 인공지능 기반 가상의사를 개발한다.
- 실제 환자-의사 대화를 포함한 고품질의 다국어 의료 대화 데이터셋 두 개인 CovidDialog-영어 및 CovidDialog-중국어를 수집하고 공개한다.
- 데이터 부족과 과적합 문제를 완화하기 위해 전이 학습을 활용해 이 데이터셋에 기반한 대화 생성 모델을 훈련하고 평가한다.
- 자동 평가 지표와 인간 평가를 병행해 생성된 응답의 품질을 평가하며, 관련성, 임상적 정보성, 언어적 유창성에 중점을 둔다.
- 미세조정된 대규모 언어 모델이 패닉 관련 건강 질문에 대해 임상적으로 정확하고 맥락에 적합한 응답을 생성할 잠재력을 입증한다.
제안 방법
- 온라인 의료 포럼인 icliniq.com, healthcaremagic.com, healthtap.com에서 603건의 영어 및 1,088건의 중국어 상담을 수집해 CovidDialog 데이터셋을 구성한다.
- 대화 및 텍스트 대량 코퍼스에서 사전 훈련한 모델(Transformer, GPT, BERT-GPT)을 사용하고, 과적합을 줄이기 위해 CovidDialog 데이터셋에서 미세조정한다.
- 대화 및 일반 텍스트에서 대규모 사전 훈련된 가중치로 모델을 초기화한 후 의료 대화 데이터에서 미세조정하는 전이 학습을 적용한다.
- 응답 생성에 beam search 디코딩을 사용하고 k=50로 설정하며, 퍼플렉서티, BLEU-2/4, METEOR, NIST-4, 엔트로피, 다양성(Dist-1/2) 등의 자동 평가 지표를 사용해 모델을 평가한다.
- 100개의 랜덤 샘플링된 중국어 테스트 예제에 대해 5명의 평가자와 함께 인간 평가를 수행하여 관련성, 임상적 정보성, 유창성 기준으로 응답을 평가한다.
- 다양한 아키텍처를 비교한다: 표준 Transformer, DialoGPT, BERT-GPT, 그리고 최대 상호정보량(MMI) 정규화를 적용한 변종.
실험 결과
연구 질문
- RQ1소규모 의료 대화 데이터셋에서 미세조정된 사전 훈련된 언어 모델이 임상적으로 정확하고 언어적으로 자연스러운 응답을 생성할 수 있는가?
- RQ2대규모 사전 훈련에서의 전이 학습은 자원이 제한된 의료 대화 환경에서 응답 품질을 어떻게 향상시키는가?
- RQ3생성된 임상적으로 관련성 있는 응답에서 디코더 전용(GPT), 인코더-디코더(BERT-GPT), 표준 Transformer 아키텍처 간의 상대적 성능은 어떻게 다른가?
- RQ4자동 평가 지표는 의료 대화 생성에서 인간 평가의 응답 품질 평가와 얼마나 관련이 있는가?
- RQ5노이즈가 많거나 문법적으로 잘못되었거나 모호한 중국어 의료 대화와 같은 저자원, 노이즈가 많은 언어나 도메인 이격된 언어에 적용할 경우 어떤 과제가 발생하는가?
주요 결과
- BERT-GPT는 Dist-1 및 Dist-2 점수를 통해 응답 다양성에서 가장 뛰어난 성능을 보이며, 더 다양한 결과를 생성하고 반복을 줄였다.
- DialoGPT 및 BERT-GPT와 같은 사전 훈련된 모델은 사전 훈련되지 않은 Transformer보다 퍼플렉서티가 유의미하게 낮게 나타나, 자원이 제한된 환경에서 전이 학습의 효과를 확인했다.
- 인간 평가 결과, BERT-GPT로 생성된 응답은 다른 모델 대비 관련성, 임상적 정보성, 유창성에서 높은 평가를 받았지만, 여전히 인간 기준 참조 수준에는 못 미쳤다.
- 일반 대화 데이터에서 사전 훈련된 것으로虽, DialoGPT는 중국어에서 표준 Transformer보다 성능이 열 劣했으며, 일반 대화에서 의료 상담으로의 도메인 이격이 원인일 가능성이 높다.
- BERT-GPT와 인간 기준 참조 간 성능 격차는 영어 대비 중국어에서 더 크게 나타나, 노이즈가 많고 문법적으로 잘못되었거나 모호한 중국어 의료 대화를 처리하는 데 더 큰 과제가 있음을 시사한다.
- 최대 상호정보량(MMI) 정규화는 일관되게 응답 품질을 향상시키지 못했으며, 이 특정 의료 대화 환경에서는 유의미한 이점이 제한적임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.