Skip to main content
QUICK REVIEW

[논문 리뷰] MedDialog: Two Large-scale Medical Dialogue Datasets

Xuehai He, Shu Chen|arXiv (Cornell University)|2020. 04. 07.
Topic Modeling참고 문헌 5인용 수 10
한 줄 요약

이 논문은 실시간 원격의료 플랫폼에서 수집된 0.3백만 건의 영어 및 1.1백만 건의 중국어 환자-의사 상담을 포함하는 두 개의 대규모 의료 대화 데이터셋인 MedDialog-EN과 MedDialog-CN을 소개한다. 각각 0.5백만 건과 4백만 건의 발화를 포함한다. 96개와 172개의 의료 전문 분야를 포함하며, 원격의료 응용 분야에서 인공지능 기반 의료 대화 시스템을 발전시키기 위한 다양한 고품질 훈련 데이터를 제공한다.

ABSTRACT

Medical dialogue systems are promising in assisting in telemedicine to increase access to healthcare services, improve the quality of patient care, and reduce medical costs. To facilitate the research and development of medical dialogue systems, we build two large-scale medical dialogue datasets: MedDialog-EN and MedDialog-CN. MedDialog-EN is an English dataset containing 0.3 million conversations between patients and doctors and 0.5 million utterances. MedDialog-CN is an Chinese dataset containing 1.1 million conversations and 4 million utterances. To our best knowledge, MedDialog-(EN,CN) are the largest medical dialogue datasets to date. The dataset is available at https://github.com/UCSD-AI4H/Medical-Dialogue-System

연구 동기 및 목표

  • 인공지능 기반 의료 대화 시스템을 훈련하기 위한 대규모, 다양한, 대표성을 갖춘 의료 대화 데이터셋의 부족을 해결하기 위해.
  • 기존 데이터셋이 크기가 작거나 특정 질환에 치우쳐 있거나 단일 언어에 국한되어 있다는 한계를 극복하기 위해.
  • 다양한 의료 전문 분야와 환자 인구 통계에 걸쳐 의사 수준의 지능을 갖춘 의료 대화 시스템 개발을 가능하게 하기 위해.
  • 다국어 및 다전문의 의료 대화형 AI 연구를 지원하기 위해 공개된 고품질 데이터를 제공함으로써.
  • 가상의 의사가 원격 환자 상담, 모니터링 및 간섭을 지원할 수 있도록 하여 원격의료 분야의 발전을 촉진하기 위해.

제안 방법

  • iCliniq.com(영어) 및 Haodf.com(중국어)와 같은 국제적 원격의료 플랫폼에서 실제 환자-의사 상담을 크롤링하였다.
  • 환자의 병력, 증상 기술, 대화 턴, 임상적 권고 등 구조화된 데이터를 수집하였다.
  • 소음을 줄이고 일관성을 향상시키기 위해 동일한 발화자로부터 연속된 발화를 병합하여 대화를 전처리하였다.
  • 두 개의 별도 데이터셋으로 구성: MedDialog-EN(257,454건의 영어 대화, 514,908건의 발화) 및 MedDialog-CN(1,145,231건의 중국어 대화, 3,959,333건의 발화).
  • MedDialog-EN에는 96개의 전문 분야, MedDialog-CN에는 172개의 세분화된 전문 분야를 포함하여 광범위한 의료 전문 분야 커버리지를 확보하였다.
  • 전처리 과정에서 개인을 식별할 수 있는 정보를 제거하여 데이터 프라이버시와 익명화를 유지하였다.

실험 결과

연구 질문

  • RQ1대규모, 다양한, 다국어 의료 대화 데이터셋이 의료 대화 시스템의 성능과 일반화 능력을 크게 향상시킬 수 있는가?
  • RQ2기존의 의료 대화 데이터셋이 의료 전문 분야의 전체 스펙트럼과 환자 다양성을 얼마나 잘 반영하고 있는가?
  • RQ3대규모 데이터셋이 다양한 의료 상태에서 복잡한 다턴 대화 상호작용을 처리할 수 있도록 의료 대화 모델을 얼마나 효과적으로 지원하는가?
  • RQ4다국어 및 다민족 데이터가 인공지능 기반 의료 대화 에이전트의 견고성과 공정성에 어떤 영향을 미치는가?
  • RQ5MedDialog와 같은 공개된 대규모 데이터셋이 원격의료 및 가상 헬스케어 어시스턴트 분야의 연구 및 개발을 얼마나 가속화할 수 있는가?

주요 결과

  • MedDialog-EN은 현재까지 가장 큰 영어 의료 대화 데이터셋으로, 257,454건의 환자-의사 상담과 514,908건의 발화를 포함한다.
  • MedDialog-CN은 현재까지 가장 큰 중국어 의료 대화 데이터셋으로, 1,145,231건의 상담과 3,959,333건의 발화를 포함하며, 172개의 세분화된 의료 전문 분야를 다룬다.
  • 심장내과, 신장내과, 종양학, 가정의학과 등 다양한 의료 전문 분야를 포함하여 포괄적인 커버리지를 확보하였다.
  • 양 데이터셋의 환자들은 중국의 31개 성급 행정 단위와 글로벌 지역을 아우르는 다양한 인구 통계를 반영하여 인구 편향을 최소화하였다.
  • 데이터셋은 https://github.com/UCSD-AI4H/Medical-Dialogue-System 에 공개되어 있어 개방형 연구와 재현 가능한 개발을 가능하게 한다.
  • MedDialog-EN과 MedDialog-CN은 이전의 데이터셋보다 크게 더 크며, 동일한 발화자 시퀀스를 합친 결과 MedDialog-CN은 약 340만 건의 발화를 포함하여 기존 벤치마크를 크게 초월한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.