Skip to main content
QUICK REVIEW

[논문 리뷰] BiMediX: Bilingual Medical Mixture of Experts LLM

Sara Pieri, Sahal Shaji Mullappilly|arXiv (Cornell University)|2024. 02. 20.
Biomedical Text Mining and Ontologies인용 수 4
한 줄 요약

BiMediX는 영어와 아랍어에서 모두 원활하고 고성능의 의료 상호작용을 가능하게 하는 최초의 双어 전문 모델 기반 혼합 전문가 대규모 언어 모델(Large Language Model, LLM)이다. 이 모델은 인간 검토를 통한 반자동 번역 파이프라인을 활용하여 130만 개 샘플로 구성된 이중어 지침 데이터셋 BiMed1.3M를 구축하였으며, 이는 6억 3,200만 개의 의료 전문 토큰을 포함하고 있다. 이로 인해 영어 및 아랍어 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, Med42와 Meditron보다 각각 평균 2.5%, 4.1% 향상되었고, 아랍어 과제에서는 Jais-30B보다 10% 높은 성능을 기록하였다. 또한 추론 속도는 기존 모델 대비 8배 빠르게 구현되었다.

ABSTRACT

In this paper, we introduce BiMediX, the first bilingual medical mixture of experts LLM designed for seamless interaction in both English and Arabic. Our model facilitates a wide range of medical interactions in English and Arabic, including multi-turn chats to inquire about additional details such as patient symptoms and medical history, multiple-choice question answering, and open-ended question answering. We propose a semi-automated English-to-Arabic translation pipeline with human refinement to ensure high-quality translations. We also introduce a comprehensive evaluation benchmark for Arabic medical LLMs. Furthermore, we introduce BiMed1.3M, an extensive Arabic-English bilingual instruction set covering 1.3 Million diverse medical interactions, resulting in over 632 million healthcare specialized tokens for instruction tuning. Our BiMed1.3M dataset includes 250k synthesized multi-turn doctor-patient chats and maintains a 1:2 Arabic-to-English ratio. Our model outperforms state-of-the-art Med42 and Meditron by average absolute gains of 2.5% and 4.1%, respectively, computed across multiple medical evaluation benchmarks in English, while operating at 8-times faster inference. Moreover, our BiMediX outperforms the generic Arabic-English bilingual LLM, Jais-30B, by average absolute gains of 10% on our Arabic medical benchmark and 15% on bilingual evaluations across multiple datasets. Our project page with source code and trained model is available at https://github.com/mbzuai-oryx/BiMediX .

연구 동기 및 목표

  • 영어와 아랍어에서 모두 원활하고 상호작용 가능한 의료 대화를 수행할 수 있는 이중어 전문 대규모 언어 모델(Large Language Model, LLM) 개발
  • 고품질 아랍어 의료 대규모 언어 모델(Large Language Model, LLM)의 부족 문제를 해결하기 위해 종합적이고 고정밀도의 아랍어-영어 지침 데이터셋을 구축
  • 저자원 언어 번역에서 언어적 정확성과 의료 정확성을 확보하기 위한 반자동, 인간 검토를 통한 번역 파이프라인 설계
  • 아랍어 의료 대규모 언어 모델 및 이중어 의료 모델 평가를 위한 새로운 기준 설정
  • 각 벤치마크 별 별도의 피팅(fine-tuning) 없이도 영어 및 아랍어 의료 평가 과제에서 최신 기술 수준 성능 달성

제안 방법

  • 영어 의료 텍스트를 아랍어로 번역하기 위해 반복적이고 반자동적인 번역 파이프라인을 개발하였으며, 인간 검토를 통한 보정을 통해 고품질의 의료 정확도를 확보하였다.
  • BiMed1.3M은 130만 개 샘플로 구성된 이중어 지침 데이터셋으로, 25만 개의 합성된 다단계 의사-환자 대화 쌍을 포함하고 있으며, 아랍어 토큰 대비 영어 토큰 비율을 1:2로 유지하였다.
  • BiMediX 모델은 BiMed1.3M 데이터셋에 피팅된 혼합 전문가(Mixture-of-Experts, MoE) 아키텍처를 기반으로 하며, 입력 토큰당 전문가 라우팅을 통해 효율적이고 고용량의 추론을 가능하게 하였다.
  • 모델 성능 평가를 위한 종합적인 아랍어 의료 평가 벤치마크를 구축하여 아랍어 전용 의료 과제에서의 성능을 측정하였다.
  • 표준화된 메트릭을 사용하여 다수의 영어 및 아랍어 의료 벤치마크에서 평가를 수행하였으며, MCQA, 개방형 질의응답, 다단계 대화 등 다양한 과제를 포함하였다.
  • A100-80GB GPU에서 추론 효율성을 라이턴시와 초당 토큰 수를 측정하여 평가하였으며, 기존 모델 대비 8배 빠른 추론 속도를 입증하였다.

실험 결과

연구 질문

  • RQ1각 과제 별 별도의 피팅 없이도 이중어 전문 모델 기반 혼합 전문가 대규모 언어 모델(Large Language Model, LLM)이 영어 및 아랍어 의료 벤치마크에서 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ2반자동, 인간 검토를 통한 번역 파이프라인은 영어 의료 텍스트에서 고품질의 의료 정확도를 갖춘 아랍어 번역을 얼마나 효과적으로 생성하는가?
  • RQ3BiMed1.3M처럼 대규모 다국어 지침 데이터셋은 이중어 전문 대규모 언어 모델(Large Language Model, LLM)의 제로샷 및 피츠샷 일반화 능력을 어느 정도 향상시키는가?
  • RQ4BiMediX는 기존의 이중어 및 단일어 의료 대규모 언어 모델(Large Language Model, LLM)과 비교해 아랍어 의료 이해력 및 다국어 의료 추론 능력에서 어떤 차이를 보이는가?
  • RQ5단일어 아랍어 전용 피팅 대비 이중어 프리트레인의 영향은 아랍어 의료 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 다양한 영어 의료 벤치마크에서 BiMediX는 Med42와 Meditron보다 평균 절대 성능 향상 2.5%, 4.1%를 기록하였다.
  • 아랍어 의료 벤치마크에서 BiMediX는 주요 일반 아랍어-영어 이중어 대규모 언어 모델인 Jais-30B보다 평균 10% 높은 성능을 기록하였다.
  • 이중어 평가에서 BiMediX는 Jais-30B보다 평균 15% 높은 성능을 기록하여 이중어 훈련 데이터의 효과성을 입증하였다.
  • A100-80GB GPU에서 추론 속도 측정 결과, BiMediX는 기존 모델 대비 8배 빠른 추론 속도를 확보하였다.
  • 특정 과제에 대한 피팅 없이도 다단계 대화, MCQA, 개방형 질의응답 등 다양한 의료 과제에서 강력한 제로샷 일반화 능력을 보였다.
  • BiMed1.3M에 포함된 25만 개의 합성된 다단계 의사-환자 대화 쌍은 모델이 후속 질문을 유도하고 대화의 연속성을 유지하는 능력을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.