Skip to main content
QUICK REVIEW

[論文レビュー] BiMediX: Bilingual Medical Mixture of Experts LLM

Sara Pieri, Sahal Shaji Mullappilly|arXiv (Cornell University)|Feb 20, 2024
Biomedical Text Mining and Ontologies被引用数 4
ひとこと要約

BiMediX は、英語とアラビア語の両方でシームレスで高性能な医療対話が可能な、最初の二言語対応医療混合専門家LLMです。半自動で人間による精査を施した翻訳パイプラインを活用し、63200万の医療特化トークンを含む130万サンプルの二言語指令データセット BiMed1.3M を作成しました。これにより、英語およびアラビア語のベンチマークで最先端のパフォーマンスを達成し、Med42 や Meditron よりそれぞれ2.5%および4.1%高い性能を発揮し、アラビア語タスクでは Jais-30B よりも10%高い性能を示しました。また、推論速度は8倍速くなりました。

ABSTRACT

In this paper, we introduce BiMediX, the first bilingual medical mixture of experts LLM designed for seamless interaction in both English and Arabic. Our model facilitates a wide range of medical interactions in English and Arabic, including multi-turn chats to inquire about additional details such as patient symptoms and medical history, multiple-choice question answering, and open-ended question answering. We propose a semi-automated English-to-Arabic translation pipeline with human refinement to ensure high-quality translations. We also introduce a comprehensive evaluation benchmark for Arabic medical LLMs. Furthermore, we introduce BiMed1.3M, an extensive Arabic-English bilingual instruction set covering 1.3 Million diverse medical interactions, resulting in over 632 million healthcare specialized tokens for instruction tuning. Our BiMed1.3M dataset includes 250k synthesized multi-turn doctor-patient chats and maintains a 1:2 Arabic-to-English ratio. Our model outperforms state-of-the-art Med42 and Meditron by average absolute gains of 2.5% and 4.1%, respectively, computed across multiple medical evaluation benchmarks in English, while operating at 8-times faster inference. Moreover, our BiMediX outperforms the generic Arabic-English bilingual LLM, Jais-30B, by average absolute gains of 10% on our Arabic medical benchmark and 15% on bilingual evaluations across multiple datasets. Our project page with source code and trained model is available at https://github.com/mbzuai-oryx/BiMediX .

研究の動機と目的

  • 英語およびアラビア語の両方で、シームレスでインタラクティブな医療対話が可能な二言語対応医療LLMの開発を目的とする。
  • 高品質なアラビア語医療LLMの不足を補うために、包括的で高精度なアラビア語-英語指令データセットの構築を目的とする。
  • 低リソース言語の翻訳において、言語的および医療的正確性を保証する半自動で人間による精査を施した翻訳パイプラインの設計を目的とする。
  • アラビア語医療LLMおよび二言語対応医療モデルの評価のための新しいベンチマークの確立を目的とする。
  • 各ベンチマークごとに別々の微調整を必要とせずに、英語およびアラビア語の医療評価タスクで最先端のパフォーマンスを達成することを目的とする。

提案手法

  • 英語医療テキストをアラビア語に翻訳するための半自動で反復的な翻訳パイプラインを開発し、高品質で医療的に正確な翻訳を保証するための人間による検証を統合した。
  • BiMed1.3M は、130万サンプルの二言語指令データセットとして収集され、25万件の合成された複数ターンの医師-患者対話が含まれており、アラビア語トークンと英語トークンの比率が1:2を維持している。
  • BiMediX モデルは、BiMed1.3M で微調整された混合専門家(MoE)アーキテクチャであり、入力トークンごとに専門家ルーティングを実行することで、効率的で高容量の推論を可能にしている。
  • モデルのアラビア語固有の医療タスクにおけるパフォーマンスを評価するため、包括的なアラビア語医療評価ベンチマークを構築した。
  • 標準化された指標を用いて、MCQA、開かれた質問形式のQA、複数ターン対話など、複数の英語およびアラビア語医療ベンチマークでモデルを評価した。
  • A100-80GB GPU 上での遅延および1秒あたりのトークン数を測定し、推論効率を評価した。その結果、ベースラインモデルと比較して8倍速い推論速度を達成した。

実験結果

リサーチクエスチョン

  • RQ1別々のタスクごとの微調整を必要とせずに、二言語対応医療混合専門家LLMが英語およびアラビア語の医療ベンチマークで最先端のパフォーマンスを達成できるか?
  • RQ2半自動で人間による精査を施した翻訳パイプラインは、英語医療テキストから高品質で医療的に正確なアラビア語翻訳を生成するのにどの程度効果的か?
  • RQ3BiMed1.3M のような大規模で多言語の指令データセットは、二言語対応医療LLMにおけるゼロショットおよびフェイズショット一般化性能をどの程度向上させるか?
  • RQ4BiMediX は、既存の二言語対応および単言語対応医療LLMと比較して、アラビア語医療理解力および多言語医療推論力において優れているか?
  • RQ5単一言語対応のアラビア語のみの微調整と比較して、二言語事前学習がアラビア語医療モデルのパフォーマンスに与える影響は何か?

主な発見

  • 複数の英語医療ベンチマークにおいて、BiMediX は Med42 や Meditron よりそれぞれ平均で2.5%および4.1%の絶対的向上を達成した。
  • アラビア語医療ベンチマークでは、代表的な汎用アラビア語-英語二言語LLMである Jais-30B より平均10%のパフォーマンス向上を達成した。
  • 二言語評価では、BiMediX は Jais-30B より平均15%高い性能を示し、その二言語学習データの有効性を裏付けた。
  • A100-80GB GPU 上で測定した結果、BiMediX はベースラインモデルと比較して推論速度が8倍速くなった。
  • タスク固有の微調整なしに、多様な医療タスク、特に複数ターン対話、MCQA、開かれた質問形式のQA において、強力なゼロショット一般化性能を示した。
  • BiMed1.3M に統合された25万件の合成された複数ターンの医師-患者対話のおかげで、モデルのフォローアップ質問の応答力および会話の一貫性維持能力が著しく向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。