[论文解读] BiMediX: Bilingual Medical Mixture of Experts LLM
BiMediX 是首个专为英语和阿拉伯语设计的双语医学专家混合模型(MoE)大语言模型,旨在实现无缝、高性能的双语医学交互。它采用半自动、人工优化的翻译流程,构建了 BiMed1.3M——一个包含 130 万条双语指令的语料库,涵盖 6.32 亿个医疗专业术语,使模型在英语和阿拉伯语基准测试中达到最先进性能,相较于 Med42 和 Meditron 分别提升 2.5% 和 4.1%,在阿拉伯语任务上相较 Jais-30B 提升 10%,同时实现 8 倍于基线模型的推理速度。
In this paper, we introduce BiMediX, the first bilingual medical mixture of experts LLM designed for seamless interaction in both English and Arabic. Our model facilitates a wide range of medical interactions in English and Arabic, including multi-turn chats to inquire about additional details such as patient symptoms and medical history, multiple-choice question answering, and open-ended question answering. We propose a semi-automated English-to-Arabic translation pipeline with human refinement to ensure high-quality translations. We also introduce a comprehensive evaluation benchmark for Arabic medical LLMs. Furthermore, we introduce BiMed1.3M, an extensive Arabic-English bilingual instruction set covering 1.3 Million diverse medical interactions, resulting in over 632 million healthcare specialized tokens for instruction tuning. Our BiMed1.3M dataset includes 250k synthesized multi-turn doctor-patient chats and maintains a 1:2 Arabic-to-English ratio. Our model outperforms state-of-the-art Med42 and Meditron by average absolute gains of 2.5% and 4.1%, respectively, computed across multiple medical evaluation benchmarks in English, while operating at 8-times faster inference. Moreover, our BiMediX outperforms the generic Arabic-English bilingual LLM, Jais-30B, by average absolute gains of 10% on our Arabic medical benchmark and 15% on bilingual evaluations across multiple datasets. Our project page with source code and trained model is available at https://github.com/mbzuai-oryx/BiMediX .
研究动机与目标
- 开发一种双语医学大模型,能够在英语和阿拉伯语中实现无缝、交互式的医学对话。
- 通过创建全面、高保真的阿拉伯语-英语指令数据集,解决高质量阿拉伯语医学大模型稀缺的问题。
- 设计一种半自动、人工优化的翻译流程,确保低资源语言翻译中的语言准确性和医学准确性。
- 建立新的评估基准,用于衡量阿拉伯语医学大模型及双语医学模型的性能。
- 在无需为每个基准单独微调的前提下,实现在英语和阿拉伯语医学评估任务中的最先进性能。
提出的方法
- 开发了一种半自动、迭代式的翻译流程,将英语医学文本翻译为阿拉伯语,并结合人工验证以确保高质量、医学准确的翻译结果。
- 精心构建了 BiMed1.3M——一个包含 130 万条样本的双语指令数据集,其中包含 25 万条合成的多轮医患对话,并保持阿拉伯语与英语的词元比例为 1:2。
- BiMediX 模型采用专家混合(MoE)架构,并在 BiMed1.3M 上进行微调,实现基于输入词元的专家路由,从而支持高效、高容量的推理。
- 构建了一个全面的阿拉伯语医学评估基准,用于评估模型在阿拉伯语特有医学任务中的表现。
- 在多个英语和阿拉伯语医学基准上对模型进行了评估,包括 MCQA、开放式问答和多轮对话,采用标准化指标。
- 通过在 A100-80GB GPU 上测量延迟和每秒词元数,评估了推理效率,结果显示其推理速度比基线模型快 8 倍。
实验结果
研究问题
- RQ1双语医学专家混合模型是否能在无需为每个任务单独微调的情况下,在英语和阿拉伯语医学基准测试中均实现最先进性能?
- RQ2半自动、人工优化的翻译流程在从英语医学文本生成高质量、医学准确的阿拉伯语翻译方面效果如何?
- RQ3像 BiMed1.3M 这样大规模、多语言的指令数据集,在提升双语医学大模型的零样本和少样本泛化能力方面有多大作用?
- RQ4与现有的双语和单语医学大模型相比,BiMediX 在阿拉伯语医学理解与多语言医学推理方面表现如何?
- RQ5相较于仅针对阿拉伯语进行微调的单语阿拉伯语模型,双语预训练对阿拉伯语医学模型性能有何影响?
主要发现
- 在多个英语医学基准测试中,BiMediX 相较于 Med42 和 Meditron 分别实现了平均绝对性能提升 2.5% 和 4.1%。
- 在阿拉伯语医学基准测试中,BiMediX 相较于领先的通用阿拉伯语-英语双语大模型 Jais-30B 实现了平均 10% 的性能提升。
- 在双语评估中,BiMediX 平均领先 Jais-30B 15%,证明了其双语训练数据的有效性。
- BiMediX 的推理速度达到基线模型的 8 倍,以 A100-80GB GPU 上的每秒词元数为衡量标准。
- 该模型在无需任务特定微调的情况下,展现出在多轮对话、MCQA 和开放式问答等多样化医学任务中的强大零样本泛化能力。
- BiMed1.3M 中整合的 25 万条合成多轮医患对话显著提升了模型在后续追问和保持对话连贯性方面的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。