[论文解读] MedChatZH: a Better Medical Adviser Learns from Better Instructions
MedChatZH 是一个基于精选的中医(TCM)文本和医疗指令配对数据集微调的中文医学对话模型,在单轮中文医学问答任务中达到最先进性能。它在自动指标(BLEU、ROUGE-L、GLEU)和微调后的奖励模型评估中均优于基线模型,相关代码、模型和数据集已开源,供社区使用。
Generative large language models (LLMs) have shown great success in various applications, including question-answering (QA) and dialogue systems. However, in specialized domains like traditional Chinese medical QA, these models may perform unsatisfactorily without fine-tuning on domain-specific datasets. To address this, we introduce MedChatZH, a dialogue model designed specifically for traditional Chinese medical QA. Our model is pre-trained on Chinese traditional medical books and fine-tuned with a carefully curated medical instruction dataset. It outperforms several solid baselines on a real-world medical dialogue dataset. We release our model, code, and dataset on https://github.com/tyang816/MedChatZH to facilitate further research in the domain of traditional Chinese medicine and LLMs.
研究动机与目标
- 通过创建一个领域特定的对话模型,解决通用大语言模型在中医等专业领域表现不佳的问题。
- 通过在大量中医古籍语料上预训练,并使用高质量指令数据进行微调,提升中文医学问答能力。
- 通过严格的文本筛选流程(去除敏感、无关或口语化内容),缓解医学大语言模型中的幻觉和低质量输出问题。
- 发布可复现的开源模型与数据集,以支持中文医学大语言模型的后续研究。
提出的方法
- 在大规模中医文本集合上预训练一个面向中文的专用大语言模型,以增强领域知识。
- 采用多阶段筛选流程构建高质量医疗指令数据集,包括启发式规则过滤、大语言模型辅助筛选及奖励模型打分,以剔除无关、敏感或低质量内容。
- 使用筛选后的指令数据集对预训练模型进行指令微调,以提升医学问答与对话生成能力。
- 采用标准自然语言处理指标(BLEU、ROUGE-L、GLEU)和领域专用奖励模型(Ziya-LLaMA-7B-Reward)评估模型性能。
- 开展消融实验,验证指令微调对模型性能的影响。
- 将训练好的模型、代码和数据集发布在 GitHub 上,以确保可复现性并促进社区使用。
实验结果
研究问题
- RQ1在领域特定的中医文本和指令数据上微调的大语言模型,是否能在中文医学对话任务中超越通用模型或英文导向模型?
- RQ2多阶段数据筛选流程(包括启发式规则、大语言模型过滤及奖励模型评分)在提升医疗指令数据质量与安全性方面的有效性如何?
- RQ3指令微调在多大程度上提升了模型生成准确、流畅且医学上恰当的回答的能力,特别是在单轮医学问答任务中?
- RQ4MedChatZH 在自动指标和类人类奖励评分方面,与 HuatuoGPT 和 GPT-3.5-turbo 等强基线模型相比表现如何?
主要发现
- MedChatZH 在真实世界中文医学对话基准测试中优于多个强基线模型,在多项评估指标上表现最先进。
- 消融实验证实,使用蒸馏后的高质量医疗指令数据进行微调,能显著提升模型的医学问答能力。
- 使用奖励模型(Ziya-LLaMA-7B-Reward)进行评估,相比仅依赖传统指标,能提供更细致且可靠的响应质量评估。
- 模型在 BLEU、ROUGE-L 和 GLEU 等标准 NLP 指标上表现优异,表明其生成结果与参考答案在流畅性和 n-gram 重叠度方面高度匹配。
- 模型在多项评估标准下表现稳健,包括事实一致性、指令遵循度和响应连贯性。
- 开源模型、代码和数据集,支持研究可复现性,并推动中文医学大语言模型的未来发展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。