Skip to main content
QUICK REVIEW

[论文解读] MedChatZH: a Better Medical Adviser Learns from Better Instructions

Yang Tan, Mingchen Li|arXiv (Cornell University)|Sep 3, 2023
Topic Modeling被引用 4
一句话总结

MedChatZH 是一个基于精选的中医(TCM)文本和医疗指令配对数据集微调的中文医学对话模型,在单轮中文医学问答任务中达到最先进性能。它在自动指标(BLEU、ROUGE-L、GLEU)和微调后的奖励模型评估中均优于基线模型,相关代码、模型和数据集已开源,供社区使用。

ABSTRACT

Generative large language models (LLMs) have shown great success in various applications, including question-answering (QA) and dialogue systems. However, in specialized domains like traditional Chinese medical QA, these models may perform unsatisfactorily without fine-tuning on domain-specific datasets. To address this, we introduce MedChatZH, a dialogue model designed specifically for traditional Chinese medical QA. Our model is pre-trained on Chinese traditional medical books and fine-tuned with a carefully curated medical instruction dataset. It outperforms several solid baselines on a real-world medical dialogue dataset. We release our model, code, and dataset on https://github.com/tyang816/MedChatZH to facilitate further research in the domain of traditional Chinese medicine and LLMs.

研究动机与目标

  • 通过创建一个领域特定的对话模型,解决通用大语言模型在中医等专业领域表现不佳的问题。
  • 通过在大量中医古籍语料上预训练,并使用高质量指令数据进行微调,提升中文医学问答能力。
  • 通过严格的文本筛选流程(去除敏感、无关或口语化内容),缓解医学大语言模型中的幻觉和低质量输出问题。
  • 发布可复现的开源模型与数据集,以支持中文医学大语言模型的后续研究。

提出的方法

  • 在大规模中医文本集合上预训练一个面向中文的专用大语言模型,以增强领域知识。
  • 采用多阶段筛选流程构建高质量医疗指令数据集,包括启发式规则过滤、大语言模型辅助筛选及奖励模型打分,以剔除无关、敏感或低质量内容。
  • 使用筛选后的指令数据集对预训练模型进行指令微调,以提升医学问答与对话生成能力。
  • 采用标准自然语言处理指标(BLEU、ROUGE-L、GLEU)和领域专用奖励模型(Ziya-LLaMA-7B-Reward)评估模型性能。
  • 开展消融实验,验证指令微调对模型性能的影响。
  • 将训练好的模型、代码和数据集发布在 GitHub 上,以确保可复现性并促进社区使用。

实验结果

研究问题

  • RQ1在领域特定的中医文本和指令数据上微调的大语言模型,是否能在中文医学对话任务中超越通用模型或英文导向模型?
  • RQ2多阶段数据筛选流程(包括启发式规则、大语言模型过滤及奖励模型评分)在提升医疗指令数据质量与安全性方面的有效性如何?
  • RQ3指令微调在多大程度上提升了模型生成准确、流畅且医学上恰当的回答的能力,特别是在单轮医学问答任务中?
  • RQ4MedChatZH 在自动指标和类人类奖励评分方面,与 HuatuoGPT 和 GPT-3.5-turbo 等强基线模型相比表现如何?

主要发现

  • MedChatZH 在真实世界中文医学对话基准测试中优于多个强基线模型,在多项评估指标上表现最先进。
  • 消融实验证实,使用蒸馏后的高质量医疗指令数据进行微调,能显著提升模型的医学问答能力。
  • 使用奖励模型(Ziya-LLaMA-7B-Reward)进行评估,相比仅依赖传统指标,能提供更细致且可靠的响应质量评估。
  • 模型在 BLEU、ROUGE-L 和 GLEU 等标准 NLP 指标上表现优异,表明其生成结果与参考答案在流畅性和 n-gram 重叠度方面高度匹配。
  • 模型在多项评估标准下表现稳健,包括事实一致性、指令遵循度和响应连贯性。
  • 开源模型、代码和数据集,支持研究可复现性,并推动中文医学大语言模型的未来发展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。