Skip to main content
QUICK REVIEW

[论文解读] Taiyi: A Bilingual Fine-Tuned Large Language Model for Diverse Biomedical Tasks

Ling Luo, Jinzhong Ning|arXiv (Cornell University)|Nov 20, 2023
Topic Modeling参考文献 43被引用 7
一句话总结

Taiyi 是一个针对英文和中文多种生物医学 NLP 任务优化的双语、微调大型语言模型。在涵盖 10 种任务类型的 140 个精选生物医学数据集上采用两阶段监督微调策略,Taiyi 在 13 个基准测试集上达到最先进性能,展现出强大的双语多任务能力,尽管生成式方法在信息抽取等非生成任务中仍逊于判别式模型。

ABSTRACT

Objective: Most existing fine-tuned biomedical large language models (LLMs) focus on enhancing performance in monolingual biomedical question answering and conversation tasks. To investigate the effectiveness of the fine-tuned LLMs on diverse biomedical NLP tasks in different languages, We present Taiyi, a bilingual fine-tuned LLM for diverse biomedical tasks. Materials and Methods: We first curated a comprehensive collection of 140 existing biomedical text mining datasets (102 English and 38 Chinese datasets) across over 10 task types. Subsequently, a two-stage strategy is proposed for supervised fine-tuning to optimize the model performance across varied tasks. Results: Experimental results on 13 test sets covering named entity recognition, relation extraction, text classification, question answering tasks demonstrate that Taiyi achieves superior performance compared to general LLMs. The case study involving additional biomedical NLP tasks further shows Taiyi's considerable potential for bilingual biomedical multi-tasking. Conclusion: Leveraging rich high-quality biomedical corpora and developing effective fine-tuning strategies can significantly improve the performance of LLMs within the biomedical domain. Taiyi shows the bilingual multi-tasking capability through supervised fine-tuning. However, those tasks such as information extraction that are not generation tasks in nature remain challenging for LLM-based generative approaches, and they still underperform the conventional discriminative approaches of smaller language models.

研究动机与目标

  • 为解决现有生物医学大模型在多语言和多任务能力方面的局限性,这些模型主要聚焦于单语问答任务。
  • 探究在多样化生物医学数据集上进行监督微调是否能提升大模型在多种语言和任务类型中的性能。
  • 开发一个统一的双语模型,以支持英文和中文的生物医学 NLP 任务。
  • 评估生成式大模型在非生成任务(如命名实体识别和关系抽取)中的有效性。
  • 将微调后的 Taiyi 模型与通用大模型及传统判别式模型进行性能比较。

提出的方法

  • 整理了涵盖 102 个英文和 38 个中文数据集的 140 个精选生物医学文本挖掘数据集,覆盖 10 多种 NLP 任务类型。
  • 提出一种两阶段监督微调策略,以优化模型在多样化生物医学任务中的性能。
  • 利用高质量、领域特定的英文和中文生物医学语料库对模型进行预训练和微调。
  • 应用任务特定的输出头层和提示工程,将基础大模型适配至各类下游任务,如文本分类和问答。
  • 采用统一架构支持双语推理,实现在语言间的零样本和少样本迁移。
  • 在 13 个基准测试集上评估模型,以衡量其在命名实体识别、关系抽取等任务中的性能。

实验结果

研究问题

  • RQ1一个单一的双语大模型是否能在英文和中文的多样化生物医学 NLP 任务中实现优异性能?
  • RQ2在广泛多样的生物医学数据集上进行监督微调,如何提升多语言环境下的零样本和少样本泛化能力?
  • RQ3生成式大模型在非生成任务(如实体识别和关系抽取)中,与传统判别式模型相比,表现是更优还是更差?
  • RQ4双语数据整理与两阶段微调对跨语言迁移性能有何影响?
  • RQ5Taiyi 在专业生物医学基准测试中与通用大模型相比表现如何?

主要发现

  • Taiyi 在涵盖命名实体识别、关系抽取和文本分类等多类生物医学 NLP 任务的 13 个测试集中表现优异,优于通用大模型。
  • 该模型展现出强大的双语多任务处理能力,能有效实现英文与中文生物医学任务之间的知识迁移。
  • 尽管在问答等生成式任务中表现良好,Taiyi 在信息抽取等非生成式任务中仍逊于专用判别式模型。
  • 两阶段微调策略显著提升了模型在多样化任务类型和语言之间的泛化能力。
  • 经整理的 140 个生物医学数据集(102 个英文,38 个中文)集合在实现广泛多任务学习方面被证明是有效的。
  • Taiyi 发表于《美国医学信息学杂志》(Journal of the American Medical Informatics Association),表明其贡献已通过同行评审验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。