Skip to main content
QUICK REVIEW

[论文解读] A Survey of Pre-trained Language Models for Processing Scientific Text

Xanh Ho, Anh Khoa Duong Nguyen|arXiv (Cornell University)|Jan 31, 2024
Topic Modeling被引用 4
一句话总结

本文首次全面综述了科学文本预训练语言模型(SciLMs),涵盖2019至2023年间在生物医学、计算机科学、化学和数学领域发布的117个模型。该研究分析了模型架构、性能趋势与评估实践,识别出在鲁棒性、泛化能力和可解释性方面的关键差距,并提出标准化基准与多模态融合,以推动可靠、领域无关且语言无关的SciLM发展。

ABSTRACT

The number of Language Models (LMs) dedicated to processing scientific text is on the rise. Keeping pace with the rapid growth of scientific LMs (SciLMs) has become a daunting task for researchers. To date, no comprehensive surveys on SciLMs have been undertaken, leaving this issue unaddressed. Given the constant stream of new SciLMs, appraising the state-of-the-art and how they compare to each other remain largely unknown. This work fills that gap and provides a comprehensive review of SciLMs, including an extensive analysis of their effectiveness across different domains, tasks and datasets, and a discussion on the challenges that lie ahead.

研究动机与目标

  • 为解决科学语言模型(SciLMs)缺乏全面综述的问题,该问题阻碍了对其演化历程与比较性能的理解。
  • 系统性地回顾117个SciLMs在不同领域、语言与架构下的表现,重点关注其在命名实体识别(NER)、问答(QA)和关系抽取等自然语言处理任务中的有效性。
  • 分析随时间推移的性能趋势,突出生物医学领域及基于BERT的编码器架构的偏见,以及非英语与多模态模型的兴起。
  • 识别鲁棒性、泛化能力与可解释性方面的关键挑战,并为未来模型开发提出可操作的改进建议。
  • 倡导建立标准化的多领域基准,以实现对不同科学任务与语言中SciLMs的公平且可靠的评估。

提出的方法

  • 通过系统性文献回顾,识别并分类2019年至2023年9月间发表的117个科学文本预训练语言模型。
  • 基于三个维度对模型进行分析:领域(生物医学、计算机科学、化学、数学)、语言(特别是非英语)以及模型规模(参数量与架构类型)。
  • 在25个基准数据集上,针对12项常见自然语言处理任务进行性能评估,重点关注任务特定指标与时间趋势。
  • 该综述识别出当前评估实践中的关键局限,包括缺乏对抗性测试、跨数据集泛化评估不足,以及解释性相关数据集稀疏。
  • 作者提出改进建议,包括整合知识库、扩大模型规模、利用多模态内容(如图表)以及支持低资源语言。
  • 呼吁建立标准化的多领域基准,以确保模型与任务之间公平且可复现的比较。

实验结果

研究问题

  • RQ1截至当前,科学文本预训练语言模型的发展状况如何?从2019年到2023年,其在架构、领域覆盖与语言支持方面有何演变?
  • RQ2SciLMs在主要科学自然语言处理任务中的表现如何?其主导架构与随时间推移的性能趋势是什么?
  • RQ3当前SciLM评估实践中的关键局限是什么,特别是在鲁棒性、泛化能力与可解释性方面?
  • RQ4未来SciLMs如何通过整合知识库、多模态内容以及支持低资源语言得到改进?
  • RQ5标准化基准在实现跨领域与任务对SciLMs进行公平且可靠的比较中应发挥何种作用?

主要发现

  • 尽管非英语与多模态模型的兴趣日益增长,但绝大多数SciLMs仍集中于生物医学领域,且基于BERT的编码器架构占据主导地位。
  • 在PubMedQA、SciFact和MedNLI等标准基准上的表现显示随时间推移稳步提升,但增益通常较为有限,且依赖于模型架构。
  • 仅有四个科学数据集包含解释性标注——PubMedQA、SciFact、QASPER和NLI4CT,凸显了SciLM可解释性研究中的关键缺口。
  • 对抗性鲁棒性测试极少应用于SciLMs,且在相同任务内跨数据集的泛化能力评估不足,尤其在低资源环境下更为明显。
  • NLI4CT数据集(含2,400个样本)是目前唯一近期发布的临床试验用自然语言推理数据集,凸显了科学文本中大规模、多样化NLI数据的稀缺性。
  • 作者建议通过整合知识库、扩大模型规模以及利用多模态内容(如图表)来提升SciLM的可靠性与性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。