Skip to main content
QUICK REVIEW

[论文解读] SciRepEval: A Multi-Format Benchmark for Scientific Document Representations

Amanpreet Singh, Mike D’Arcy|arXiv (Cornell University)|Nov 23, 2022
Topic Modeling被引用 7
一句话总结

本文提出了 SciRepEval,这是首个全面的基准,涵盖24种多样化的科学文献任务,涵盖分类、回归、排序和搜索四种格式。该研究提出 SPECTER2,一种多格式表示模型,通过使用控制码或适配器学习任务特定嵌入,相比单嵌入SOTA模型(如 SPECTER 和 SciNCL)实现了超过2个点的绝对性能提升。

ABSTRACT

Learned representations of scientific documents can serve as valuable input features for downstream tasks without further fine-tuning. However, existing benchmarks for evaluating these representations fail to capture the diversity of relevant tasks. In response, we introduce SciRepEval, the first comprehensive benchmark for training and evaluating scientific document representations. It includes 24 challenging and realistic tasks, 8 of which are new, across four formats: classification, regression, ranking and search. We then use this benchmark to study and improve the generalization ability of scientific document representation models. We show how state-of-the-art models like SPECTER and SciNCL struggle to generalize across the task formats, and that simple multi-task training fails to improve them. However, a new approach that learns multiple embeddings per document, each tailored to a different format, can improve performance. We experiment with task-format-specific control codes and adapters and find they outperform the existing single-embedding state-of-the-art by over 2 points absolute. We release the resulting family of multi-format models, called SPECTER2, for the community to use and build on.

研究动机与目标

  • 解决在多样化任务格式下评估科学文献表示方法的全面基准缺乏的问题。
  • 探究现有 SOTA 模型(如 SPECTER 和 SciNCL)在多种任务格式下的泛化能力限制。
  • 开发并评估一种学习任务格式特定文献表示的新方法,以提升泛化性能。
  • 发布标准化基准和新型多格式模型,以支持可复现的研究和社区进步。

提出的方法

  • 设计一个包含24个真实任务的基准——其中8个为新引入——涵盖四类格式:分类、回归、基于接近度的排序和即席搜索。
  • 在引用三元组上对 Transformer 模型进行预微调,以生成适用于下游任务的高质量文献表示。
  • 探索两种用于格式特定表示学习的方法:任务格式特定的控制码和参数高效的适配器模块。
  • 使用针对每种格式定制的多任务目标进行模型训练:分类使用交叉熵,排序使用三元组边缘损失,回归使用均方误差。
  • 采用统一框架为每篇文档生成多个嵌入,每个嵌入均针对特定任务格式进行优化。
  • 在所有任务中标准化训练与评估划分,以实现公平且可复现的比较。

实验结果

研究问题

  • RQ1现有的科学文献表示模型能否在分类、回归、排序和搜索等多样化任务格式中有效泛化?
  • RQ2在广泛异构任务上进行多任务训练是否能提升文献表示模型的泛化能力?
  • RQ3为每篇文档学习多个格式特定的嵌入,是否能显著提升性能,相比单一统一表示?
  • RQ4用于任务格式适配的控制码或适配器模块,是否在跨格式评估中优于标准的单嵌入方法?
  • RQ5格式特定表示带来的性能提升,在真实世界下游应用中能有多大程度的体现?

主要发现

  • SOTA 模型如 SPECTER 和 SciNCL 在不同任务格式之间表现出较差的泛化能力,即使在标准基准上表现良好。
  • 在多样化格式上进行简单多任务训练无法提升模型泛化能力,表明联合优化不足以满足格式特定表示的需求。
  • 为每篇文档学习多个嵌入,每个嵌入针对特定任务格式定制,相比单嵌入 SOTA 模型,性能提升超过2个点绝对值。
  • 任务格式特定的控制码和适配器模块优于现有单嵌入方法,其中适配器在参数高效适配方面表现出强大效果。
  • SPECTER2 系列模型通过格式特定适配训练,在 SciRepEval 的所有四种任务格式中均达到 SOTA 结果。
  • 该基准揭示,通用 NLP 基准(如 MTEB)上的表现无法可靠预测科学文献表示任务的表现,凸显了领域特定评估的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。