Skip to main content
QUICK REVIEW

[论文解读] LinkBERT: Pretraining Language Models with Document Links

Michihiro Yasunaga, Jure Leskovec|arXiv (Cornell University)|Mar 29, 2022
Topic Modeling被引用 11
一句话总结

LinkBERT 是一种新颖的预训练语言模型方法,利用文档链接(如维基百科中的超链接和 PubMed 中的引用链接)来提升多跳推理和知识整合能力。通过联合训练掩码语言建模和文档关系预测任务,使用链接文档对进行训练,LinkBERT 在下游任务中取得了最先进性能,包括在 USMLE 上提升 7% 准确率,在 HotpotQA 上提升 5% F1 分数。

ABSTRACT

Language model (LM) pretraining can learn various knowledge from text corpora, helping downstream tasks. However, existing methods such as BERT model a single document, and do not capture dependencies or knowledge that span across documents. In this work, we propose LinkBERT, an LM pretraining method that leverages links between documents, e.g., hyperlinks. Given a text corpus, we view it as a graph of documents and create LM inputs by placing linked documents in the same context. We then pretrain the LM with two joint self-supervised objectives: masked language modeling and our new proposal, document relation prediction. We show that LinkBERT outperforms BERT on various downstream tasks across two domains: the general domain (pretrained on Wikipedia with hyperlinks) and biomedical domain (pretrained on PubMed with citation links). LinkBERT is especially effective for multi-hop reasoning and few-shot QA (+5% absolute improvement on HotpotQA and TriviaQA), and our biomedical LinkBERT sets new states of the art on various BioNLP tasks (+7% on BioASQ and USMLE). We release our pretrained models, LinkBERT and BioLinkBERT, as well as code and data at https://github.com/michiyasunaga/LinkBERT.

研究动机与目标

  • 解决现有语言模型仅在单个文档上进行预训练、无法捕捉跨文档知识依赖关系的局限性。
  • 探究文档链接(如超链接、引用)是否可在预训练过程中作为多跳知识的来源。
  • 通过整合文档级别的关联信号,提升知识密集型自然语言处理任务(如问答和推理)的性能。
  • 开发一种自监督预训练框架,将语言建模与文档链接网络上的图学习相结合。
  • 通过领域特定的变体模型(BioLinkBERT)在生物医学和通用领域 NLP 基准上建立新的最先进结果。

提出的方法

  • 将预训练语料表示为文档图,其中链接(如超链接、引用)定义文档之间的边。
  • 通过在源文档片段后连接第二段文本构建输入序列,第二段可以是连续的(同一文档)、随机的(无关文档)或链接的(通过超链接或引用相连)。
  • 联合训练两个自监督目标:掩码语言建模(MLM)和文档关系预测(DRP)。
  • 利用 DRP 将两段输入之间的关系分类为连续、随机或链接,以促使模型学习桥接概念和相关性。
  • 在两个领域进行预训练:使用超链接的维基百科(通用领域)和使用引用链接的 PubMed(生物医学领域)。
  • 在下游任务(如问答和文本分类)上微调所得模型(LinkBERT 和 BioLinkBERT)。

实验结果

研究问题

  • RQ1在预训练过程中引入文档链接是否能提升语言模型在知识密集型任务上的性能?
  • RQ2与标准 BERT 风格的预训练相比,使用文档链接是否能增强多跳推理能力?
  • RQ3LinkBERT 在通用领域和生物医学领域的下游基准测试中,与 BERT 和 PubMedBERT 等现有模型相比表现如何?
  • RQ4文档链接在少样本和零样本问答任务中的性能提升程度如何?
  • RQ5在专业推理任务中,较小的、领域特定的模型(如 BioLinkBERT)是否能超越更大的通用领域模型?

主要发现

  • 在 MRQA 基准上,LinkBERT 相较于 BERT 的 F1 分数绝对提升 4%,并在通用领域的 GLUE 基准上表现优于 BERT。
  • 在 BioASQ 和 PubMedQA 生物医学问答任务中,BioLinkBERT 相较于之前的最先进模型实现了 7% 的绝对准确率提升。
  • 在 MedQA-USMLE 专业医学基准测试中,BioLinkBERT(大模型)仅用 340M 参数达到 50% 的准确率,优于 GPT-3(1750 亿参数)的 39% 准确率。
  • 在 HotpotQA 和 TriviaQA 的少样本问答任务中,LinkBERT 实现了 5% 的绝对性能提升,表明其具备强大的多跳推理能力。
  • DRP 目标显著提升了模型学习文档间桥接概念的能力,例如 '国家樱花节' 将 '潮汐盆地' 和 '日本樱花树' 关联起来。
  • 定性分析表明,BioLinkBERT 能够正确识别多跳推理链(例如:胰腺癌 → 深静脉血栓形成 → 压迫超声检查),而 PubMedBERT 因依赖表面词匹配而失败。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。