[论文解读] Enabling Language Models to Fill in the Blanks
本文提出了一种名为基于语言建模的补全(Infilling by Language Modeling, ILM)的简单、与模型无关的框架,通过在掩码文本与其真实补全结果拼接后进行训练,使预训练语言模型能够有效预测文档中任意位置的可变长度文本片段。该方法在短篇小说中实现了人类无法识别的文本补全,优于 BERT、专用模型和标准语言模型的人工评估表现。
We present a simple approach for text infilling, the task of predicting missing spans of text at any position in a document. While infilling could enable rich functionality especially for writing assistance tools, more attention has been devoted to language modeling---a special case of infilling where text is predicted at the end of a document. In this paper, we aim to extend the capabilities of language models (LMs) to the more general task of infilling. To this end, we train (or fine-tune) off-the-shelf LMs on sequences containing the concatenation of artificially-masked text and the text which was masked. We show that this approach, which we call infilling by language modeling, can enable LMs to infill entire sentences effectively on three different domains: short stories, scientific abstracts, and lyrics. Furthermore, we show that humans have difficulty identifying sentences infilled by our approach as machine-generated in the domain of short stories.
研究动机与目标
- 使预训练语言模型能够补全文档中任意位置的可变长度文本片段,而不仅限于序列末尾。
- 解决现有模型仅能补全固定长度片段或需要专用架构的局限性。
- 开发一种通用、灵活且简单的框架,保留标准语言模型的优势(如高质量生成和高效采样),同时支持双向上下文使用。
- 证明通过该方法微调的现成语言模型,其生成的补全结果在真实写作任务中与人类写作的文本难以区分。
- 通过支持多段落、可变长度补全,实现写作辅助、文档恢复和想法连接等实际应用。
提出的方法
- 通过将空白替换为 [blank] 标记,将补全任务重新表述为仅预测缺失片段(y),而非整个序列。
- 通过将不完整输入(含 [blank] 标记)与真实补全结果(y)拼接,并以 [answer] 标记分隔,构建训练样本。
- 在这些拼接序列上微调标准单向语言模型,以学习 p(y | x̃),其中 x̃ 为不完整输入。
- 推理时,使用微调后的语言模型为每个 [blank] 生成文本,然后将 [blank] 标记确定性地替换为预测片段,生成完整文本。
- 每个样本仅需一次前向传播,避免对输入序列进行迭代重处理,从而实现高效的多段落补全。
- 利用大规模预训练语言模型作为初始化,以提升性能,尤其在低资源场景下。
实验结果
研究问题
- RQ1能否通过一种简单且可泛化的通用方法,有效微调标准语言模型,使其在文档中任意位置补全可变长度的文本片段?
- RQ2所提出的 ILM 框架是否使语言模型生成的补全结果比现有方法更具连贯性和上下文一致性?
- RQ3在人工评估中,ILM 生成的补全结果是否在叙事语境下与人类写作的文本难以区分?
- RQ4在人类可检测性和流畅性方面,ILM 的性能与 BERT 和专用架构(如 SA)相比如何?
- RQ5从大规模预训练语言模型初始化是否能提升 ILM 框架中的补全性能?
主要发现
- ILM 模型在人工评估中得分达到 45%,意味着人类标注者在 45% 的故事中未能识别出机器生成的句子——显著高于 BERT(20%)、SA(29%)和标准语言模型(41%)。
- 尽管仅使用从左到右的上下文,标准语言模型在人工评估中仍优于 BERT 和专用 SA 模型,表明上下文长度和模型架构并非决定质量的唯一因素。
- ILM 框架在多种领域(包括短篇小说、科学摘要和歌词)中均实现了有效的补全,展现出广泛的适用性。
- 从大规模预训练语言模型进行微调显著提升了补全性能,表明 ILM 框架能有效利用已有知识。
- 定性分析表明,ILM 生成的句子在上下文中连贯,能同时考虑前后文内容,而 BERT 和 SA 的输出往往偏离主题或无关。
- 该方法与模型无关,无需架构修改,可仅通过少量调整应用于任何预训练语言模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。