[论文解读] Few-Shot NLG with Pre-Trained Language Model
本文提出少样本自然语言生成(NLG)这一新任务,要求仅使用50–200个标注样本,从结构化数据生成高质量文本。该方法提出一种简单但高效的方法,结合预训练语言模型与可学习的复制开关机制,以选择性地从表格中提取事实并生成流畅且事实准确的句子,在仅使用少量数据的情况下,相比强基线模型,BLEU得分平均提升超过8.0分。
Neural-based end-to-end approaches to natural language generation (NLG) from structured data or knowledge are data-hungry, making their adoption for real-world applications difficult with limited data. In this work, we propose the new task of extit{few-shot natural language generation}. Motivated by how humans tend to summarize tabular data, we propose a simple yet effective approach and show that it not only demonstrates strong performance but also provides good generalization across domains. The design of the model architecture is based on two aspects: content selection from input data and language modeling to compose coherent sentences, which can be acquired from prior knowledge. With just 200 training examples, across multiple domains, we show that our approach achieves very reasonable performances and outperforms the strongest baseline by an average of over 8.0 BLEU points improvement. Our code and data can be found at \url{https://github.com/czyssrs/Few-Shot-NLG}
研究动机与目标
- 解决神经NLG系统对大规模标注数据的高依赖性问题,该问题限制了其在真实场景中的部署。
- 提出一个新研究问题:少样本NLG,即模型需在仅50–200个标注样本下生成高质量文本。
- 通过利用预训练语言模型作为先验知识,减少人工标注工作量,提升文本生成的流畅性。
- 通过引入可学习的开关机制,将内容选择与语言建模解耦,提升跨领域的泛化能力。
- 证明即使在极端数据稀缺条件下,也可在不微调大规模领域特定模型的情况下实现优异性能。
提出的方法
- 该方法使用预训练语言模型(如GPT风格)作为生成器,为流畅且连贯的句子生成提供强先验知识。
- 引入一种可学习的复制开关机制,以控制模型是通过语言模型参数生成文本,还是直接从输入表格值中复制内容。
- 复制开关通过复制损失项 $p_{ ext{copy}}$ 进行训练,该损失项鼓励模型在适当情况下从表格中复制事实内容。
- 模型架构简洁,可学习参数极少,适用于少样本学习场景。
- 通过在小规模标注数据集上端到端训练,联合优化内容选择与句子生成。
- 该框架在基于多领域维基百科的表格到文本数据集上进行应用,支持零样本泛化。
实验结果
研究问题
- RQ1神经NLG模型是否仅使用50–200个标注训练样本即可实现合理性能?
- RQ2预训练语言模型能否作为有效先验知识,降低NLG任务对数据的依赖?
- RQ3可学习的复制开关机制是否能提升少样本NLG中的事实一致性和流畅性?
- RQ4所提方法在数据极少的情况下,是否能在多样化领域中实现良好泛化?
- RQ5在低资源设置下,该模型能否超越依赖大规模训练数据的强基线模型?
主要发现
- 仅使用200个训练样本,该方法在Humans数据集上平均BLEU-4得分为36.1,相比最强基线模型提升超过8.0 BLEU分。
- 复制损失项 $p_{ ext{copy}}$ 在不同训练集规模下平均提升4.0 BLEU分,显著减少幻觉或错误事实的生成。
- 在WikiBio数据集上,该方法使用200个样本时达到25.4 BLEU得分,超过Pivot模型(16.8 BLEU),尽管Pivot模型使用了大规模目标端数据。
- 人工评估显示,该模型每样本生成3.64个支持性事实(基线最强模型为2.57个),仅产生1.12个矛盾事实,表明事实准确性极高。
- 未使用复制损失的模型在语言自然度上略优(1.63 vs. 1.59),但复制损失显著提升了事实一致性,这对NLG至关重要。
- 该方法在跨领域间泛化良好,展现出强大的零样本迁移能力,且模型架构复杂度与数据需求极低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。