Skip to main content
QUICK REVIEW

[论文解读] GENIUS: Sketch-based Language Model Pre-training via Extreme and Selective Masking for Text Generation and Augmentation

Biyang Guo, Yeyun Gong|arXiv (Cornell University)|Nov 18, 2022
Topic Modeling被引用 4
一句话总结

GENIUS 是一种基于草图的文本生成模型,通过极端且选择性地掩码进行预训练,以从最少的关键信息(草图)中重建完整文本,从而实现高质量、多样化的生成。它驱动了 GeniusAug,一种数据增强方法,可提取任务感知的草图并生成语义丰富、多样化的训练样本,在无需微调的情况下显著提升文本分类、命名实体识别(NER)和机器阅读理解(MRC)任务的性能。

ABSTRACT

We introduce GENIUS: a conditional text generation model using sketches as input, which can fill in the missing contexts for a given sketch (key information consisting of textual spans, phrases, or words, concatenated by mask tokens). GENIUS is pre-trained on a large-scale textual corpus with a novel reconstruction from sketch objective using an extreme and selective masking strategy, enabling it to generate diverse and high-quality texts given sketches. Comparison with other competitive conditional language models (CLMs) reveals the superiority of GENIUS's text generation quality. We further show that GENIUS can be used as a strong and ready-to-use data augmentation tool for various natural language processing (NLP) tasks. Most existing textual data augmentation methods are either too conservative, by making small changes to the original text, or too aggressive, by creating entirely new samples. With GENIUS, we propose GeniusAug, which first extracts the target-aware sketches from the original training set and then generates new samples based on the sketches. Empirical experiments on 6 text classification datasets show that GeniusAug significantly improves the models' performance in both in-distribution (ID) and out-of-distribution (OOD) settings. We also demonstrate the effectiveness of GeniusAug on named entity recognition (NER) and machine reading comprehension (MRC) tasks. (Code and models are publicly available at https://github.com/microsoft/SCGLab and https://github.com/beyondguo/genius)

研究动机与目标

  • 开发一种条件语言模型,通过掩码标记从极简的草图输入(关键词或短语)生成连贯且多样的文本。
  • 克服现有文本重建模型的局限性,这些模型受限于低掩码比例,且无法处理高度损坏的输入。
  • 设计一种使用极端且选择性掩码的预训练目标,以实现从稀疏草图中稳健重建。
  • 证明 GENIUS 作为一种强大且即插即用的数据增强工具在多种 NLP 任务中的实用性。
  • 在数据增强中平衡多样性与质量,通过保留核心语义的同时生成多样的上下文。

提出的方法

  • 在大规模语料上预训练 GENIUS,采用一种新颖的基于草图的重建目标,结合极端掩码(高比例的标记被掩码)和选择性掩码(针对显著且信息丰富的短语)。
  • 使用掩码标记表示草图元素,其中仅保留关键词或短语,其余文本被掩码。
  • 应用选择性掩码策略,优先保留重要的语义单元(如命名实体、情感承载短语)以保留在草图中。
  • 利用预训练的 GENIUS 模型,基于草图输入生成完整、连贯且多样的文本。
  • 设计 GeniusAug:从原始训练数据中提取目标感知的草图,然后使用 GENIUS 在这些草图周围生成新的训练样本。
  • 将 GeniusAug 集成到下游 NLP 流程中,无需任务特定的微调,实现即插即用的数据增强。

实验结果

研究问题

  • RQ1语言模型能否有效从仅由关键词或短语组成的极端掩码输入中重建出完整、连贯且多样的文本?
  • RQ2与标准掩码策略相比,预训练期间采用极端且选择性掩码是否能带来更好的泛化能力和生成质量?
  • RQ3通过 GENIUS 实现的基于草图的生成能否成为下游 NLP 任务中强大且可控的数据增强方法?
  • RQ4在多样性、质量以及下游性能方面,GeniusAug 与保守型(如 EDA、MLM-based)和激进型(如 LAMBADA)数据增强方法相比如何?
  • RQ5GeniusAug 在分布内和分布外设置下,能在多大程度上提升模型的泛化能力?

主要发现

  • GeniusAug 在六个文本分类数据集上显著提升了模型性能,在分布内和分布外设置下的平均 F1 分数提升最高达 4.2%。
  • 与 EDA、回译和基于 MLM 的强基线方法相比,GeniusAug 在多样性和下游准确率方面表现更优,尤其在低资源场景下优势明显。
  • 该方法在命名实体识别和机器阅读理解任务上取得了 SOTA 或具有竞争力的结果,展现出广泛的适用性。
  • GeniusAug 生成的样本质量高,与原始样本语义高度一致,同时引入了有意义的结构和词汇变化,避免了保守与激进增强方法的缺陷。
  • 预训练的 GENIUS 模型可在无需微调的情况下实现零样本数据增强,且在下游数据上进一步微调可带来额外的性能提升。
  • 与基于自回归的 LAMBADA 等方法相比,GeniusAug 更具可控性,因为它在生成多样化上下文的同时保留了核心语义,降低了生成低质量或无关样本的风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。