[论文解读] Select and Attend: Towards Controllable Content Selection in Text Generation
本文提出了一种基于变分推断的框架,将神经编码器-解码器模型中的内容选择与文本生成解耦,从而实现对生成内容的显式、人类可解释的控制。通过将内容选择视为隐变量,并使用可微分的下界进行端到端训练,该模型在内容层面实现了更高的多样性与可控性——尤其仅通过一个超参数即可调节性能与可控性之间的权衡,在数据到文本和标题生成任务上优于SOTA基线模型。
Many text generation tasks naturally contain two steps: content selection and surface realization. Current neural encoder-decoder models conflate both steps into a black-box architecture. As a result, the content to be described in the text cannot be explicitly controlled. This paper tackles this problem by decoupling content selection from the decoder. The decoupled content selection is human interpretable, whose value can be manually manipulated to control the content of generated text. The model can be trained end-to-end without human annotations by maximizing a lower bound of the marginal likelihood. We further propose an effective way to trade-off between performance and controllability with a single adjustable hyperparameter. In both data-to-text and headline generation tasks, our model achieves promising results, paving the way for controllable content selection in text generation.
研究动机与目标
- 解决端到端神经文本生成模型中内容选择与表面实现混淆所导致的可控性与可解释性不足问题。
- 将内容选择与解码器解耦,使其可显式操作并便于用户控制。
- 通过最大化边缘似然的下界,实现在无需人工标注内容标签情况下的端到端训练。
- 提供一个可调节的超参数,有效控制生成性能与内容可控性之间的权衡。
- 在多种文本生成任务(包括数据到文本和标题生成)中验证该框架的有效性。
提出的方法
- 将内容选择视为隐变量,应用近似变分推断联合训练选择器与生成器。
- 使用边缘似然的可微分下界,实现在无需人工标注内容标签情况下的端到端训练。
- 引入一个超参数 ε,用于约束选择器与生成文本之间条件互信息(CMI)的上界。
- 采用变分自编码器风格的目标函数进行模型训练,其中后验近似通过反向传播进行优化。
- 在解码器之前插入一个可微分的、基于注意力的模块作为内容选择器,使其能够关注源表示,并对源文本标记生成软掩码。
- 在训练过程中调节 ε,以控制生成质量(更低的负对数似然,NLL)与内容层面多样性/可控性(更高的熵)之间的平衡。
实验结果
研究问题
- RQ1是否可以在神经文本生成中将内容选择与表面实现解耦,以实现显式、人类可解释的控制?
- RQ2是否可以设计一种无需人工标注内容标签的可微分端到端训练目标?
- RQ3是否可以通过单一超参数有效调节生成性能与内容可控性之间的权衡?
- RQ4与现有基线相比,所提出方法是否实现了更高的内容层面多样性与可控性?
- RQ5该模型在真实世界文本生成任务(如数据到文本和标题生成)中的表现如何?
主要发现
- VRS 模型在数据到文本和标题生成任务上均达到 SOTA 性能,在 Wikibio 上有轻微性能下降,而在 Gigaword 上下降更明显,这归因于后者更高的不确定性。
- 提高超参数 ε 可提升选择器的熵,增强内容层面的多样性与可控性,同时略微降低 NLL(性能)。
- 将 ε 设为 0 时,其性能优于保留所有源标记的标准序列到序列模型,表明即使在无显式可控性时,内容选择依然有益。
- VRS 模型生成的文本比基线更忠实于所选内容:VRS 的生成结果始终反映所有所选词汇,而 SS、Bo.Up 和 RS 模型常会遗漏或错误表示所选内容。
- 图 3 显示,VRS 的样本之间高度一致,仅在用词上有所不同(例如,'sparks uproar' 与 'sparks protests'),表明具有强内容保真度与改写多样性。
- 该模型在保持高性能的同时实现了可控的内容选择,且通过 ε 可有效调节性能与可控性之间的权衡,如图 2 所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。