Skip to main content
QUICK REVIEW

[论文解读] DExperts: Decoding-Time Controlled Text Generation with Experts and Anti-Experts

Alisa Liu, Maarten Sap|arXiv (Cornell University)|May 7, 2021
Topic Modeling参考文献 41被引用 11
一句话总结

DExperts 提出了一种推理时的文本生成控制方法,通过使用专家和反专家(即微调过的小型语言模型,分别针对理想和不良文本属性)的乘积模型对预训练语言模型的输出进行重加权。该方法在去毒化和情感控制方面优于现有方法,即使在数据极少或应用于 GPT-3 等大型模型(通过 API 访问)时,也能保持流畅性和泛化能力。

ABSTRACT

Despite recent advances in natural language generation, it remains challenging to control attributes of generated text. We propose DExperts: Decoding-time Experts, a decoding-time method for controlled text generation that combines a pretrained language model with "expert" LMs and/or "anti-expert" LMs in a product of experts. Intuitively, under the ensemble, tokens only get high probability if they are considered likely by the experts, and unlikely by the anti-experts. We apply DExperts to language detoxification and sentiment-controlled generation, where we outperform existing controllable generation methods on both automatic and human evaluations. Moreover, because DExperts operates only on the output of the pretrained LM, it is effective with (anti-)experts of smaller size, including when operating on GPT-3. Our work highlights the promise of tuning small LMs on text with (un)desirable attributes for efficient decoding-time steering.

研究动机与目标

  • 为解决在不微调基础语言模型的前提下控制生成文本中不良属性(如毒性或负面情感)的挑战。
  • 开发一种轻量级、高效的推理时方法,用于引导大型预训练语言模型(如 GPT-3),避免微调或重新训练带来的高昂成本。
  • 仅通过微调特定属性分布的小型专用语言模型(专家和反专家)实现有效控制。
  • 证明通过直接对专家和反专家模型的输出进行概率集成,其效果优于使用它们来估计类别概率的方法。
  • 证明当仅使用反专家时,该方法依然有效,从而无需依赖标注的非毒性样本。

提出的方法

  • DExperts 通过乘积-专家公式将基础预训练语言模型与一个专家语言模型(建模理想属性)和一个反专家语言模型(建模不良属性)相结合。
  • 在每个解码步骤中,使用专家和反专家 logits 的差值对基础模型的 logits 进行重加权:$\tilde{\mathbf{z}}_t = \mathbf{z}_t + \alpha(\mathbf{z}^{+}_t - \mathbf{z}^{-}_t)$,其中 $\alpha$ 控制引导强度。
  • 最终的词元分布通过在重加权后的 logits 上应用 softmax 得到,从而实现在保持流畅性和多样性的同时进行可控生成。
  • 该方法仅作用于基础模型的输出,因此可与通过 API 访问的黑箱模型(如 GPT-3)兼容。
  • 专家和反专家在小型人工标注数据集(如 650 条有毒评论)上进行微调,以建模特定属性。
  • 该方法可泛化至多种属性:已应用于去毒化和情感控制,展现出鲁棒性和有效性。

实验结果

研究问题

  • RQ1基于专家和反专家语言模型的推理时方法,是否能在不访问基础模型权重的情况下有效降低生成文本中的毒性?
  • RQ2在自动评估和人类评估中,DExperts 在去毒化任务中相较于现有可控生成方法表现如何?
  • RQ3DExperts 是否能仅通过反专家并复用基础模型作为专家来实现有效控制,从而消除对非毒性训练数据的需求?
  • RQ4在对抗性设置下(提示词被设计用于引发相反情感),DExperts 在情感控制方面的表现如何,尤其是在引发负面或正面延续时?
  • RQ5小型微调后的专家和反专家模型在轻量级、推理时方式下,能否有效引导大型冻结的基础模型?

主要发现

  • 在自动评估和人类评估中,DExperts 在语言去毒化任务中均优于现有方法,成功降低毒性,同时保持高流畅性和多样性。
  • 即使仅使用 650 条有毒评论来训练反专家,该方法仍表现出强大的性能,证明其数据效率。
  • 当仅使用反专家并以基础模型作为专家时,DExperts 依然有效,实现了无需非毒性训练样本的毒性缓解。
  • 在情感控制方面,DExperts 在自动评估和人类评估中均优于基线方法,尤其在对抗性设置下(提示词被设计用于引发相反情感)表现更优。
  • 该方法可泛化至不同属性,且在通过 API 应用于 GPT-3 时仍保持强性能,表明其与大规模黑箱模型的兼容性。
  • 直接对专家和反专家输出进行概率集成,其效果优于使用它们来估计类别概率的方法(如 GeDi 或 FUDGE)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。