[论文解读] GeDi: Generative Discriminator Guided Sequence Generation
GeDi 提出了一种计算高效的控制大型语言模型(LM)生成的方法,通过使用小型的类别条件语言模型(CC-LM)作为生成判别器。它应用贝叶斯法则,基于期望属性与非期望属性计算下一个词元的分类概率,从而实现更快、更可控且更安全的生成——在不牺牲流畅性的情况下,相比先前方法实现超过30倍的速度提升,同时降低了 GPT-2 的毒性。
While large-scale language models (LMs) are able to imitate the distribution of natural language well enough to generate realistic text, it is difficult to control which regions of the distribution they generate. This is especially problematic because datasets used for training large LMs usually contain significant toxicity, hate, bias, and negativity. We propose GeDi as an efficient method for using smaller LMs as generative discriminators to guide generation from large LMs to make them safer and more controllable. GeDi guides generation at each step by computing classification probabilities for all possible next tokens via Bayes rule by normalizing over two class-conditional distributions; one conditioned on the desired attribute, or control code, and another conditioned on the undesired attribute, or anti control code. We find that GeDi gives stronger controllability than the state of the art method while also achieving generation speeds more than 30 times faster. Additionally, training GeDi on only four topics allows us to controllably generate new topics zero-shot from just a keyword, unlocking a new capability that previous controllable generation methods do not have. Lastly, we show that GeDi can make GPT-2 (1.5B parameters) significantly less toxic without sacrificing linguistic quality, making it by far the most practical existing method for detoxifying large language models while maintaining a fast generation speed.
研究动机与目标
- 为解决在有偏见或有毒网络数据上训练的大型语言模型(LM)常生成有害或不可控内容的挑战。
- 克服现有控制方法(如 PPLM 和加权解码)在词汇表规模增大时计算效率低下的问题。
- 实现在训练过程中未见过的新主题的零样本控制,将可控性扩展至训练分布之外。
- 在不降低语言质量的前提下,减少 GPT-2 等大型 LM 中的毒性,提供一种实用的去毒化解决方案。
提出的方法
- 使用类别条件语言模型(CC-LM)作为生成判别器(GeDis),通过贝叶斯法则计算词元级别的分类概率。
- 应用贝叶斯法则,在两个类别条件分布之间进行归一化:一个以期望控制码为条件,另一个以反向控制码为条件。
- 采用加权解码策略,利用计算出的似然概率引导大型 LM 的生成,实现在不重新排序所有候选词的情况下高效控制。
- 通过混合生成-判别损失训练 GeDis,以提升其分类性能,增强其作为判别器的有效性。
- 通过仅在四个主题上微调 GeDis,实现零样本主题控制,使模型能通过关键词提示泛化到未见主题。
- 在推理阶段通过引导机制将 GeDi 与 GPT-2-XL 等大型 LM 集成,避免对主模型进行昂贵的微调。
实验结果
研究问题
- RQ1小型生成判别器(GeDi)能否在保持高流畅性的同时,有效引导大型语言模型生成具有期望属性的文本?
- RQ2在大规模场景下,GeDi 的推理速度与 PPLM 和加权解码等现有方法相比如何?
- RQ3GeDi 是否能泛化到训练数据中未出现的新主题的零样本控制?
- RQ4GeDi 在不降低文本质量的前提下,能在多大程度上减少 GPT-2 等大型语言模型中的毒性?
- RQ5使用混合生成-判别目标训练 GeDi 是否能提升其作为控制任务判别器的性能?
主要发现
- 在默认设置下,GeDi 引导的 GPT-2-XL 生成速度比 PPLM 快超过 30 倍,显著提升了推理效率。
- 在电影评论情感控制任务上,GeDi 在控制语气(正面/负面)方面优于当前最先进基线方法。
- GeDi 在保持语言质量的同时降低了 GPT-2 生成内容的毒性,是目前针对大型 LM 最实用的去毒化方法。
- GeDi 实现了零样本主题控制:仅在四个主题上微调,即可通过关键词提示有效生成全新主题的内容。
- 参数量为 345M 的小型 GeDis 模型,仅用单张 GPU 在一天内完成微调,即可有效且高效地引导更大模型。
- 混合训练目标提升了 GeDi 的判别能力,使其在控制任务中表现优于仅使用生成目标训练的标准 CC-LM。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。