Skip to main content
QUICK REVIEW

[论文解读] DIRECTOR: Generator-Classifiers For Supervised Language Modeling

Kushal Arora, Kurt Shuster|arXiv (Cornell University)|Jun 15, 2022
Topic Modeling被引用 9
一句话总结

本文提出 Director,一种统一的生成器-分类器语言模型架构,其解码器参数共享,并配备双头结构——一个用于语言建模,一个用于分类——支持在标准文本和理想/不良生成样本的标注数据上进行联合训练。该方法在仅带来极小速度损失的前提下,实现了更优的安全性和连贯性,其准确率与效率均优于重排序和引导生成技术。

ABSTRACT

Current language models achieve low perplexity but their resulting generations still suffer from toxic responses, repetitiveness and contradictions. The standard language modeling setup fails to address these issues. In this paper, we introduce a new architecture, {\sc Director}, that consists of a unified generator-classifier with both a language modeling and a classification head for each output token. Training is conducted jointly using both standard language modeling data, and data labeled with desirable and undesirable sequences. Experiments in several settings show that the model has competitive training and decoding speed compared to standard language models while yielding superior results, alleviating known issues while maintaining generation quality. It also outperforms existing model guiding approaches in terms of both accuracy and efficiency.

研究动机与目标

  • 解决标准语言模型在生成有毒、重复或自相矛盾文本方面的局限性。
  • 利用监督数据,同时在理想(期望)和不良(不期望)生成样本上进行训练。
  • 在不牺牲推理速度或模型效率的前提下,提升生成质量和安全性。
  • 提供一种通用框架,适用于多种不良行为,包括毒性与重复。
  • 证明联合训练分类器头可优于独立的重排序或模型引导方法。

提出的方法

  • 提出双头解码器架构:在每个解码器层中,除标准语言建模头外,增加一个额外的分类器头。
  • 通过在未标注文本上使用标准语言建模损失,以及在标注数据上使用交叉熵损失(指示生成结果为理想或不良),对模型进行联合训练。
  • 在解码过程中,使用可学习的混合权重结合两个头的预测结果,以指导标记生成。
  • 在两个头之间共享解码器的大部分Transformer参数,以保持效率和参数共享。
  • 应用显式的标签归一化正则化,以提升在分布外或未标注标签上的泛化能力。
  • 通过自动标注(例如,利用n-gram重复检测)对重复序列进行标注,从而在无需人工标注数据的情况下训练分类器。

实验结果

研究问题

  • RQ1统一的模型架构能否联合优化语言建模与理想/不良生成的分类?
  • RQ2与标准语言建模相比,引入有毒或自相矛盾响应的标注样本是否能提升生成质量和安全性?
  • RQ3在准确率和推理速度方面,Director与重排序及模型引导方法(如 FUDGE 和 PACER)相比表现如何?
  • RQ4在不使用人工标注的负面样本的情况下,模型能否通过自动标注有效减少重复?
  • RQ5参数共享与冻结策略对模型在保持语言建模质量的同时提升安全性的能力有何影响?

主要发现

  • Director 实现了与标准语言模型相当的训练和解码速度,尽管采用了双头架构。
  • 在安全性和矛盾性任务中,Director 显著减少了有毒和自相矛盾的生成内容,优于标准语言模型。
  • Director 在准确率和速度上均优于 FUDGE 和 PACER,其推理速度比这些方法快 8–40 倍,原因在于无需使用独立模型。
  • 当冻结语言模型权重时,模型表现欠佳,表明两个头的联合微调对有效分类至关重要。
  • 显式的标签归一化正则化在各项任务中均提升了性能,表明其增强了对模糊或缺失标签的鲁棒性。
  • 在使用自动标注的重复序列时,Director 成功减少了重复现象,且无需人工标注数据,证明了其广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。