[论文解读] Reducing Non-Normative Text Generation from Language Models
本文提出一种基于策略梯度的强化学习方法,利用规范性文本分类器作为奖励信号,对 GPT-2 进行微调,从而在五个数据集上将非规范性文本生成减少了 27–61%。该方法借助预训练分类器引导模型生成社会适宜的输出,而无需在规范语料上进行大规模微调。
Large-scale, transformer-based language models such as GPT-2 are pretrained on diverse corpora scraped from the internet. Consequently, they are prone to generating non-normative text (i.e. in violation of social norms). We introduce a technique for fine-tuning GPT-2, using a policy gradient reinforcement learning technique and a normative text classifier to produce reward and punishment values. We evaluate our technique on five data sets using automated and human participant experiments. The normative text classifier is 81-90% accurate when compared to gold-standard human judgments of normative and non-normative generated text. Our normative fine-tuning technique is able to reduce non-normative text by 27-61%, depending on the data set.
研究动机与目标
- 减少大型语言模型(如 GPT-2)生成非规范性文本的行为,这些行为通常源于从互联网抓取的训练数据中包含的有害或偏离规范的行为。
- 探究是否可以将价值对齐先验(特别是规范性文本分类器)作为强化学习微调中的有效、不可微分的奖励函数。
- 通过自动化指标和人工评估,在多种数据集上评估该方法的有效性。
- 通过将相同技术应用于其他分类任务(如情感分析和毒性检测)来展示泛化能力。
- 为控制有害语言生成提供一种可扩展、数据高效的替代方案,以替代大规模微调或数据集去偏处理。
提出的方法
- 使用基于策略梯度的强化学习对 GPT-2 进行微调,其中奖励信号源自一个预训练的规范性文本分类器。
- 该规范性分类器在 Goofus & Gallant 漫画片段上进行训练,将生成的文本标记为规范性或非规范性,从而为强化学习提供奖励信号。
- 由于奖励函数不可微,因此使用策略梯度方法基于模型输出质量反向传播参数更新。
- 该方法应用于多个数据集,包括 ROCStories、Plotto 和科幻叙事数据集,以评估其泛化能力和有效性。
- 通过将规范性分类器替换为负面情感和毒性语言分类模型,对方法进行消融实验,表明其在不同标准下的可迁移性。
- 通过人工评估和自动化指标验证所有测试集上非规范性内容的减少情况。
实验结果
研究问题
- RQ1预训练的规范性文本分类器能否有效作为奖励函数,以减少 GPT-2 生成的非规范性文本?
- RQ2该强化学习微调方法在多样化文本生成任务中,能在多大程度上减少非规范性输出?
- RQ3当使用为其他标准(如情感或毒性)训练的分类器时,该方法是否具有泛化能力?
- RQ4该方法在不同基线非规范性水平的数据集上的表现如何变化?
- RQ5该技术能否作为大规模数据重训练或去偏处理的可扩展替代方案,以实现更安全的语言模型输出?
主要发现
- 所提出的微调方法在五个评估数据集上将非规范性文本生成减少了 27–61%,且在非规范性水平更高的数据集中观察到更大的减少幅度。
- 本研究中使用的规范性文本分类器在与人工标注的金标准对比时,准确率达到 81–90%。
- 该方法成功泛化至其他分类任务,在使用负面情感和毒性语言分类器时也表现出有效性。
- 人工评估确认,微调后的模型生成的非规范性描述显著减少,支持了自动化结果。
- 即使在标注数据有限的情况下,该技术依然有效,因为规范性分类器仅在 Goofus & Gallant 漫画的少量少样本数据上进行训练。
- 该方法通过将生成过程与价值对齐的先验对齐,使语言模型具备自我审查行为,而无需进行大量重训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。