[论文解读] Toxicity Detection with Generative Prompt-based Inference
本文提出一种基于生成式提示的零样本毒性检测推理方法,利用大语言模型的自我诊断能力,无需微调即可实现。实验表明,与判别式方法相比,生成式分类在三个社交媒体毒性数据集上表现更优,F1宏平均值更高,且对隐性毒性检测更佳,同时减少了对有偏见的虚假相关性的依赖。
Due to the subtleness, implicity, and different possible interpretations perceived by different people, detecting undesirable content from text is a nuanced difficulty. It is a long-known risk that language models (LMs), once trained on corpus containing undesirable content, have the power to manifest biases and toxicity. However, recent studies imply that, as a remedy, LMs are also capable of identifying toxic content without additional fine-tuning. Prompt-methods have been shown to effectively harvest this surprising self-diagnosing capability. However, existing prompt-based methods usually specify an instruction to a language model in a discriminative way. In this work, we explore the generative variant of zero-shot prompt-based toxicity detection with comprehensive trials on prompt engineering. We evaluate on three datasets with toxicity labels annotated on social media posts. Our analysis highlights the strengths of our generative classification approach both quantitatively and qualitatively. Interesting aspects of self-diagnosis and its ethical implications are discussed.
研究动机与目标
- 探究基于生成式提示的推理方法是否能在无需特定任务微调的情况下有效检测毒性内容。
- 评估生成式分类在检测隐性与微妙毒性方面相对于判别式分类的性能表现。
- 通过避免二元标签监督,减少对少数群体提及与毒性标签之间虚假相关性的依赖。
- 探讨大语言模型自我诊断能力在毒性检测中的伦理影响。
- 分析提示措辞如何影响模型在零样本毒性检测中的行为与可解释性。
提出的方法
- 该方法利用大语言模型(如 GPT-2)生成响应,其条件由指定毒性方面的提示决定,例如“这段文本是否具有冒犯性?”或“为这段文本生成一个具有毒性的版本。”
- 将毒性检测建模为生成任务:模型基于将任务表述为条件生成的提示,生成反映输入是否具有毒性的文本片段。
- 该方法利用预训练模型对毒性内容及其相关判断的内部知识,避免了对标注数据或微调的需求。
- 提示工程受社会偏见框架(SBF)指导,有助于结构化提示以检测隐性偏见与微妙的毒性形式。
- 通过阈值法或基于标记的分类策略,根据生成文本是否与毒性标签一致,将模型输出分类为有毒或非有毒。
- 评估采用宏平均F1、正负样本F1值,以及通过LIME进行的定性分析,以评估标记层面的预测贡献。
实验结果
研究问题
- RQ1基于生成式提示的推理方法是否在零样本毒性检测中优于基于判别式提示的方法?
- RQ2生成式方法如何处理关键词检测方法无法捕捉的隐性与微妙毒性形式?
- RQ3生成式方法在多大程度上减少了对少数群体提及与毒性标签之间虚假相关性的依赖?
- RQ4提示措辞如何影响模型的检测行为与可解释性?
- RQ5大语言模型自我诊断能力在毒性检测中存在哪些伦理风险?
主要发现
- 在所有三个数据集(SBIC、HateXplain 和 SemEval 2019)上,生成式分类方法的宏平均F1得分均高于判别式分类方法。
- 在SBIC数据集上,最大的GPT-2模型在使用生成式分类时达到0.62的宏平均F1,优于判别式基线模型。
- 生成式方法在检测隐性毒性方面表现更优,尤其在无辱骂性词汇或明显冒犯性词语的情况下。
- 定性分析显示,模型的预测对毒性关键词更具鲁棒性,LIME分析表明,非毒性标记在正确分类中的贡献往往超过毒性关键词。
- 由于未采用二元监督,该方法降低了利用少数群体提及与毒性标签之间虚假相关性的风险。
- 识别出伦理风险,包括双重用途滥用的潜在可能性,以及若预训练数据被过滤以去除有毒内容及其相关判断,自我诊断能力可能变得脆弱。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。