[论文解读] Chain of Explanation: New Prompting Method to Generate Higher Quality Natural Language Explanation for Implicit Hate Speech
本文提出链式解释(CoE)提示法,一种新颖方法,通过整合启发式词汇、仇恨意图展示和目标群体识别,提升隐性仇恨言论的自然语言解释(NLE)质量。该方法将BLEU-1得分从44.0提升至62.3,并取得优异的人工评估得分,生成的NLE在信息量(4.48/7)和清晰度(4.34/7)方面表现突出,优于基线模型,且与人工撰写的解释高度一致。
Recent studies have exploited advanced generative language models to generate Natural Language Explanations (NLE) for why a certain text could be hateful. We propose the Chain of Explanation (CoE) Prompting method, using the heuristic words and target group, to generate high-quality NLE for implicit hate speech. We improved the BLUE score from 44.0 to 62.3 for NLE generation by providing accurate target information. We then evaluate the quality of generated NLE using various automatic metrics and human annotations of informativeness and clarity scores.
研究动机与目标
- 为解决隐性仇恨言论缺乏高质量自然语言解释(NLE)的问题,此类言论比显性形式更难检测。
- 探索提示工程在利用预训练语言模型(PLM)提升NLE生成方面的潜力。
- 通过引入人工标注的信息量与清晰度,超越标准自动指标,对NLE质量进行综合评估。
- 研究自动指标与人工判断在NLE评估中的相关性。
- 提出一种提示框架,以增强隐性仇恨言论检测中NLE的忠实度与可解释性。
提出的方法
- 提出一种链式解释(CoE)提示框架,通过启发式词汇、仇恨意图展示和目标群体识别对输入进行结构化处理。
- 采用序列到序列的输入格式:[STR] + H_text + tweet + [SEP] + D_hate + [SEP] + D_target + [SEP] + H_NLE + 生成的NLE + [END]。
- 采用结构化提示,包括:'给定文本:'、'该文本是否具有仇恨性?是'、'目标群体为:{target}' 和 '其具有仇恨性是因为:',以引导解释生成。
- 在LatentHatred数据集上,使用CoE提示对多个生成式语言模型(如BART、T5)进行训练与评估。
- 同时采用自动指标(BLEU、ROUGE、BERTScore、BLEURT、SARI、NUBIA)与人工评估,实现全面评估。
- 由三名经验丰富的研究助理对信息量与清晰度进行人工标注,剔除模糊案例后,组间一致性(Krippendorff’s alpha)为0.35。
实验结果
研究问题
- RQ1提示方法是否能显著提升隐性仇恨言论的自然语言解释(NLE)质量?
- RQ2在提示中加入目标群体信息如何影响NLE质量与自动指标得分?
- RQ3BLEU、ROUGE与BERTScore等自动指标与人工判断的信息量和清晰度之间的相关性有多大?
- RQ4CoE提示方法与基线自回归生成方法相比,在解释质量与忠实度方面表现如何?
- RQ5结构化提示对减少歧义与提升模型生成解释的可解释性有何影响?
主要发现
- CoE提示方法将BLEU-1得分从基线的44.0提升至62.3,表明与参考解释的n-gram重叠度显著提高。
- 当从提示中移除目标群体信息时,BLEU-1得分下降15.5分,证实其在解释质量中的关键作用。
- 最佳模型生成的NLE在人工标注的信息量与清晰度得分分别为4.48/7与4.34/7,与人工撰写的解释(5.20与4.53)高度一致。
- BLEURT、BERTScore与NUBIA与人工判断的相关性最强(Spearman等级相关系数分别为r = 0.50、0.34与0.48),优于传统指标如ROUGE-L与SARI。
- SARI与清晰度的相关性最弱(r = 0.051),表明其在NLE评估中可靠性有限。
- 自动指标与人工评分的相关性各异:BLEU-1与ROUGE-L与信息量的相关性更强(r = 0.31与0.32),而与清晰度的相关性较弱(r = 0.15与0.18),凸显了现有指标在捕捉语义清晰度方面的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。