[论文解读] ToxCCIn: Toxic Content Classification with Interpretability
本文提出 ToxCCIn,一种通过将帖子的毒性建模为其各个片段中最毒片段的毒性来增强基于 Transformer 的毒性检测可解释性的方法。通过联合训练多任务模型以同时预测整体毒性与单个片段的毒性,该方法生成了高质量、符合人类偏好的解释,其可解释性优于传统的 Logistic 回归,同时在 Civil Comments 数据集上保持了强大的分类性能。
Despite the recent successes of transformer-based models in terms of effectiveness on a variety of tasks, their decisions often remain opaque to humans. Explanations are particularly important for tasks like offensive language or toxicity detection on social media because a manual appeal process is often in place to dispute automatically flagged content. In this work, we propose a technique to improve the interpretability of these models, based on a simple and powerful assumption: a post is at least as toxic as its most toxic span. We incorporate this assumption into transformer models by scoring a post based on the maximum toxicity of its spans and augmenting the training process to identify correct spans. We find this approach effective and can produce explanations that exceed the quality of those provided by Logistic Regression analysis (often regarded as a highly-interpretable model), according to a human study.
研究动机与目标
- 为解决当前最先进的基于 Transformer 的毒性检测模型在可解释性方面的不足,该不足会阻碍内容审核中的信任建立与人工审查。
- 开发一种能够为模型预测生成人类可理解解释的方法,尤其适用于社交媒体内容审核等高风险场景。
- 通过一种新颖的多任务训练方法,提升模型在域内与跨域设置下的性能与鲁棒性。
- 评估模型生成的解释是否能够超越广泛使用的、本质上可解释的模型(如 Logistic 回归)的可解释性。
提出的方法
- 该模型基于一个假设:一个帖子的毒性至少与其最毒的片段相当,因此整体毒性由所有片段毒性得分的最大值决定。
- 采用神经多任务学习框架,同时训练(1)全文毒性分类与(2)每个 token 的毒性评分,以识别有毒片段。
- 模型使用 BERT 或 ELECTRA 作为基础编码器,最终层为每个 token 预测毒性得分,再通过最大池化聚合生成最终预测。
- 训练过程中应用均方误差(MSE)损失,以促使毒性预测值趋向极端值(接近 0 或 1),从而通过预测极化提升可解释性。
- 该方法利用 WordPiece 分词机制,即使在毒性术语被改写以规避检测时,也能保留其形态变体。
- 通过突出显示毒性得分最高的 token 生成解释,为模型决策提供人类可读的依据。
实验结果
研究问题
- RQ1通过将毒性建模为各片段的最大值,基于 Transformer 的模型是否能在不牺牲分类性能的前提下实现更高的可解释性?
- RQ2在人类评估中,该方法生成的解释是否优于 Logistic 回归的解释?
- RQ3与标准微调的 Transformer 模型相比,该模型在跨域设置下的表现如何?
- RQ4与传统可解释模型相比,该模型的解释在定性上具有哪些优势与不足?
主要发现
- 在人类评估中,53.7% 的标注者更倾向于 BERT-MT(ToxCCIn)在合并数据集上的解释,而在 CCD 数据集上该比例达到 59.4%。
- BERT-MT 在 Civil Comments Dataset(CCD)和 Offenseval 2019 Implicit Dataset(OLID)上均显著优于 Logistic 回归,在可解释性方面具有明显偏好优势。
- 该模型在域内与跨域评估中均取得了高于基线模型的 F1 分数,表明其分类有效性得到提升。
- BERT-MT 在识别有毒片段方面更为准确,尤其在涉及语境敏感或被修改的毒性术语时,得益于上下文嵌入与 WordPiece 的保留能力。
- 当多个非毒性词语共同构成毒性时,Logistic 回归更受青睐,因其生成的解释更全面(尽管精确度较低)。
- 该模型在处理隐性毒性语言(如否定性侮辱或对抗性修改的蔑称)方面表现不佳,两模型均表现欠佳,表明未来需加强对隐性毒性的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。