Skip to main content
QUICK REVIEW

[论文解读] Incorporating Priors with Feature Attribution on Text Classification

Frederick Liu, Besim Avci|arXiv (Cornell University)|Jun 19, 2019
Machine Learning and Data Classification参考文献 43被引用 8
一句话总结

本文提出一种方法,在训练过程中通过最小化积分梯度特征归因与预定义目标归因值之间的L2距离,将领域特定先验注入文本分类模型。该方法通过减少模型对身份术语的依赖,在不牺牲原始任务性能的前提下提升了公平性,同时通过聚焦已知有毒术语,在低数据场景下提升了性能,实验基于Wikipedia有毒评论数据集验证。

ABSTRACT

Feature attribution methods, proposed recently, help users interpret the predictions of complex models. Our approach integrates feature attributions into the objective function to allow machine learning practitioners to incorporate priors in model building. To demonstrate the effectiveness our technique, we apply it to two tasks: (1) mitigating unintended bias in text classifiers by neutralizing identity terms; (2) improving classifier performance in a scarce data setting by forcing the model to focus on toxic terms. Our approach adds an L2 distance loss between feature attributions and task-specific prior values to the objective. Our experiments show that i) a classifier trained with our technique reduces undesired model biases without a trade off on the original task; ii) incorporating priors helps model performance in scarce data settings.

研究动机与目标

  • 解决文本分类中的模型偏差问题,特别是身份术语与毒性预测之间的非预期关联。
  • 使从业者能够在不损害原始任务性能的前提下,将领域特定先验注入模型训练过程。
  • 提供一种直接利用可解释的特征归因作为训练信号来纠正不良模型行为的方法。
  • 通过引导注意力聚焦于已知的有毒或相关术语,提升数据稀缺场景下的模型鲁棒性与性能。
  • 提供一种可扩展、可操作的替代方案,替代数据增强或对抗性去偏方法,避免公平性与准确性之间的权衡。

提出的方法

  • 该方法在模型的目标函数中引入预选标记的积分梯度归因与目标归因值(例如,身份术语的目标归因值为0,有毒术语的目标归因值为1)之间的L2距离损失。
  • 为提升公平性,身份术语被赋予目标归因值0,惩罚模型将预测归因于这些术语的行为。
  • 为提升低数据场景下的性能,已知的有毒术语被赋予目标归因值1,以鼓励模型在训练过程中关注这些术语。
  • 联合目标函数同时包含交叉熵损失和基于归因的L2损失,实现联合优化。
  • 该方法在标记级别上使用路径积分梯度(Path Integrated Gradients),确保可解释性,并与人类可理解的输入单位对齐。
  • 该方法允许使用少量训练轮次对预训练模型进行微调,从而实现去偏且更鲁棒的预测。

实验结果

研究问题

  • RQ1我们能否在不降低原始任务性能的前提下,减少文本分类模型对身份术语的偏差?
  • RQ2将先验归因值纳入训练目标在提升有毒评论分类公平性方面有多有效?
  • RQ3通过归因先验引导注意力聚焦于已知有毒术语,能否提升模型在低数据场景下的性能?
  • RQ4与标准训练相比,该方法是否会产生更高质量的词向量作为副产品?
  • RQ5该方法能否应用于其他需要领域特定特征重要性约束的NLP任务?

主要发现

  • 使用该方法训练的模型在原始任务上实现了相当或更优的性能,同时显著降低了对身份术语的归因。
  • 该方法在合成的无偏数据集上提升了公平性指标和AUC,且未牺牲原始任务的准确性。
  • 在Wikipedia有毒评论数据集上,与基线模型相比,该模型对身份术语(如“gay”、“jew”)的平均归因更低。
  • 在低数据设置下,通过将目标归因设为1来强制模型关注已知的有毒术语,显著提升了分类器性能。
  • 该方法作为副产品生成了更高质量的词向量,优于基线模型。
  • 仅经过几轮微调,该方法的归因损失即收敛至更去偏的分类器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。