Skip to main content
QUICK REVIEW

[论文解读] Adversarial Removal of Demographic Attributes from Text Data

Yanai Elazar, Yoav Goldberg|arXiv (Cornell University)|Aug 20, 2018
Topic Modeling参考文献 32被引用 10
一句话总结

本文研究了对抗性训练在神经网络文本表征中去除人口统计属性(如性别、种族、年龄)的效果。尽管对抗性训练降低了属性可预测性,但事后分类器仍能从编码表征中准确恢复人口统计信息,表明对抗性性能本身并不能可靠地反映文本数据中真正的群体敏感性不变性。

ABSTRACT

Recent advances in Representation Learning and Adversarial Training seem to succeed in removing unwanted features from the learned representation. We show that demographic information of authors is encoded in -- and can be recovered from -- the intermediate representations learned by text-based neural classifiers. The implication is that decisions of classifiers trained on textual data are not agnostic to -- and likely condition on -- demographic attributes. When attempting to remove such demographic information using adversarial training, we find that while the adversarial component achieves chance-level development-set accuracy during training, a post-hoc classifier, trained on the encoded sentences from the first part, still manages to reach substantially higher classification accuracies on the same data. This behavior is consistent across several tasks, demographic properties and datasets. We explore several techniques to improve the effectiveness of the adversarial component. Our main conclusion is a cautionary one: do not rely on the adversarial training to achieve invariant representation to sensitive features.

研究动机与目标

  • 探究文本分类神经网络的中间表征中是否编码了人口统计属性(性别、种族、年龄)
  • 评估对抗性训练在从学习表征中去除此类人口统计信息方面的有效性
  • 评估对抗性组件的性能是否可靠地指示了受保护属性的成功去除
  • 探索改进对抗性训练在实现文本表征中人口统计不变性的方法
  • 警示不应盲目信任对抗性训练用于公平性,倡导对表征不变性进行外部验证

提出的方法

  • 模型采用双流架构:编码器 h(x) 将输入文本 x 映射为表征向量 h_x,随后是主分类器 c(h(x)) 完成主要任务,以及一个对抗器 adv(h(x)) 用于预测受保护属性 z
  • 对抗性训练联合优化主任务准确率与对抗失败,使用梯度反转:编码器被训练以最小化主任务损失,同时最大化对抗器损失
  • 梯度反转层(GRL)在反向传播期间将来自对抗器的梯度缩放为 −λ,从而实现具有相反目标的端到端训练
  • 在编码表征上训练事后分类器,以评估对抗性训练后人口统计信息是否仍然存在
  • 在多个数据集和人口统计属性(性别、种族、年龄)上进行实验,比较对抗性性能与事后分类器准确率
  • 探索模型容量、对抗器权重以及集成方法,以提升对抗性鲁棒性与表征不变性

实验结果

研究问题

  • RQ1在看似无关的任务上训练的文本分类器的中间表征中,人口统计属性(性别、种族、年龄)在多大程度上被编码?
  • RQ2对抗性训练是否能有效去除文本表征中的人口统计信息,以对抗器性能为衡量标准?
  • RQ3即使对抗器表现良好,能否在编码表征上训练的事后分类器仍能准确预测人口统计属性?
  • RQ4对抗性训练设置的哪些修改(如容量、权重、集成)能改善人口统计信号的去除?
  • RQ5对抗器组件的性能是否是表征中真正人口统计不变性的可靠指标?

主要发现

  • 即使在训练数据平衡且主要任务无关的情况下,性别、种族和年龄等人口统计属性仍显著编码在文本分类器的中间表征中
  • 尽管在开发集上达到随机水平准确率,对抗器仍未能完全消除人口统计信息,事后分类器的准确率显著更高(例如,性别为 75.3%,种族为 65.4%,年龄为 58.1%)
  • 训练期间对抗器的性能并非真正不变性的可靠指标;必须通过事后攻击者进行外部验证
  • 调整对抗器容量和权重,以及使用对抗器集成,可提升性能,但无法完全消除残留的人口统计信息
  • 没有单一方法能在所有数据集和属性上一致实现人口统计属性的完全去除,表明对抗性训练在此任务中存在固有局限性
  • 本研究结论为:对抗性训练不应被视为实现文本表征中人口统计不变性的唯一方法

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。