[论文解读] Unified Adversarial Invariance
本文提出统一对抗不变性(UnifAI),一种深度学习框架,可在无需对干扰因子进行标注的情况下,诱导监督表示学习中对干扰因子和偏见因子的不变性。通过竞争性地训练预测器与重构器,并结合解耦与对抗惩罚,UnifAI在对未见干扰变化的鲁棒性以及消除潜在表示中偏见因子信息的公平性方面均达到最先进性能。
We present a unified invariance framework for supervised neural networks that can induce independence to nuisance factors of data without using any nuisance annotations, but can additionally use labeled information about biasing factors to force their removal from the latent embedding for making fair predictions. Invariance to nuisance is achieved by learning a split representation of data through competitive training between the prediction task and a reconstruction task coupled with disentanglement, whereas that to biasing factors is brought about by penalizing the network if the latent embedding contains any information about them. We describe an adversarial instantiation of this framework and provide analysis of its working. Our model outperforms previous works at inducing invariance to nuisance factors without using any labeled information about such variables, and achieves state-of-the-art performance at learning independence to biasing factors in fairness settings.
研究动机与目标
- 开发一种统一框架,以在监督深度神经网络中诱导对干扰因子和偏见因子的不变性。
- 解决模型对无关数据变化(如人脸识别中的光照)过拟合的挑战,而无需对干扰因子数据进行标注。
- 通过在训练过程中从潜在表示中移除敏感属性(如性别、种族)来实现公平性。
- 通过竞争性训练与对抗惩罚实现不变性,而非依赖数据增强或对干扰因子的显式监督。
- 在无z-标注的情况下,于鲁棒性与偏见缓解的公平性方面均优于现有方法。
提出的方法
- 该框架学习一种拆分表示:一部分(e1)用于预测,另一部分(e2)用于重构,通过共享瓶颈结构强制实现解耦。
- 在预测任务(在e1上)与重构任务(在e2上)之间采用竞争性训练目标,超参数用于控制两者之间的平衡。
- 通过训练编码器生成用于预测和重构任务的独立、解耦表示,实现解耦。
- 使用对抗判别器,若潜在表示e1中包含已知偏见因子z的信息,则对网络施加惩罚。
- 使用联合损失端到端训练模型,联合包含预测准确率、重构损失、解耦正则化以及对z的对抗惩罚。
- 该框架以对抗方式实例化,无需对干扰因子进行任何标注,仅在公平性设置中需要对偏见因子进行标注。
实验结果
研究问题
- RQ1能否通过统一框架在无需对这些因子进行标注的情况下,诱导对干扰因子的不变性?
- RQ2如何利用对抗训练强制模型预测中与偏见因子(如性别、种族)的独立性?
- RQ3预测与重构任务之间的竞争对模型泛化与不变性有何影响?
- RQ4在公平性与对未见干扰变化的鲁棒性方面,该方法与最先进方法相比表现如何?
- RQ5该模型能否在不依赖z-标注的情况下,同时实现鲁棒性与公平性的最先进性能?
主要发现
- 在Extended Yale-B数据集上,UnifAI在预测身份时达到88.7%的准确率,同时对光照条件保持完美不变性,表现为Az = 0.67,与多数光照类别的群体占比一致。
- 在德国信贷数据集上,UnifAI在预测信贷资格时达到78%的准确率(Ay = 0.78),优于先前方法,同时对性别保持完美不变性(Az = 0.80,等于多数类别占比)。
- t-SNE可视化结果表明,不变嵌入e1不会按干扰因子(年龄、光照)或偏见因子(性别)聚类,而原始数据或e2表示则会聚类。
- 预测与重构任务之间的竞争被证明至关重要:增加重构权重(β)可提升准确率至某一峰值,之后因预测信息丢失而性能下降。
- 该模型在公平性与鲁棒性基准测试中优于最先进方法(如NN+MMD、VFAE、CAI、CVIB),尤其在无z-标注时表现更优。
- 该框架展现出对未见干扰因子变化(如未见过的光照条件)的泛化能力,原因在于此类因子被排除在预测表示之外。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。