[论文解读] Counterfactual Generation and Fairness Evaluation Using Adversarially Learned Inference
本文提出了一种基于条件对抗自编码推理(c-ALI)框架的因果感知反事实生成方法,通过整合已知的因果图结构,生成语义上合理的图像扰动。该方法在Morpho-MNIST和CelebA数据集上成功生成了改变目标属性及其因果后代的反事实样本,同时保持其他特征不变,从而实现对人脸吸引力分类器的鲁棒公平性评估。
Recent studies have reported biases in machine learning image classifiers, especially against particular demographic groups. Counterfactual examples for an input---perturbations that change specific features but not others---have been shown to be useful for evaluating explainability and fairness of machine learning models. However, generating counterfactual examples for images is non-trivial due to the underlying causal structure governing the various features of an image. To be meaningful, generated perturbations need to satisfy constraints implied by the causal model. We present a method for generating counterfactuals by incorporating a known causal graph structure in a conditional variant of Adversarially Learned Inference (ALI). The proposed approach learns causal relationships between the specified attributes of an image and generates counterfactuals in accordance with these relationships. On Morpho-MNIST and CelebA datasets, the method generates counterfactuals that can change specified attributes and their causal descendants while keeping other attributes constant. As an application, we apply the generated counterfactuals from CelebA images to evaluate fairness biases in a classifier that predicts attractiveness of a face.
研究动机与目标
- 解决在图像分类器中生成尊重属性之间潜在因果关系的有意义反事实样本的挑战。
- 通过生成反映现实、因果一致的属性变化的反事实样本,改进公平性评估。
- 开发一种在修改指定特征及其因果后代的同时,保持非目标属性不变的方法。
- 将生成的反事实样本应用于检测和量化人脸吸引力分类器中的公平性偏差。
提出的方法
- 该方法将对抗自编码推理(ALI)扩展为一种条件变体(c-ALI),通过整合已知的因果图结构来引导反事实生成。
- 利用条件生成器和判别器来建模在因果图约束下图像属性的联合分布。
- 生成器通过扰动特定属性来学习生成反事实图像,同时尊重其因果依赖关系并保持无关特征不变。
- 在训练过程中,模型强制施加来自因果图的结构约束,确保变化仅传播到被操纵属性的因果后代。
- 该框架通过端到端的对抗学习进行训练,判别器负责区分真实图像与生成的反事实图像。
- 该方法在Morpho-MNIST和CelebA上进行了评估,成功生成了改变目标属性及其因果后代但保持其他属性恒定的反事实样本。
实验结果
研究问题
- RQ1通过在生成过程中整合已知的因果图,是否能够实现在图像数据中因果一致的反事实生成?
- RQ2所提出的方法在修改指定属性及其因果后代的同时,对非目标属性的保持能力如何?
- RQ3生成的反事实样本在多大程度上能够检测到训练好的图像分类器中的公平性偏差?
- RQ4与非因果基线相比,引入因果结构是否能提升生成反事实样本的语义合理性和有效性?
主要发现
- 所提出的方法在Morpho-MNIST和CelebA上成功生成了改变指定属性及其因果后代但其他属性保持不变的反事实图像。
- 这些反事实样本具有语义上的合理性,因为它们尊重了图像属性背后的因果结构。
- 在CelebA数据集中,生成的反事实样本揭示了人脸吸引力分类器中显著的公平性偏差,尤其体现在人口统计属性对预测结果的影响方面。
- 与非因果基线相比,该方法在生成既真实又符合因果关系的反事实样本方面表现更优。
- 该框架在反事实生成过程中对非目标特征的保持表现出鲁棒性,证实了其隔离特定属性变化的能力。
- 通过反事实样本的评估,为公平性提供了可操作的洞察,揭示了不同人口群体在吸引力预测上的差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。