Skip to main content
QUICK REVIEW

[论文解读] Understanding Instance-based Interpretability of Variational Auto-Encoders

Zhifeng Kong, Kamalika Chaudhuri|arXiv (Cornell University)|May 29, 2021
Generative Adversarial Networks and Image Synthesis参考文献 35被引用 11
一句话总结

本文提出 VAE-TracIn,一种计算高效且理论严谨的方法,用于基于实例的变分自编码器(VAEs)可解释性分析,采用影响函数。通过将反事实问题表述为“哪些训练样本最能提高测试样本的似然度?”,作者表明 VAE-TracIn 能够识别出具有影响力的训练样本——高自影响值表明样本难以重建或具有高对比度——并能通过检测数据流形外的数据点实现无监督数据清洗。

ABSTRACT

Instance-based interpretation methods have been widely studied for supervised learning methods as they help explain how black box neural networks predict. However, instance-based interpretations remain ill-understood in the context of unsupervised learning. In this paper, we investigate influence functions [Koh and Liang, 2017], a popular instance-based interpretation method, for a class of deep generative models called variational auto-encoders (VAE). We formally frame the counter-factual question answered by influence functions in this setting, and through theoretical analysis, examine what they reveal about the impact of training samples on classical unsupervised learning methods. We then introduce VAE- TracIn, a computationally efficient and theoretically sound solution based on Pruthi et al. [2020], for VAEs. Finally, we evaluate VAE-TracIn on several real world datasets with extensive quantitative and qualitative analysis.

研究动机与目标

  • 通过基于似然最大化构建的反事实问题,正式定义无监督学习中基于实例的可解释性,特别是针对 VAEs。
  • 解决由于编码器中的随机性以及海森矩阵求逆计算成本过高,导致在 VAE 中计算影响函数的挑战。
  • 开发 VAE-TracIn,一种一阶、高效的影响力函数近似方法,避免海森矩阵计算,并利用模型检查点实现高速计算。
  • 在真实世界数据集上对 VAE-TracIn 进行实证验证,证明其能够识别具有影响力的训练样本,并支持无监督数据质量评估。
  • 表明高自影响样本通常在视觉上显著或具有高对比度,提示其在检测数据分布异常值方面具有实用价值。

提出的方法

  • 将 VAE 的反事实问题形式化为“哪些训练样本最能提高测试样本的似然度?”,从而在无标签条件下实现基于影响力的可解释性分析。
  • 使用影响函数的经验平均来近似真实影响,并在温和条件下证明集中性界,以确保可靠性。
  • 将 TracIn——一种一阶影响力估计方法——适配至 VAE,消除对海森矩阵求逆的依赖,通过模型检查点实现快速计算。
  • 将高影响力训练样本定义为“支持者”,低影响力样本定义为“反对者”,并分析其在视觉和潜在空间中的特征。
  • 在 MNIST 和 CIFAR-10 上评估 VAE-TracIn,将影响力得分与潜在空间距离和范数进行比较,并通过过滤高自影响样本实现无监督数据清洗。

实验结果

研究问题

  • RQ1在无监督学习中,特别是针对 VAE,如何在不依赖标签的情况下正式构建基于实例的可解释性框架?
  • RQ2影响函数与 VAE 中的似然最大化之间存在何种理论关系?它们与潜在空间中成对距离的关系如何?
  • RQ3在编码器具有随机性且参数空间高维的条件下,如何高效计算 VAE 中的影响函数?
  • RQ4训练样本对测试样本的影响呈现出何种模式?这些模式如何与视觉和潜在空间特性相关联?
  • RQ5在无监督设置中,高自影响训练样本是否可作为数据分布异常值或异常现象的指示器?

主要发现

  • VAE 中高自影响训练样本与较大的重建损失相关,表明其在视觉上复杂、对比度高或难以重建。
  • 支持者(高影响力样本)通常在视觉上与测试样本相似,常匹配其背景和物体颜色,且通常更明亮或更鲜艳。
  • 在 CIFAR-10 中,强支持者始终表现出较大的潜在空间范数,表明其为高对比度或明亮图像,CIFAR-9 中的平均范数为 5.48±0.62。
  • 支持者与反对者在潜在空间中均与测试样本紧密相邻,尤其在较高 β 值下,表明存在强烈的语义相似性。
  • 强反对者通常属于与测试样本相同的类别,但在风格、粗细或形状上存在差异,表明影响力对细微视觉差异敏感。
  • 该方法通过高自影响成功识别出数据流形外的数据点,实现了有效的无监督数据清洗,无需标签。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。