[论文解读] DORA: Exploring Outlier Representations in Deep Neural Networks
DORA 提出了一种数据无关的框架,通过一种新颖的极端激活(EA)距离度量方法,分析深度神经网络的表征。该方法通过分析极端激活信号上的激活模式,识别出异常特征。该方法能够检测到水印、伪影等虚假概念,表明 EA 距离与人类感知一致,并能有效标记视觉模型中的不良表征。
Deep Neural Networks (DNNs) excel at learning complex abstractions within their internal representations. However, the concepts they learn remain opaque, a problem that becomes particularly acute when models unintentionally learn spurious correlations. In this work, we present DORA (Data-agnOstic Representation Analysis), the first data-agnostic framework for analyzing the representational space of DNNs. Central to our framework is the proposed Extreme-Activation (EA) distance measure, which assesses similarities between representations by analyzing their activation patterns on data points that cause the highest level of activation. As spurious correlations often manifest in features of data that are anomalous to the desired task, such as watermarks or artifacts, we demonstrate that internal representations capable of detecting such artifactual concepts can be found by analyzing relationships within neural representations. We validate the EA metric quantitatively, demonstrating its effectiveness both in controlled scenarios and real-world applications. Finally, we provide practical examples from popular Computer Vision models to illustrate that representations identified as outliers using the EA metric often correspond to undesired and spurious concepts.
研究动机与目标
- 解决当前缺乏识别深度神经网络学习到的非预期或虚假概念的方法的问题。
- 开发一种不依赖训练数据的、数据无关的内部表征分析方法。
- 创建一种稳健且可解释的度量方法,用于衡量 DNN 中学习表征之间的相似性。
- 检测对应于伪影、偏见或后门攻击的异常表征。
- 验证该框架与人类感知的一致性,并在受控环境和真实世界场景中验证其有效性。
提出的方法
- 提出极端激活(EA)距离度量方法,基于表征在极端激活信号上的激活模式,评估其相似性。
- 使用合成生成的激活最大化信号(AMS)实现对表征关系的数据无关分析。
- 应用 AMS 识别出使特定神经元最大激活的数据点,从而在不访问原始数据的情况下分析表征行为。
- 采用表征图谱可视化并聚类视觉模型各层中语义相似的表征。
- 在受控和真实世界环境中,将 EA 距离与人类感知及功能相似性进行验证。
- 将该框架集成到名为 DORA(Data-agnOstic Representation Analysis)的流水线中,实现对模型内部结构的系统性探索。
实验结果
研究问题
- RQ1一种数据无关的方法能否有效识别 DNN 中捕获虚假或异常概念的表征?
- RQ2EA 距离度量在多大程度上与人类对神经表征概念相似性的感知保持一致?
- RQ3EA 能在多大程度上检测到视觉模型中的已知伪影,如水印或彩色创可贴?
- RQ4DNN 中的表征聚类如何对应于语义概念,包括地理区域或明确内容?
- RQ5EA 度量能否作为受控实验中检测注入异常概念的稳健基线?
主要发现
- EA 距离度量在底层概念已知的情况下,与人类对概念相似性的感知表现出强烈一致性。
- DORA 在真实世界的视觉模型中成功识别出与虚假概念(如水印、彩色创可贴和明确内容)对应的表征。
- 在受控场景中,EA 度量能有效检测到插入的异常概念,确立了可靠的异常检测基线。
- 表征图谱揭示了语义相似表征的聚类,包括对地理区域和明确内容的独立分组。
- 该框架识别出对伪影(如中文表意文字水印和创可贴)敏感的神经元,证实了这些元素存在于学习到的表征中。
- 即使伪影未出现在原始训练数据中,该方法仍保持有效性,表明其对激活模式中虚假相关性的敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。