[论文解读] Anomaly Detection with Domain Adaptation
本文提出不变表示异常检测(IRAD),一种用于半监督异常检测的域自适应方法,通过共享编码器和特定域编码器与生成器的对抗性训练学习域不变特征。IRAD 在 Office-Home 数据集上相比基线方法性能提升最高达 10%,并通过误差和泛化性的理论边界实现强大泛化能力。
We study the problem of semi-supervised anomaly detection with domain adaptation. Given a set of normal data from a source domain and a limited amount of normal examples from a target domain, the goal is to have a well-performing anomaly detector in the target domain. We propose the Invariant Representation Anomaly Detection (IRAD) to solve this problem where we first learn to extract a domain-invariant representation. The extraction is achieved by an across-domain encoder trained together with source-specific encoders and generators by adversarial learning. An anomaly detector is then trained using the learnt representations. We evaluate IRAD extensively on digits images datasets (MNIST, USPS and SVHN) and object recognition datasets (Office-Home). Experimental results show that IRAD outperforms baseline models by a wide margin across different datasets. We derive a theoretical lower bound for the joint error that explains the performance decay from overtraining and also an upper bound for the generalization error.
研究动机与目标
- 解决在目标域中仅有有限正常数据时半监督异常检测的挑战。
- 实现从源域(拥有丰富正常数据)到目标域(正常样本稀少)的异常检测知识有效迁移。
- 开发一种在目标域中对未见异常具有良好泛化能力的方法,同时避免因目标数据有限导致的过拟合。
- 对联合误差与泛化边界进行理论分析,以解释过训练导致的性能下降,并指导模型设计。
提出的方法
- 训练一个共享编码器,从源域和目标域数据中提取域不变表示。
- 使用源域特定编码器、生成器和判别器进行对抗性训练,以解耦共享特征与特定域特征。
- 通过潜在空间中的相似性目标(公式 4)强制源域与目标域表示之间的特征相似性。
- 应用循环一致性损失(公式 2)以在特征重建过程中保持结构一致性。
- 在对抗性目标中引入随机噪声输入($\bm{x}_{rnd}$),以正则化判别器并改善决策边界学习。
- 在共享表示上训练预训练的异常检测器(孤立森林),以实现目标域中的最终异常评分。
实验结果
研究问题
- RQ1能否从有限的目标域数据和丰富的源域数据中有效学习域不变表示,从而提升异常检测性能?
- RQ2共享特征与特定域特征的对抗性解耦在域分布偏移下的异常检测泛化能力方面有何影响?
- RQ3循环一致性与相似性正则化对目标域中正常与异常特征分离的影响如何?
- RQ4过训练如何影响域自适应异常检测中的联合误差与泛化性能?
- RQ5何种理论边界可解释此设定下表示不变性与模型泛化之间的权衡?
主要发现
- IRAD 在 Office-Home Product → Clip Art 基准上相比最先进基线方法性能最高提升 10%,显著提升检测性能。
- 在数字图像数据集(MNIST → USPS, SVHN)上,IRAD 相比基线实现一致改进,尤其在目标域训练数据有限时表现更优。
- 消融实验表明,若移除循环一致性损失,性能下降超过 10%,凸显其在特征解耦中的关键作用。
- 对抗性训练中若缺少随机噪声项($\bm{x}_{rnd}$),正常与异常特征将发生混合,导致检测性能下降。
- 相似性目标(公式 4)能有效对齐潜在空间中源域与目标域的表示,如主成分分析投影与内积幅值所示。
- 理论分析揭示了联合误差的下界与泛化误差的上界,解释了过训练导致的性能下降,并指导模型优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。