Skip to main content
QUICK REVIEW

[论文解读] Anomaly Detection with Tensor Networks

Jinhui Wang, Chase Roberts|arXiv (Cornell University)|Jun 3, 2020
Anomaly Detection Techniques and Applications参考文献 41被引用 18
一句话总结

本文提出张量网络异常检测(TNAD),一种新颖的线性模型,利用张量网络高效表示高维变换,用于单类异常检测。通过惩罚变换矩阵的Frobenius范数,TNAD在稀疏的正常数据周围实现紧密拟合,在表格数据集上优于深度学习和传统方法,并在图像数据集上取得具有竞争力的结果,且无需利用空间局部性。

ABSTRACT

Originating from condensed matter physics, tensor networks are compact representations of high-dimensional tensors. In this paper, the prowess of tensor networks is demonstrated on the particular task of one-class anomaly detection. We exploit the memory and computational efficiency of tensor networks to learn a linear transformation over a space with dimension exponential in the number of original features. The linearity of our model enables us to ensure a tight fit around training instances by penalizing the model's global tendency to a predict normality via its Frobenius norm---a task that is infeasible for most deep learning models. Our method outperforms deep and classical algorithms on tabular datasets and produces competitive results on image datasets, despite not exploiting the locality of images.

研究动机与目标

  • 解决单类异常检测中的挑战:正常数据丰富,但异常样本稀少且分布在庞大而高维的空间中。
  • 克服深度学习模型因模型复杂度过高而导致在整个输入空间中行为难以控制的局限性。
  • 利用张量网络在内存和计算效率方面的优势,学习高维特征空间的紧凑且表达能力强的表示。
  • 通过线性变换的Frobenius范数正则化,确保在正常样本周围形成紧密的决策边界,这一策略对大多数深度模型不可行。
  • 证明张量网络可作为深度学习在异常检测中的强大且可扩展的替代方案,且无需依赖如图像局部性等归纳偏置。

提出的方法

  • 该模型在远大于输入维度的特征空间上执行线性变换,通过张量网络紧凑表示,避免完整矩阵计算。
  • 关键创新在于使用Frobenius范数正则化,以惩罚模型整体趋向于正常性的倾向,确保训练样本周围的决策边界紧密。
  • 模型采用两种类型的特征嵌入:三角函数型(ϕ_trig)和基于傅里叶的(ϕ_four),后者用于Glass等数据集以更好地利用正交性。
  • 张量网络结构由键维数b=5和控制嵌入维度相对于训练样本数量的参数α定义。
  • 采用两阶段训练方案,通过阻尼和学习率衰减稳定优化,尤其适用于较大模型。
  • 异常得分源自模型的决策函数,该函数计算线性变换的输出,数值越高表示与正常性的偏离越大。

实验结果

研究问题

  • RQ1张量网络能否以计算高效的方式有效表示高维线性变换,用于异常检测?
  • RQ2与深度学习模型相比,对线性变换施加Frobenius范数正则化是否能在稀疏正常数据周围实现更紧密的拟合?
  • RQ3采用张量网络参数化的线性模型是否能在表格异常检测基准上超越传统方法和深度学习方法?
  • RQ4像TNAD这样不考虑局部性的模型在图像数据集上的表现与考虑局部性的模型相比如何?
  • RQ5在不依赖特定领域归纳偏置的前提下,张量网络在多大程度上可作为可扩展的宽模型架构,用于单类异常检测?

主要发现

  • TNAD在所有五个ODDS基准数据集上均取得最高AUROC,其中在Wine数据集上达到97.3±4.5%,显著优于次佳方法(OC-SVM为60.0%)。
  • 在Glass数据集上,TNAD取得81.8±7.3% AUROC,超过OC-SVM(62.0%)及其他基线方法,尽管该数据集存在高度类别不平衡和样本量小的问题。
  • 在Thyroid数据集上,TNAD与最佳基线方法(99.0±0.1%)持平,得分为99.0±0.1%,展现出在中等规模数据上的鲁棒性。
  • 在大型Forest Cover数据集上,TNAD取得98.8±0.6% AUROC,优于OC-SVM(97.7%)及其他所有模型,包括自监督方法GOAD(64.6±4.7%)。
  • GOAD在非图像数据(如Satellite和Forest Cover)上性能显著下降,表明仿射变换在任意表格数据上可能不具备良好的泛化能力。
  • 在Glass数据集中使用傅里叶嵌入(ϕ_four)对性能至关重要,表明嵌入设计在小样本、高类别不平衡数据集上的成功中起着决定性作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。