[论文解读] Gaussian Process Subset Scanning for Anomalous Pattern Detection in Non-iid Data
本文提出高斯过程子集扫描(GPSS)和高斯过程邻域扫描(GPNS),通过结合高斯过程与一种新颖的对数似然比统计量,检测在相关时空数据中具有不规则、非独立同分布(non-iid)特性的异常模式,该统计量不假设条件独立性。该方法能够在多个数据流中实现强大且可解释的检测,识别出细微的集体异常,优于基线方法在真实世界数据集(包括阿片类药物死亡、311电话求助和学校缺勤)上的表现。
Identifying anomalous patterns in real-world data is essential for understanding where, when, and how systems deviate from their expected dynamics. Yet methods that separately consider the anomalousness of each individual data point have low detection power for subtle, emerging irregularities. Additionally, recent detection techniques based on subset scanning make strong independence assumptions and suffer degraded performance in correlated data. We introduce methods for identifying anomalous patterns in non-iid data by combining Gaussian processes with novel log-likelihood ratio statistic and subset scanning techniques. Our approaches are powerful, interpretable, and can integrate information across multiple data streams. We illustrate their performance on numeric simulations and three open source spatiotemporal datasets of opioid overdose deaths, 311 calls, and storm reports.
研究动机与目标
- 解决现有异常检测方法假设数据独立同分布(i.i.d.)所带来的局限性,避免在相关现实系统中产生高误报率。
- 检测个体点异常检测难以识别的细微、集体异常模式,因其单点异常程度较低。
- 开发一种方法,可在复杂相关数据中识别形状不规则、不连续的异常子集,且无需依赖强独立性假设。
- 通过高斯过程建模常规动态和局部异常模式,整合领域知识,实现可解释、与政策相关的异常检测。
- 提供可扩展、有理论依据的算法,利用迭代和广义瑞利商优化方法求解非i.i.d.数据中的NP难子集扫描问题。
提出的方法
- 提出一种适用于非i.i.d.数据的新对数似然比(LLR)统计量,通过高斯过程(GP)建模捕捉协方差结构,避免传统子集扫描中对条件独立性的假设。
- 采用留出法GP推断估计零假设模型(即常规动态),避免异常污染,确保在无标注异常数据情况下的鲁棒性。
- 应用一种新颖的迭代算法,通过基于GP结构LLR的条件最优系数β*,逐步更新子集成员资格,近似最优子集。
- 引入一种带约束的优化变体,利用数据块(如空间上连续的区域)施加结构先验,采用改进的βMAX公式以考虑非对角线协方差项。
- 采用广义瑞利商(GRQ)作为替代优化策略,以数学基础坚实的方式识别高分值子集。
- 将GP建模与子集扫描相结合,联合学习底层协方差结构并检测异常子集,实现对时间、空间及多流数据中不规则形状模式的检测。
实验结果
研究问题
- RQ1能否设计一种新型对数似然比统计量,在不假设条件独立性的前提下,检测非i.i.d.数据中的异常模式?
- RQ2如何将高斯过程建模与子集扫描结合,以提升在相关数据中检测细微、集体异常的检测能力?
- RQ3迭代优化与广义瑞利商优化策略能否有效近似高维、相关数据中寻找最异常子集的NP难问题?
- RQ4所提出的基于GP的子集扫描方法在检测多样化、复杂真实世界数据集中的异常时,与基线方法相比表现如何?
- RQ5该方法在多大程度上能产生可解释、与政策相关联的异常检测结果,使其与领域专家的理解一致?
主要发现
- GPSS和GPNS方法成功检测到2016年1月至2月期间曼哈顿西区学校缺勤数据中一个连贯的异常模式,而基线方法未能识别。
- 该异常对应一场五级暴风雪,尽管未正式宣布停课,却显著影响了出勤率,表明其对系统造成广泛影响,而个体点检测方法未能捕捉到。
- 基线异常检测方法未能识别出连贯的异常,反而在整个年度报告出零散、不连贯的检测结果,凸显i.i.i.d.-基础方法的局限性。
- GPSS方法在模拟数据和真实世界数据集(包括阿片类药物过量死亡、311电话求助和风暴报告)上均实现了高检测功效,通过建模复杂相关性和不规则模式。
- 迭代优化与基于GRQ的优化策略为NP难子集扫描问题提供了可扩展且有效的解决方案,使该方法可实际应用于真实世界数据。
- 该方法展现出强大的可解释性,使领域专家能够通过GP学习到的常规动态和局部异常区域,验证并理解检测到的异常。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。