Skip to main content
QUICK REVIEW

[论文解读] Feature Shift Detection: Localizing Which Features Have Shifted via Conditional Distribution Tests

Sean Kulinski, Saurabh Bagchi|arXiv (Cornell University)|Jul 14, 2021
Time Series Analysis and Forecasting被引用 9
一句话总结

该论文提出了一种新颖的方法,通过使用基于得分的检验统计量(源自密度模型梯度)进行条件分布假设检验,来检测和定位多变量传感器数据中的分布偏移。该方法可在单次前向和反向传播中高效地同时对所有特征进行检验,实现了在分布偏移检测和特征级定位方面的最先进性能,即使在互信息较低和自然数据偏移的情况下也表现优异。

ABSTRACT

While previous distribution shift detection approaches can identify if a shift has occurred, these approaches cannot localize which specific features have caused a distribution shift -- a critical step in diagnosing or fixing any underlying issue. For example, in military sensor networks, users will want to detect when one or more of the sensors has been compromised, and critically, they will want to know which specific sensors might be compromised. Thus, we first define a formalization of this problem as multiple conditional distribution hypothesis tests and propose both non-parametric and parametric statistical tests. For both efficiency and flexibility, we then propose to use a test statistic based on the density model score function (i.e. gradient with respect to the input) -- which can easily compute test statistics for all dimensions in a single forward and backward pass. Any density model could be used for computing the necessary statistics including deep density models such as normalizing flows or autoregressive models. We additionally develop methods for identifying when and where a shift occurs in multivariate time-series data and show results for multiple scenarios using realistic attack models on both simulated and real world data.

研究动机与目标

  • 为现有分布偏移检测方法中无法定位具体哪些特征(例如传感器)发生偏移这一关键空白提供解决方案。
  • 将特征偏移检测问题形式化为多个条件分布假设检验,以提升对相关联对抗性攻击的检测能力。
  • 开发一种高效且可扩展的检验统计量,使仅通过一次前向和反向传播即可实现对所有特征的同时检验。
  • 将该方法扩展至时间序列数据,以识别动态传感器网络中攻击发生的时间和位置。
  • 在真实世界和模拟数据集上,于现实的对抗性模型下(包括自然数据偏移)展示出稳健的性能。

提出的方法

  • 该方法使用基于得分的检验统计量,源自费雪散度,通过输入变量的对数密度梯度计算得出,可实现对所有特征的高效并行计算。
  • 该统计量可使用任意可微分密度模型(包括归一化流和自回归模型)计算,利用现有模型的梯度实现计算开销极低。
  • 通过构建条件分布假设检验,检测在其他特征取值给定条件下某一特征分布的偏移,从而提高对相关联攻击的敏感性。
  • 对于时间序列数据,该方法采用时间感知自助法(time-aware bootstrapping)以建模时间依赖性,并区分对抗性偏移与自然数据漂移。
  • 该方法支持非参数和参数统计检验框架,允许在模型假设上具有灵活性。
  • 该方法专为在线部署设计,可在每个时间步实现极低计算成本的实时检测。

实验结果

研究问题

  • RQ1我们能否在多变量传感器数据中检测分布偏移,并定位具体哪些特征被攻击者操纵?
  • RQ2条件分布检验能否提升对匹配边缘分布但不匹配联合依赖关系的对抗性攻击的检测能力?
  • RQ3我们能否在不牺牲准确性的前提下,高效地同时计算所有特征的偏移检测统计量?
  • RQ4在特征间互信息较低的情况下,所提出的基于得分的检验统计量能否保持高性能?
  • RQ5在真实世界时间序列传感器数据中常见的自然数据偏移下,该方法表现如何?

主要发现

  • 基于得分的检验统计量在所有评估数据集上均实现了最先进的检测与定位性能,优于基于高斯分布的基线方法。
  • 该方法即使在单个传感器读数表现如正常样本时,也能成功检测出模拟传感器网络中的对抗性攻击,归因于其对联合分布偏移的敏感性。
  • 在能源和天然气数据集上,即使时间轴未打乱,该方法仍保持了高检测与定位精度,表明对时间重排具有鲁棒性。
  • 在新冠数据集上,由于良性偏移较强,时间感知自助法设置的检测阈值过高,导致未打乱时间轴情况下检测与定位准确率均为0%。
  • 该方法在传感器数量增加时具有高效的可扩展性,相比逐特征测试,计算量减少了约 O(d),得益于单次遍历的梯度计算。
  • 该方法在深度密度模型(如归一化流和自回归模型)上表现出色,表明其对现代生成模型具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。