Skip to main content
QUICK REVIEW

[论文解读] Focusing on a Probability Element: Parameter Selection of Message Importance Measure in Big Data

Rui She, Shanyun Liu|arXiv (Cornell University)|Jan 12, 2017
Anomaly Detection Techniques and Applications参考文献 12被引用 4
一句话总结

本文提出了一种针对消息重要性度量(MIM)的参数选择方法,通过设定重要性系数 𝜔_j = 1/p_j,聚焦于大数据分布中的特定概率元素,从而增强对罕见或异常事件的检测能力。该方法通过强调低概率事件来提升异常检测性能,理论分析与仿真结果证实其在统计模型下对少数子集检测的有效性。

ABSTRACT

Message importance measure (MIM) is applicable to characterize the importance of information in the scenario of big data, similar to entropy in information theory. In fact, MIM with a variable parameter can make an effect on the characterization of distribution. Furthermore, by choosing an appropriate parameter of MIM, it is possible to emphasize the message importance of a certain probability element in a distribution. Therefore, parametric MIM can play a vital role in anomaly detection of big data by focusing on probability of an anomalous event. In this paper, we propose a parameter selection method of MIM focusing on a probability element and then present its major properties. In addition, we discuss the parameter selection with prior probability, and investigate the availability in a statistical processing model of big data for anomaly detection problem.

研究动机与目标

  • 解决现有MIM参数选择方法仅关注最小概率事件、忽略其他罕见事件的局限性。
  • 开发一种实用且自适应的MIM参数选择策略,以强调分布中的特定概率元素。
  • 通过定制MIM以聚焦于具有小但非最小概率的异常事件,实现更有效的大数据中少数子集检测。
  • 在与现实世界大数据异常检测应用相关的统计模型中验证所提方法。

提出的方法

  • 定义一种参数化MIM,其中重要性系数 𝜔_j = 1/p_j,p_j 为需强调的目标概率元素。
  • 推导出MIM表达式为 L_j(p, 𝜔_j) = log(∑ p_i * exp( (1/p_j)(1 - p_i) )),该表达式可调节对 p_j 的敏感度。
  • 分析该参数化下MIM的关键性质,包括单调性以及在均匀分布与非均匀分布下的行为。
  • 应用一阶与二阶泰勒展开近似,估计在抽样条件下经验MIM的期望值与方差。
  • 利用切比雪夫不等式分析经验MIM估计器在样本量增加时的收敛性质。
  • 通过二项分布、泊松分布与几何分布的数值仿真验证该方法。

实验结果

研究问题

  • RQ1如何选择MIM参数以聚焦于特定低概率事件,而非仅限于最小概率事件?
  • RQ2当重要性系数设为 𝜔_j = 1/p_j 时,MIM的基本性质是什么?
  • RQ3当应用于不同概率分布时,MIM在检测少数子集方面的表现如何?
  • RQ4经验MIM估计器在抽样条件下是否能可靠收敛?样本量如何影响其准确度与方差?
  • RQ5所提出的MIM参数化方法是否能有效区分罕见事件与均匀或多数分布?

主要发现

  • 在所有测试分布中,MIM在 𝜔_j = 1/p_j 下对 p_j 严格递减,证实其对低概率事件的敏感性。
  • 对于非均匀分布,聚焦于特定 p_j 的MIM值高于均匀分布,验证了其检测非均匀性偏离的能力。
  • 经验MIM估计器的期望值 E(𝐿̂_i) 随样本量 N_i 增加而收敛至真实MIM值,尤其在 p 较小时表现更佳。
  • 经验MIM估计器的方差 D(𝐿̂_i) 随 N_i 增加而减小,且当 0 < p < 1/2 时,其随 μ = p 单调递减。
  • 聚焦于特定概率元素的MIM在经验设置中表现出强收敛性,适用于大数据中的统计异常检测。
  • 数值结果证实,MIM在 𝜔_j = 1/p_j 下能有效突出罕见事件,在检测能力上优于均匀分布基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。