Skip to main content
QUICK REVIEW

[论文解读] n-digit Benford distributed random variables

Azar Khosravani, Constantin Rasinariu|arXiv (Cornell University)|Apr 30, 2013
Benford’s Law and Fraud Detection参考文献 4被引用 3
一句话总结

本文引入了 $n$-位本福德分布的随机变量这一概念——即其前 $n$ 个有效数字遵循本福德定律,而第 $n$ 位之后的数字则不一定。通过使用对数密度函数 $g^\dagger$ 的模 1 映射来刻画数字分布,表明当 $g^\dagger$ 均匀时,会导出尺度不变性与进制不变性。本文的核心贡献是提出了一种构造 $n$-位本福德分布随机变量的一般方法,并通过 Mathematica 模拟展示了 1 位本福德分布的实例,模拟结果与理论本福德概率高度一致。

ABSTRACT

The scope of this paper is twofold. First, to emphasize the use of the mod 1 map in exploring the digit distribution of random variables. We show that the well-known base- and scale-invariance of Benford variables are consequences of their associated mod 1 density functions being uniformly distributed. Second, to introduce a new concept of the $n$-digit Benford variable. Such a variable is Benford in the first $n$ digits, but it is not guaranteed to have a logarithmic distribution beyond the $n$-th digit. We conclude the paper by giving a general construction method for $n$-digit Benford variables, and provide a concrete example.

研究动机与目标

  • 阐明模 1 映射在刻画随机变量数字分布中的作用。
  • 证明本福德分布随机变量的尺度不变性与进制不变性源于模 1 密度 $g^\dagger$ 的均匀性。
  • 引入并形式化 $n$-位本福德分布随机变量的概念,即其前 $n$ 个有效数字服从本福德定律,但后续数字不一定。
  • 提出一种利用分段定义的模 1 密度构造 $n$-位本福德分布随机变量的一般方法。
  • 通过使用 Mathematica 对 100,000 个数据点的数值模拟验证该构造方法。

提出的方法

  • 将模 1 映射应用于随机变量 $Y$ 的对数密度 $g$,定义 $g^\dagger(x) = \sum_{k=-\infty}^{\infty} g(x+k)$($x \in [0,1)$),该函数控制有效数字的分布。
  • 通过计算 $g^\dagger$ 在对应于特定数字序列的对数区间上的积分,来确定前 $n$ 位数字的特定序列的概率。
  • 提出一种通用构造方法:将 $[0,1)$ 划分为 $10^n$ 个区间,并在每个区间上分段定义 $g^\dagger$ 为归一化的概率密度函数,以满足 $n$-位本福德条件。
  • 对于 1 位数字的示例,通过在区间 $[\log k, \log(k+1))$($k=1$ 到 $9$)上使用正弦函数构造非均匀的 $g^\dagger$,确保首位数字的概率正确。
  • 使用 Mathematica 生成 100,000 个数据点的离散近似,以表示 1 位本福德分布的随机变量,其密度函数 $f(y)$ 由 $g^\dagger$ 通过 $f(y) = g(\log y)/(y \ln 10)$ 推导得出。
  • 通过直方图与统计表格将模拟数据与理论本福德概率进行比较,结果表明高度一致。

实验结果

研究问题

  • RQ1模 1 密度函数 $g^\dagger$ 如何决定随机变量的数字分布?
  • RQ2为何本福德分布随机变量的尺度不变性与进制不变性源于 $g^\dagger$ 的均匀性?
  • RQ3能否构造出一种随机变量,使其前 $n$ 个有效数字服从本福德定律,而后续数字不一定?
  • RQ4如何利用分段定义的模 1 密度,提出一种构造 $n$-位本福德分布随机变量的一般方法?
  • RQ51 位本福德分布随机变量的数值模拟精度如何?模拟结果是否符合理论预期?

主要发现

  • 当且仅当其模 1 密度 $g^\dagger$ 在对应于数字序列的区间上的积分为 $\log\left(1 + \frac{1}{10^{n-1}d_1 + \cdots + d_n}\right)$ 时,一个随机变量在其前 $n$ 位数字上才是本福德分布的。
  • 通过将 $[0,1)$ 划分为 $10^n$ 个区间,并在每个区间上定义归一化的 $g^\dagger$ 密度,可实现 $n$-位本福德分布随机变量的构造,从而确保所有 $n$-位组合的累积概率正确。
  • 使用 100,000 个数据点在 Mathematica 中成功模拟了 1 位本福德分布随机变量,模拟得到的首位数字分布与理论本福德概率高度吻合。
  • 模拟得到的数字 1 至 9 的概率分别为 0.3006、0.1775、0.1258、0.0957、0.0783、0.0671、0.0572、0.0516 和 0.0463,与理论值 0.3010、0.1761、0.1249、0.0969、0.0792、0.0669、0.0580、0.0512 和 0.0458 非常接近。
  • 通过非均匀 $g^\dagger$(如基于正弦函数的构造)的示例表明,尽管可生成 1 位本福德分布的随机变量,但其不具备尺度不变性或进制不变性,从而确认 $g^\dagger$ 的均匀性是实现这些不变性的必要条件。
  • 本文确立了 $g^\dagger = 1$(即均匀分布)是实现尺度不变性与进制不变性的充要条件,且该均匀性可直接推出首位数字的本福德定律。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。