Skip to main content
QUICK REVIEW

[논문 리뷰] Benford or not Benford: a systematic but not always well-founded use of an elegant law in experimental fields

Stéphane Blondeau Da Silva|arXiv (Cornell University)|2018. 04. 16.
Benford’s Law and Fraud Detection참고 문헌 22인용 수 4
한 줄 요약

이 논문은 상한이 존재하는 자연 발생적 데이터의 첫 번째 자릿수 분포가 벤포르드의 법칙보다는 상한 $ n $ 에 의존하는 법칙에 더 잘 따르는 확률 모델을 제안한다. 모델은 $ i \leq n $ 인 임의로 선택된 범위 $[1, i]$ 에서 이산 균일 분포를 사용하며, 벤포르드의 법칙에서 관찰되는 편차가 무작위가 아니라 체계적이고 예측 가능하다는 것을 보여주며, 상한이 벤포르드의 로그 법칙보다 더 잘 맞는 분포를 가능하게 한다.

ABSTRACT

In this paper, we will see that the proportion of d as leading digit, d $\\in$ 1, 9, in data (obtained thanks to the hereunder developed model) is more likely to follow a law whose probability distribution is determined by a specific upper bound, rather than Benford's Law. These probability distributions fluctuate around Benford's value as can often be observed in the literature in many naturally occurring collections of data (where the physical , biological or economical quantities considered are upper bounded). Knowing beforehand the value of the upper bound can be a way to find a better adjusted law than Benford's one.

연구 동기 및 목표

  • 벤포르드의 법칙이 널리 사용되지만 실제 데이터가 자주 벤포르드의 법칙에서 벗어나는 이유를 조사하기 위해.
  • 자연 발생적 데이터의 상한을 고려하는 확률 모델을 개발하여, 첫 번째 자릿수 빈도의 체계적 변동을 설명하기 위해.
  • 벤포르드의 법칙이 항상 최적은 아니며, 상한에 의존하는 분포가 상한이 존재하는 데이터에 더 잘 맞는다는 것을 보여주기 위해.
  • 벤포르드의 법칙이 근사적으로 나타나는 조건과, 다른 법칙이 구조적으로 더 적합한 조건을 정식화하기 위해.

제안 방법

  • 모델은 각 결과 $ (i,j) $ 가 임의로 선택된 범위 $[1,i]$ 와 $ i \in [1,n] $ 인 균일 분포값 $ j \in [1,i] $ 로 구성되는 확률 공간 $ \Omega_n $ 을 정의한다.
  • 첫 번째 자릿수 $ d \in \{1,\dots,9\} $ 은 $ j $ 로부터 추출되며, 장기 비율로 나타내는 $ d $ 가 첫 번째 자릿수로 나타나는 비율은 $ \tilde{C}_{(d,n)} $ 로 계산된다.
  • 조화급수 근사와 로그 적분을 사용하여 $ \tilde{C}_{(d,n)} $ 의 이론적 점근적 표현을 유도하며, 특히 $ \sum_{i=a}^{b} \frac{1}{i} \sim \ln(b/a) $ 를 포함한다.
  • 모델은 상한 $ n $ 을 통합함으로써 벤포르드 분포를 일반화하여, $ d=1 $ 에서 $ 9 $ 까지의 분포 가족 $ (P_{(d,n)})_{d=1}^9 $ 을 도출하며, 이는 벤포르드 값 주변을 진동한다.
  • 첫 번째 자릿수 확률을 계산하기 위해 구간 $[d \cdot 10^k, (d+1) \cdot 10^k)$ 에 대해 조각별 합을 사용하고, $ n \to \infty $ 일 때의 점근적 행동을 유도한다.
  • 논문은 유도된 분포를 벤포르드의 법칙과 비교하며, $ \tilde{C}_{(d,n)} \sim \widehat{C}_{(d,n)} $ 라는 결과를 도출하며, 여기서 $ \widehat{C}_{(d,n)} $ 는 로그 항과 상수 $ \alpha_d, \beta_d $ 를 포함하는 상한에 의존하는 표현으로 수렴한다.

실험 결과

연구 질문

  • RQ1왜 경험적 데이터 세트는 벤포르드의 법칙을 따르는 것으로 간주되더라도 체계적으로 벤포르드의 법칙에서 벗어나는가?
  • RQ2데이터가 상한이 존재할 경우, 더 정확한 첫 번째 자릿수 빈도 분포를 도출할 수 있는가?
  • RQ3데이터 세트의 상한 $ n $ 이 첫 번째 자릿수의 확률 분포에 어떤 영향을 미치는가?
  • RQ4벤포르드의 법칙이 근사적으로 나타나는 조건은 무엇이며, 언제 구조적으로 부적절한가?

주요 결과

  • 상한이 존재하는 데이터에서 $ d $ 가 첫 번째 자릿수로 나타나는 비율은 상한 $ n $ 에 의존하는 분포로 수렴하며, 벤포르드의 법칙으로는 수렴하지 않는다.
  • 특히 $ d=1 $ 인 경우, 극한 비율 $ \tilde{C}_1 \approx 0.281 $ 이며, 이는 벤포르드의 값 $ 0.301 $ 보다 작다. 이는 체계적인 편차를 시사한다.
  • 모델은 첫 번째 자릿수 빈도의 진동이 무작위 잡음이 아니라 상한 $ n $ 에 의해 구조적으로 결정된 예측 가능한 것임을 보여준다.
  • 점근적 분포 $ \tilde{C}_{(d,n)} $ 는 로그 항과 상수 $ \alpha_d, \beta_d $ 를 포함하는 닫힌 형태의 표현으로 수렴하며, 이는 $ d $ 와 $ n $ 에 따라 달라진다.
  • 유도된 분포 $ P_{(d,n)} $ 는 알려진 상한이 존재하는 데이터에 대해 벤포르드의 법칙보다 더 잘 맞는다. 특히 물리적, 생물학적, 경제적 시스템에서 그렇다.
  • 결과는 벤포르드의 법칙이 보편 법칙이 아니며, 현실 세계의 데이터에서 상한으로 인한 체계적 편차를 포착하지 못하므로 실패한다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.