Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond the Chinese Restaurant and Pitman-Yor processes: Statistical Models with Double Power-law Behavior

Fadhel Ayed, Juho Lee|arXiv (Cornell University)|2019. 02. 13.
Bayesian Methods and Mixture Models참고 문헌 46인용 수 8
한 줄 요약

이 논문은 순위 빈도에서 이중 거듭제곱 법칙 행동을 보이는 랜덤 확률 측도를 생성하는 새로운 종류의 완전 임의 측도—이중 정규로 변하는 CRMs—를 소개한다. 피트만-요르 과정과 달리, 이 과정은 단일 거듭제곱 법칙 영역을 가지지만, 제안된 모델들(일반화된 BFRY 및 베타 제곱 과정 포함)은 낮은 빈도 항목에 대해 τ로 제어되는 지수를 가지는, 높은 빈도 항목에 대해 α로 제어되는 지수를 가지는 두 가지 별개의 거듭제곱 법칙 영역을 포착한다. 이는 텍스트 및 네트워크 데이터에서 훨씬 더 나은 적합도를 제공한다.

ABSTRACT

Bayesian nonparametric approaches, in particular the Pitman-Yor process and the associated two-parameter Chinese Restaurant process, have been successfully used in applications where the data exhibit a power-law behavior. Examples include natural language processing, natural images or networks. There is also growing empirical evidence that some datasets exhibit a two-regime power-law behavior: one regime for small frequencies, and a second regime, with a different exponent, for high frequencies. In this paper, we introduce a class of completely random measures which are doubly regularly-varying. Contrary to the Pitman-Yor process, we show that when completely random measures in this class are normalized to obtain random probability measures and associated random partitions, such partitions exhibit a double power-law behavior. We discuss in particular three models within this class: the beta prime process (Broderick et al. (2015, 2018), a novel process called generalized BFRY process, and a mixture construction. We derive efficient Markov chain Monte Carlo algorithms to estimate the parameters of these models. Finally, we show that the proposed models provide a better fit than the Pitman-Yor process on various datasets.

연구 동기 및 목표

  • 기존 베이지안 비모수 모델들, 예를 들어 피트만-요르 과정이 단일 거듭제곱 법칙 영역을 가정하지만, 실제 데이터에서 이중 거듭제곱 법칙 행동에 대한 점점 더 많은 경험적 증거가 존재하므로, 이러한 제한을 해결하고자 한다.
  • 순위 빈도에서 두 가지 별개의 거듭제곱 법칙 영역을 가진 랜덤 확률 측도를 생성할 수 있는 새로운 종류의 완전 임의 측도—이중 정규로 변하는 CRMs—를 개발하고자 한다.
  • 이러한 모델을 위한 두 가지 일반적 구성 방법을 제공하고, 구체적인 과정들인 일반화된 BFRY 과정과 베타 제곱 과정을 구현하고자 한다.
  • 이러한 모델에서 모수 추정을 위한 효율적인 마르코프 체인 몬테카를로 추론 알고리즘을 유도하고자 한다.
  • 제안된 모델이 다양한 데이터셋, 특히 텍스트 코퍼스와 사회적 네트워크에서 피트만-요르 과정보다 더 나은 적합도를 보임을 경험적으로 검증하고자 한다.

제안 방법

  • 이중 정규로 변하는 완전 임의 측도(CRMs)의 새로운 클래스를 제안하며, 이는 레비 측도가 두 가지 별개의 정규로 변하는 영역를 가지는 것을 의미한다.
  • 일반화된 BFRY 과정을 안정적인 베타 과정의 변환으로, 베타 제곱 과정을 일반화된 감마 과정의 변환으로 구성한다.
  • CRMs를 정규화하여 순위 빈도에서 이중 거듭제양 법칙 행동을 보이는 랜덤 확률 측도를 얻는다: $ f_{(k)} \simeq \begin{cases} C_1 k^{-1/\tau} & \text{for small }k \\ C_2 k^{-1/\alpha} & \text{for large }k \end{cases} $
  • 모델 모수, 특히 σ, τ 및 기타 초모수에 대한 사후 추론을 위한 효율적인 MCMC 알고리즘을 유도한다.
  • 모델 적합도를 정량적으로 비교하기 위해 재가중된 콜모고로프-스미르노프 수렴을 사용한다.
  • 미국 국립 코퍼스, 프랑스어 및 영어 책, NIPS1000, 트위터 네트워크와 같은 실제 데이터셋에 모델을 적용하여 빈도 및 순위 분포 양면에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1순위 빈도에서 낮은 빈도 영역과 높은 빈도 영역에 대해 별개의 지수를 가지는 이중 거듭제곱 법칙 행동을 포착할 수 있는 베이지안 비모수 모델을 구축할 수 있는가?
  • RQ2제안된 이중 정규로 변하는 CRMs가 정규화되었을 때, 두 가지 별개의 거듭제곱 법칙 영역을 가지는 무작위 분할과 빈도 분포를 생성하는가?
  • RQ3이중 거듭제곱 법칙 행동이 의심되는 실제 데이터셋에 대해 일반화된 BFRY 과정과 베타 제곱 과정은 피트만-요르 과정보다 어떻게 성능을 냈는가?
  • RQ4이러한 새로운 모델에 대해 효율적인 MCMC 추론 알고리즘을 개발할 수 있는가? 이는 대규모 데이터셋에 대한 실용적 응용을 가능하게 한다.
  • RQ5경험적 데이터에서 관찰된 이중 거듭제곱 법칙 행동—예를 들어 단어 빈도와 네트워크 차수—은 제안된 모델이 표준 피트만-요르 기반 모델보다 더 잘 포착하는가?

주요 결과

  • 일반화된 BFRY 과정과 베타 제곱 과정은 이중 정규로 변하는 CRMs의 사례로서, 낮은 빈도 영역에 대해 τ, 높은 빈도 영역에 대해 α로 제어되는 별개의 지수를 가지는 이중 거듭제곱 법칙 행동을 성공적으로 모델링한다.
  • 미국 국립 코퍼스(ANC) 데이터셋에서 GBFRY 모델은 콜모고로프-스미르노프 수렴이 0.033으로, 피트만-요르 과정(0.081)보다 유의미하게 낮아 더 나은 적합도를 나타낸다.
  • NIPS1000 데이터셋에서 GBFRY 모델은 수렴이 0.041로, 피트만-요르 과정(0.059)과 일반화된 감마 과정(0.08)을 모두 뛰어넘어 더 나은 예측 성능을 확인한다.
  • 높은 빈도 지수 τ에 대한 사후 신뢰구간은 텍스트 데이터셋에서 일관되게 1에 가까웠다 (예: ANC의 경우 (0.998, 1.055)), 이는 지프 법칙 지수 가설을 지지한다.
  • 트위터 데이터에서 GBFRY 모델은 높은 빈도 지수 τ ≈ 1.60과 낮은 빈도 지수 σ ≈ 0.28을 포착했으며, 피트만-요르 과정은 높은 빈도 尾영역을 모델링하지 못했다.
  • 시각적 사후 예측 점검(Fig. 3)은 오직 GBFRY와 베타 제곱 모델만이 발생 비율과 순위 빈도 양쪽 모두에서 이중 거듭제곱 법칙 형태를 정확히 포착했음을 확인했으며, 피트만-요르 모델은 그렇지 못했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.