Skip to main content
QUICK REVIEW

[논문 리뷰] Probabilistic Relational Model Benchmark Generation

Mouna Ben Ishak, Rajani Chulyadyo|arXiv (Cornell University)|2016. 03. 02.
Bayesian Modeling and Causal Inference참고 문헌 33인용 수 3
한 줄 요약

이 논문은 무작위로 생성된 스키마와 확률적 종속성에서 합성된 확률적 관계 모델(PRMs) 및 관련 관계형 데이터베이스 인스턴스를 생성하기 위한 새로운 알고리즘 프레임워크를 제시한다. 무작위 DAG 생성과 확률적 종속성 모델링을 결합함으로써 기계학습 및 데이터베이스 시스템을 위한 재현 가능한 벤치마킹을 가능하게 하며, 확장 가능한 불확실성 인식 데이터를 지원함으로써 SRL 연구와 DBMS 평가 모두에 기여한다.

ABSTRACT

The validation of any database mining methodology goes through an evaluation process where benchmarks availability is essential. In this paper, we aim to randomly generate relational database benchmarks that allow to check probabilistic dependencies among the attributes. We are particularly interested in Probabilistic Relational Models (PRMs), which extend Bayesian Networks (BNs) to a relational data mining context and enable effective and robust reasoning over relational data. Even though a panoply of works have focused, separately , on the generation of random Bayesian networks and relational databases, no work has been identified for PRMs on that track. This paper provides an algorithmic approach for generating random PRMs from scratch to fill this gap. The proposed method allows to generate PRMs as well as synthetic relational data from a randomly generated relational schema and a random set of probabilistic dependencies. This can be of interest not only for machine learning researchers to evaluate their proposals in a common framework, but also for databases designers to evaluate the effectiveness of the components of a database management system.

연구 동기 및 목표

  • 기계학습 및 데이터베이스 연구에서 확률적 관계 모델(PRMs)에 대한 공개된 벤치마크 부족 문제를 해결하기 위해.
  • 통제된 조건 하에서 SRL 학습 알고리즘과 DBMS 구성 요소의 체계적 평가를 가능하게 하기 위해.
  • 기능적 및 확률적 종속성을 모두 반영하는 PRMs와 관련 관계형 데이터를 생성하기 위해.
  • 반복 가능한 알고리즘적 프로세스를 제공함으로써 재현 가능한 실험을 지원하기 위해.

제안 방법

  • 관계 스키마 구조를 위해 PMMixed 알고리즘을 사용하여 균일하게 분포된 연결된 방향 비순환 그래프(DAGs)를 생성한다.
  • 표본 공간 내에서 균일성을 유지하면서도 생성된 DAG가 연결되어 있음을 보장하기 위해 거부 샘플링을 적용한다.
  • 속성 수에 대해 λ=1, 값 상태 수에 대해 λ=1인 포isson 분포를 사용하여 각 관계에 대해 무작위로 속성과 카디널리티를 할당한다.
  • 각 클래스 내 조건부 확률 분포를 모델링하기 위해 수정된 PMMixed 알고리즘을 사용하여 클래스 내 종속성 구조를 구성한다.
  • 다른 클래스 간 변수 간의 간선 생성에 제한을 두어 관계의 무결성을 보장함으로써 클래스 간 종속성을 생성한다.
  • 스키마 그래프의 재귀적 탐색을 통해 최대 길이 K_max까지의 슬롯 체인(경로)을 결정하여 복잡한 확률적 쿼리 지원을 가능하게 한다.

실험 결과

연구 질문

  • RQ1어떻게 제어된 구조적 및 확률적 성질을 갖는 완전히 무작위이면서도 유효한 확률적 관계 모델을 처음부터 생성할 수 있는가?
  • RQ2어떤 알고리즘 전략이 벤치마킹에 적합한 연결성, 확장성, 다양성을 갖춘 관계 스키마를 보장하는가?
  • RQ3다양한 클래스 간에 확률적 종속성을 어떻게 systematic하게 인코딩할 수 있는가? 이때 모델의 표현력과 정확성을 유지해야 한다.
  • RQ4제안된 방법이 실제 세계의 데이터베이스에서 관찰되는 기능적 및 확률적 제약 조건을 얼마나 잘 반영하는 합성 데이터를 생성할 수 있는가?
  • RQ5이 프레임워크는 SRL 및 DBMS 평가 모두에 재사용 가능한 벤치마킹 도구로 기능할 수 있는가?

주요 결과

  • 제안된 방법은 관계 스키마와 확률적 종속성을 하나의 일관된 파이프라인에서 성공적으로 생성한다.
  • PMMixed 기반의 DAG 생성 후 거부 샘플링을 적용함으로써 유효한 DAG 공간에서 균일성을 유지하면서도 연결성을 보장한다.
  • 속성 카디널리티와 값 상태는 λ=1인 포isson 분포를 사용하여 생성되며, 평균적으로 각 관계당 2개의 속성을 갖는다.
  • 관계 스키마 생성의 시간 복잡도는 T * N * lg N이며, 여기서 T는 연결된 DAG를 생성하기 위해 필요한 PMMixed 호출의 평균 수이다.
  • 종속성 구조 생성의 시간 복잡도는 N * 2 * lg 2이며, 이는 평균적으로 각 클래스당 두 개의 속성을 반영한다.
  • 슬롯 체인 생성 과정의 시간 복잡도는 N^{K_max}이며, 이는 복잡한 스키마에서 경로 탐색의 지수적 비용을 반영한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.