Skip to main content
QUICK REVIEW

[논문 리뷰] Relational Marginal Problems: Theory and Estimation

Ondřej Kuželka, Yuyi Wang|ORCA Online Research @Cardiff (Cardiff University)|2017. 09. 18.
Bayesian Modeling and Causal Inference인용 수 9
한 줄 요약

이 논문은 훈련 데이터와 테스트 데이터의 크기가 다를 때에도 통계적으로 타당한 매개변수 추정을 가능하게 하는 관계형 마진 문제를 프레임워크로 제안한다. 최대 엔트로피 분포와 최대우도 추정 간의 이중성 관계를 확립하고, 추정 오차의 경계를 유도하며, 추출 시 복원 없이 표본을 추출할 경우 실현 가능성과 효과적 표본 크기 추정을 보장하기 위한 조정 방법을 제안한다.

ABSTRACT

In the propositional setting, the marginal problem is to find a (maximum-entropy) distribution that has some given marginals. We study this problem in a relational setting and make the following contributions. First, we compare two different notions of relational marginals. Second, we show a duality between the resulting relational marginal problems and the maximum likelihood estimation of the parameters of relational models, which generalizes a well-known duality from the propositional setting. Third, by exploiting the relational marginal formulation, we present a statistically sound method to learn the parameters of relational models that will be applied in settings where the number of constants differs between the training and test data. Furthermore, based on a relational generalization of marginal polytopes, we characterize cases where the standard estimators based on feature's number of true groundings needs to be adjusted and we quantitatively characterize the consequences of these adjustments. Fourth, we prove bounds on expected errors of the estimated parameters, which allows us to lower-bound, among other things, the effective sample size of relational training data.

연구 동기 및 목표

  • 훈련 데이터와 테스트 데이터의 상수 개수가 다를 때 SRL에서 매개변수 추정의 과제를 해결한다.
  • 전체 데이터가 가용하지 않을 경우 표본화된 관계형 데이터로부터 유도된 매개변수 추정에 통계적 보장을 제공한다.
  • 관계형 마진 문제에서 최대 엔트로피 해가 존재하도록 보장하기 위해 매개변수 추정치를 조정할 수 있는 원칙적인 방법을 개발한다.
  • 다양한 도메인 크기에서 표준 특징 기반 추정기가 편향이 없고 실현 가능한 조건을 규명한다.
  • 기대 추정 오차의 경계를 설정하고, 관계형 훈련 데이터의 효과적 표본 크기의 하한을 유도한다.

제안 방법

  • 관계형 마진의 두 정의를 도입한다: 하나는 관계형 마진 분포에 기반하고, 다른 하나는 할퍼른 스타일의 무작위 치환 의미론에 기반한다.
  • 최대 엔트로피 분포가 주어진 관계형 마진을 만족할 때와 마르코프 논리 네트워크(MLNs)에서 최대우도 추정 간의 이중성 관계를 확립한다.
  • 도메인 크기 불일치로 인해 관계형 마진 문제가 실현 가능하지 않을 경우, 추정된 매개변수를 조정하는 방법을 제안한다.
  • 관계형 마진 다면체를 정의하여 실현 가능한 마진 분포의 집합을 특징지우고, 조정되지 않은 추정기가 어떤 도메인 크기에서나 유효한지 판단한다.
  • 집중 불등식(Hoeffding의 부등식)을 사용하여 표본 도메인에서 추정된 마진 확률과 진짜 마진 확률 간의 기대 차이를 경계한다.
  • 전역 마진과 부분표본에서 유도된 마진 간 기대 오차의 상한을 유도한다: $\mathbb{E}[|\widehat{A}_{\aleph} - \widehat{B}_{\Upsilon}|] \leq 1 - \left(\frac{m-k+1}{m}\right)^{k-1} + \sqrt{\frac{1+2\log 2}{4\lfloor m/k\rfloor}}$.

실험 결과

연구 질문

  • RQ1관계형 도메인으로 일반화된 문맥적 마진 문제를 위한 적절한 관계형 마진 정의는 무엇인가?
  • RQ2최대 엔트로피와 최대우도 추정 간의 이중성은 어떻게 관계형 설정으로 확장할 수 있는가?
  • RQ3관계형 마진 문제가 실현 가능한 조건은 무엇이며, 실현 가능하지 않을 경우 어떻게 추정치를 조정할 수 있는가?
  • RQ4표본화된 관계형 데이터로부터 유도된 매개변수 추정치의 통계적 성질은 무엇이며, 도메인 크기에 따라 어떻게 달라지는가?
  • RQ5전체 데이터가 가용하지 않을 경우, 관계형 훈련 데이터의 효과적 표본 크기를 어떻게 정량화할 수 있는가?

주요 결과

  • 최대 엔트로피 분포가 관계형 마진을 만족할 때와 마르코프 논리 네트워크에서 최대우도 추정 간의 이중성 관계가 확립되었으며, 이는 문맥적 경우를 일반화한다.
  • 기대 오차는 $1 - \left(\frac{m-k+1}{m}\right)^{k-1} + \sqrt{\frac{1+2\log 2}{4\lfloor m/k\rfloor}}$로 경계되며, 여기서 $m$은 표본 도메인의 크기이고 $k$는 局부 예제의 너비이다.
  • 모델 B의 경우, 기대 오차 경계는 공식에 포함된 변수 수에 따라 달라진다: $\mathbb{E}[|\widetilde{A}_{\Upsilon} - A_{\aleph}|] \leq \sqrt{\frac{1+2\log 2}{4\lfloor n/|\text{vars}(\alpha)|\rfloor}}$.
  • 관계형 마진 다면체를 도입하여 실현 가능한 마진 분포 집합을 특징지우고, 어떤 도메인 크기에서나 조정되지 않은 추정기가 실현 가능한지 판단할 수 있다.
  • 논문은 기대 추정 오차를 바탕으로 관계형 훈련 데이터의 효과적 표본 크기의 하한을 제공한다.
  • 제안된 조정 방법은 원래 추정치가 실현 가능하지 않더라도 관계형 마진 문제의 해가 존재하도록 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.