Skip to main content
QUICK REVIEW

[논문 리뷰] Probabilistic Models of Relational Implication

Xavier Holt|arXiv (Cornell University)|2019. 07. 28.
Complex Network Analysis Techniques참고 문헌 20인용 수 14
한 줄 요약

이 논문은 경험적 분포 추정기와 링크 예측 모델을 사용하여 관계적 함의에 대한 공식적인 확률적 프레임워크를 제안하며, 17,848개의 인스턴스로 구성된 재재정의된 데이터셋에서 기존 최고 성능인 AUC 0.7812에서 0.8143으로 향상되었고, 전문가가 참여한 새로운 군중 소싱 체계를 통해 재정의된 후 정밀도가 53%에서 95%로 향상됨.

ABSTRACT

Relational data in its most basic form is a static collection of known facts. However, by learning to infer and deduct additional information and structure, we can massively increase the usefulness of the underlying data. One common form of inferential reasoning in knowledge bases is implication discovery. Here, by learning when one relation implies another, we can extend our knowledge representation. There are several existing models for relational implication, however we argue they are motivated but not principled. To this end, we define a formal probabilistic model of relational implication. By using estimators based on the empirical distribution of our dataset, we demonstrate that our model outperforms existing approaches. While previous work achieves a best score of 0.7812 AUC on an evaluatory dataset, our ProbE model improves this to 0.7915. Furthermore, we demonstrate that our model can be improved substantially through the use of link prediction models and dense latent representations of the underlying argument and relations. This variant, denoted ProbL, improves the state of the art on our evaluation dataset to 0.8143. In addition to developing a new framework and providing novel scores of relational implication, we provide two pragmatic resources to assist future research. First, we motivate and develop an improved crowd framework for constructing labelled datasets of relational implication. Using this, we reannotate and make public a dataset comprised of 17,848 instances of labelled relational implication. We demonstrate that precision (as evaluated by expert consensus with the crowd labels) on the resulting dataset improves from 53% to 95%.

연구 동기 및 목표

  • 기존의 관계적 함의 모델에서의 원칙적인 확률적 기초의 부족을 해결하기 위해.
  • 현재 정밀도가 낮아 문제를 일으키는 레이블이 부여된 관계적 함의 데이터셋의 품질과 신뢰성을 향상시키기 위해.
  • 링크 예측 모델을 훈련하고 튜닝하기 위한 확장 가능하고 최적화된 프레임워크를 개발하기 위해.
  • 링크 예측을 확률 모델링과 통합할 경우 관계적 함의 작업에서 성능 향상이 크게 이루어지는지 입증하기 위해.
  • 향후 관계 추론 및 지식 기반 보완 연구를 지원하기 위해 오픈소스 도구와 재정의된 데이터셋을 제공하기 위해.

제안 방법

  • 논문은 링크 예측에 의존하지 않고 데이터셋에서 경험적 빈도를 사용하여 함의 확률을 추정하는 ProbE라는 확률 모델을 도입함.
  • 관계적 함의를 조건부 확률 P(Z_r=1 | Z_p=1)로 공식화함. 여기서 Z_r과 Z_p는 각각 관계 r과 전제 p의 진리 여부를 나타냄.
  • 모델의 표현력을 향상시키기 위해 링크 예측 모델을 관계 튜플의 결합 확률 추정기로 사용함.
  • 레이블 품질을 향상시키기 위해 전문가 공감 기반의 새로운 타겟팅된 군중 정렬 프레임워크를 개발함. 이 프레임워크를 통해 17,848개의 인스턴스가 재정의됨.
  • 링크 예측 임베딩과 확률 모델을 통합한 ProbL로 프레임워크를 확장함. 이는 인자와 관계에 대해 밀도 있는 잠재 표현을 사용함.
  • 하이퍼파ram터 튜닝과 확장성을 지원하는 최적화되고 병렬화된 링크 예측 모델의 구현을 제공함.

실험 결과

연구 질문

  • RQ1관계적 함의에 대한 공식적인 확률 모델이 기존 히وري스틱 또는 비확률적 접근 방식을 뛰어넘을 수 있는가?
  • RQ2링크 예측 모델이 관계적 함의 시스템의 성능을 어느 정도 향상시킬 수 있는가?
  • RQ3기존의 관계적 함의를 위한 레이블이 부여된 데이터셋의 품질을 체계적으로 향상시킬 수 있는가?
  • RQ4확장 가능하고 모oduляр한 링크 예측 프레임워크를 개발하여 고정밀도 함의 모델링을 지원할 수 있는가?
  • RQ5전문가 검증을 거친 재정의된 데이터셋을 사용할 경우 모델 성능과 신뢰성에 어떤 영향을 미치는가?

주요 결과

  • ProbE 모델은 벤치마크 데이터셋에서 이전 최고 성능인 0.7812를 뛰어넘는 AUC 0.7915를 달성함.
  • 링크 예측을 확률 프레임워크와 통합한 ProbL 모델은 AUC 0.8143을 기록하여 이전 연구에 비해 뚜렷한 향상이 이루어짐.
  • 새로운 전문가 공감 프레임워크를 통해 재정의된 후 데이터셋의 정밀도가 53%에서 95%로 상승함.
  • 17,848개의 인스턴스로 구성된 재정의된 데이터셋은 향후 연구를 지원하기 위해 공개됨.
  • 최적화되고 병렬화된 링크 예측 프레임워크는 효율적인 하이퍼파ram터 튜닝을 가능하게 하며, 여러 기존 모델을 지원함.
  • 확률 프레임워크는 P(Z_r=1 | Z_p=1, Z_q=1)와 같은 복합 추론을 가능하게 하며, P(Z_q=0 | Z_p=1)와 같은 부정적 함의의 추론도 지원함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.