Skip to main content
QUICK REVIEW

[논문 리뷰] Probability Calibration for Knowledge Graph Embedding Models

Pedro Tabacof, Luca Costabello|arXiv (Cornell University)|2019. 12. 20.
Advanced Graph Neural Networks참고 문헌 38인용 수 15
한 줄 요약

이 논문은 실제 부정 예측이 제공되지 않는 경우에도 신뢰할 수 있는 확률 추정을 가능하게 하는 지식 그래프 임bedding 모델을 위한 새로운 校정 방법을 제안한다. 이 방법은 합성 부정 예측과 플랫팅 스케일링, 이소토닉 회귀를 사용하며, 지식 그래프에서 일반적인 개방 세계 가정 하에 실제 부정 예측이 부족한 상황에서도 상태 최고 수준의 정확도를 달성한다. 또한 관계별 결정 임계값을 필요로 하지 않고도 삼중항 분류 작업에서 최고 성능을 내며, 보다 신뢰할 수 있는 확률 추정을 가능하게 한다.

ABSTRACT

Knowledge graph embedding research has overlooked the problem of probability calibration. We show popular embedding models are indeed uncalibrated. That means probability estimates associated to predicted triples are unreliable. We present a novel method to calibrate a model when ground truth negatives are not available, which is the usual case in knowledge graphs. We propose to use Platt scaling and isotonic regression alongside our method. Experiments on three datasets with ground truth negatives show our contribution leads to well-calibrated models when compared to the gold standard of using negatives. We get significantly better results than the uncalibrated models from all calibration methods. We show isotonic regression offers the best the performance overall, not without trade-offs. We also show that calibrated models reach state-of-the-art accuracy without the need to define relation-specific decision thresholds.

연구 동기 및 목표

  • 예측 확률이 진정된 신뢰도를 반영하지 못하는 지식 그래프 임베딩 모델에서의 확률 교정 문제를 다루는 것.
  • 지식 그래프의 개방 세계 가정 하에 일반적인 상황인 실제 부정 예측이 부재할 경우에도 효과적으로 작동하는 교정 방법을 개발하는 것.
  • 관계별 결정 임계값에 의존하지 않고도 후행 작업, 예를 들어 삼중항 분류에 대해 신뢰할 수 있는 확률 예측을 가능하게 하는 것.
  • 실제 지식 그래프 데이터셋에서 실제 부정 예측이 있는지 여부에 따라 플랫팅 스케일링과 이소토닉 회귀의 교정 기법 성능을 평가하는 것.
  • 교정된 모델이 추가 모델 튜닝 없이도 최고 성능을 내며, 신뢰할 수 있고 해석 가능한 확률 추정을 유지하는지 보여주는 것.

제안 방법

  • 원시 로짓을 잘 校정된 확률로 변환하기 위해 플랫팅 스케일링과 이소토닉 회귀를 사용하여 모델 출력을 교정하는 것.
  • 실제 부정 예측이 제공되지 않을 경우를 대비해 검증 세트의 양성 기반 비율을 활용해 합성 부정 샘플을 생성하는 히우리스틱을 도입하는 것.
  • 검증 세트의 절반을 사용해 모델을 교정하고, 진짜 부정 예측을 합성 부정 예측으로 대체하여 교정 성능 유지를 위한 것.
  • 교정 과정에서 폐쇄 세계 가정을 적용하여 평가 시에 알려지지 않은 삼중항을 부정으로 간주하는 것.
  • 교정 후 삼중항 분류에 대해 단일 임계값 τ = 0.5를 사용하여 관계별 임계값이 필요 없도록 하는 것.
  • 신뢰도 다이어그램과 기대 교정 오차(ECE)를 사용해 교정 성능을 평가하며, 교정되지 않은 기준 모델 및 진짜 부정 예측이 있는 골드 표준 교정 모델과 비교하는 것.

실험 결과

연구 질문

  • RQ1실제 지식 그래프에서 흔히 발생하는 실제 부정 예측이 제공되지 않는 상황에서 지식 그래프 임베딩 모델을 효과적으로 교정할 수 있는가?
  • RQ2합성 부정 예측을 사용할 경우 플랫팅 스케일링과 이소토닉 회귀는 지식 그래프 임베딩 모델의 교정 성능에서 어떻게 상호 비교되는가?
  • RQ3교정을 통해 모든 관계에 대해 단일 통합 결정 임계값(τ = 0.5)을 사용할 수 있는가? 이는 관계별 임계값이 필요 없음을 의미한다.
  • RQ4기대 교정 오차와 신뢰도 다이어그램로 측정했을 때, 교정은 확률 추정의 신뢰성에 얼마나 기여하는가?
  • RQ5교정된 모델은 추가 모델 튜닝이나 관계별 임계값 학습 없이도 삼중항 분류에서 최고 성능을 달성할 수 있는가?

주요 결과

  • 이소토닉 회귀는 모든 데이터셋에서 가장 뛰어난 교정 성능을 보이며, 기대 교정 오차 측면에서 플랫팅 스케일링 및 교정되지 않은 모델을 크게 앞서간다.
  • 검증 세트의 절반만 사용하고 진짜 부정 예측 대신 합성 부정 예측을 사용하더라도, 제안된 방법은 잘 교정된 확률 추정을 달성한다.
  • 교정된 모델은 단일 임계값 τ = 0.5를 사용해 WN11에서 최고 성능(F1: 88.9)을 달성하며, 관계별 임계값을 사용하는 모델와 동등하거나 이를 초월한다.
  • 교정되지 않은 모델은 τ = 0.5에서 성능이 열악하여, 신뢰할 수 있는 임계값 설정을 위해 교정의 필요성을 강조한다.
  • 이 방법은 세 가지 데이터셋(WN11, FB13, YAGO39K)에서 평가된 네 가지 모델(TransE, DistMult, ComplEx, HolE) 전반에 걸쳐 교정되지 않은 모델보다 교정 성능을 크게 향상시킨다.
  • 신뢰도 다이어그램은 교정되지 않은 모델이 체계적으로 교정되지 않은 것으로 나타났다—TransE는 과소 예측을 보였고, ComplEx는 손실 함수에 따라 과소 또는 과도 예측을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.