Skip to main content
QUICK REVIEW

[논문 리뷰] A Unified Framework for Rank-based Evaluation Metrics for Link Prediction in Knowledge Graphs

Charles Tapley Hoyt, Max Berrendorf|arXiv (Cornell University)|2022. 03. 14.
Advanced Graph Neural Networks인용 수 8
한 줄 요약

이 논문은 지식 그래프 링크 예측에서 순위 기반 평가 지표를 위한 통합 이론적 프레임워크를 제안하며, 데이터셋 크기의 다양성에 걸쳐 해석 가능성과 비교 가능성을 향상시키기 위해 조정된 MRR(AMRR) 및 z-점수 기반 지표(ZMRR)와 같은 향상된 지표를 도입한다. 일반화된 평균과 확률적 조정을 활용하여 저자들은 기존의 MRR 지표가 데이터셋 크기에 의해 편향됨을 입증하며, 새로운 지표들이 모델과 지식 그래프 간에 더 정확하고 유의미한 성능 차이를 드러냄을 보여준다.

ABSTRACT

The link prediction task on knowledge graphs without explicit negative triples in the training data motivates the usage of rank-based metrics. Here, we review existing rank-based metrics and propose desiderata for improved metrics to address lack of interpretability and comparability of existing metrics to datasets of different sizes and properties. We introduce a simple theoretical framework for rank-based metrics upon which we investigate two avenues for improvements to existing metrics via alternative aggregation functions and concepts from probability theory. We finally propose several new rank-based metrics that are more easily interpreted and compared accompanied by a demonstration of their usage in a benchmarking of knowledge graph embedding models.

연구 동기 및 목표

  • 지식 그래프 링크 예측을 위한 기존 순위 기반 평가 지표의 해석 가능성과 비교 가능성 부족 문제를 해결하기 위해.
  • 순위 기반 지표에 대한 체계적인 분석과 향상을 가능하게 하는 이론적 기반을 마련하기 위해.
  • 데이터셋 크기와 무관하게 불변인 새로운 지표(예: AMRR, ZMRR, HMR)를 제안하여 모델 성능을 보다 신뢰할 수 있게 반영하기 위해.
  • 다양한 크기와 특성을 가진 데이터셋 간에 지식 그래프 임bedding 모델(KGEMs)을 공정하게 벤치마킹할 수 있도록 하기 위해.
  • PyKEEN에 새 지표의 오픈소스 구현을 제공하여 재현 가능한 평가를 가능하게 하기 위해.

제안 방법

  • 일반화된 거듭제곱 평균 기반의 이론적 프레임워크를 제안하여 순위 기반 평가 지표를 통합하고 분석한다.
  • 더 높은 강건성 확보를 위해 조화 평균 순위(HMR), 기하 평균 순위(GMR), 역수 평균 순위(IMR)와 같은 대체 집계 함수를 도입한다.
  • 극단적 값에 대한 민감도를 줄이고 해석 가능성을 향상시키기 위해 역수 및 기하 평균 변환을 적용한다.
  • 랜덤 순위 하에서 기대값과 분산을 활용하여 확률적 조정(예: AMRR, ZMRR)을 유도하여 다양한 데이터셋 간의 지표 정규화를 가능하게 한다.
  • z-점수 정규화를 활용하여 랜덤성 하에서 기대 성능에 기반해 표준화함으로써 서로 다른 지식 그래프 간의 지표 값 간 직접 비교를 가능하게 한다.
  • PyKEEN v1.8.0에 모든 새 지표를 구현하였으며, 가능한 한 폐쇄형 해를 통해 기대값과 분산을 계산한다.

실험 결과

연구 질문

  • RQ1어떻게 하면 지식 그래프 링크 예측을 위한 순위 기반 평가 지표를 다양한 크기의 데이터셋 간에 더 해석 가능하고 비교 가능하게 만들 수 있는가?
  • RQ2기존의 지표들인 MRR과 HK는 어떤 이론적 성질을 가지며, 데이터셋 크기 변화에 따라 어떻게 붕괴되는가?
  • RQ3조화 평균, 기하 평균, 역수 평균과 같은 대체 집계 함수가 더 강건하고 의미 있는 평가 점수를 생성할 수 있는가?
  • RQ4확률적 조정(예: z-점수, 조정된 평균)이 모델 비교의 공정성과 유의미성에 얼마나 기여하는가?
  • RQ5새로운 지표들이 기존의 MRR과 같은 전통적 지표가 가리키지 못하는 성능 차이를 얼마나 잘 드러내는가?

주요 결과

  • 기존의 MRR는 데이터셋 크기와 강한 반상관관계를 보이며, 이는 데이터셋 크기에 의해 편향되고 서로 다른 지식 그래프 간에 비교가 불가능하다는 것을 시사한다.
  • 조정된 MRR(AMRR)와 z-점수 기반 MRR(ZMRR) 지표는 크기 편향을 제거하여 다양한 데이터셋 간의 모델 성능 비교를 더 공정하게 한다.
  • Nations 데이터셋에서는 ComplEx가 MRR 기준으로 경쟁력이 있지만, AMRR와 ZMRR는 이들이 WN18-RR에 비해 뚜렷이 열등하다는 것을 드러낸다.
  • MRR 기준으로는 Nations에서 TuckER이 더 좋게 보이지만, AMRR와 ZMRR는 실제로 더 큰 WN18-RR 데이터셋에서 더 잘 성능을 내고 있음을 보여준다.
  • z-점수 기반 지표는 작은 데이터셋(Kinships, Nations)에서의 높은 MRR 점수가 큰 데이터셋(WN18-RR, FB15k-237)에서의 점수보다 통계적으로 유의미도가 낮다는 것을 드러낸다.
  • 새로운 지표들은 PyKEEN v1.8.0에 구현되어 있으며, 기대값과 분산에 대한 폐쇄형 해를 제공하여 효율적이고 표준화된 평가를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.