Skip to main content
QUICK REVIEW

[논문 리뷰] A Re-evaluation of Knowledge Graph Completion Methods

Zhiqing Sun, Shikhar Vashishth|arXiv (Cornell University)|2019. 11. 10.
Advanced Graph Neural Networks참고 문헌 30인용 수 6
한 줄 요약

이 논문은 최근 신경망 기반 지식 그래프 완성(KGC) 방법들이 편향된 점수 함수를 가진 모델에게 유리하게 작용하는 결함이 있는 평가 프로토콜로 인해 과대평가된 성능을 보고하고 있음을 밝혀낸다. 저자들은 동점인 점수를 무작위로 처리하는 공정하고 일관되며 현실적인 성능 비교를 보장하는 강력한 'Random' 평가 프로토콜을 제안하며, 이 프로토콜 하에서 이전에 보고된 일부 모델의 높은 성능 향상이 사라짐을 입증한다.

ABSTRACT

Knowledge Graph Completion (KGC) aims at automatically predicting missing links for large-scale knowledge graphs. A vast number of state-of-the-art KGC techniques have got published at top conferences in several research fields, including data mining, machine learning, and natural language processing. However, we notice that several recent papers report very high performance, which largely outperforms previous state-of-the-art methods. In this paper, we find that this can be attributed to the inappropriate evaluation protocol used by them and propose a simple evaluation protocol to address this problem. The proposed protocol is robust to handle bias in the model, which can substantially affect the final results. We conduct extensive experiments and report the performance of several existing methods using our protocol. The reproducible code has been made publicly available

연구 동기 및 목표

  • 최근 신경망 기반 KGC 방법들이 벤치마크 데이터셋에서 비정상적으로 높은 성능 향상을 보이는 이유를 조사하기 위해.
  • 이러한 성능 향상의 근본 원인이 편향된 점수 함수를 가진 모델에게 유리하게 작용하는 결함이 있는 평가 프로토콜에 있음을 규명하기 위해.
  • 점수 함수의 복잡성이나 편향에 관계없이 모델를 공정하게 비교할 수 있는 새로운 강력한 평가 프로토콜을 제안하기 위해.
  • 제안된 프로토콜을 사용해 최신 KGC 방법들을 재평가하여 이전 결과에서 과대평가된 성능을 드러내기 위해.
  • Random 평가 프로토콜을 KGC 벤치마킹의 새로운 표준으로 채택할 것을 촉진하기 위해.

제안 방법

  • 동점인 점수를 무작위로 처리하는 'Random' 평가 프로토콜을 제안하여 공정성과 현실성을 확보하기 위해.
  • 'Top'과 'Bottom'이라는 두 가지 대안 프로토콜을 도입하여 기존 평가 방법의 편향을 입증하기 위해.
  • 실제 세계 상황에서 동점 예측이 무작위로 처리됨을 반영하므로, 'Random' 프로토콜을 황금 표준으로 삼기 위해.
  • FB15k-237와 WN18RR에서 제안된 프로토콜을 사용해 6개의 최근 KGC 방법(ConvKB, CapsE, KBAT, TransGate, RotatE, TuckER, ConvE)을 재평가하기 위해.
  • KBAT의 원본 구현에서 데이터 泄漏 문제를 수정하여 유효한 비교를 보장하기 위해.
  • 모델당 5회의 랜덤 시드 실행을 수행해 안정성을 평가하고, 안정성을 확보하기 위해 평균 ± 표준편차를 보고하기 위해.

실험 결과

연구 질문

  • RQ1왜 최근에 제안된 신경망 기반 KGC 방법들이 이전 최고 성능 방법들보다 크게 높은 성능을 보여왔는가?
  • RQ2보고된 성능 향상의 정도가 모델 개선이 아닌 평가 프로토콜의 결함 때문인가?
  • RQ3다른 평가 프로토콜(Top, Bottom, Random)은 KGC 모델의 성능 순위에 어떤 영향을 미치는가?
  • RQ4점수 함수 편향에 강건하고 공정한 새로운 평가 프로토콜을 설계할 수 있는가?
  • RQ5CapsE나 KBAT와 같은 모델들이 이전에 보고된 높은 성능 향상이 공정한 평가 프로토콜 하에서도 유지되는가?

주요 결과

  • 'Top' 평가 프로토콜은 편향된 점수 함수를 가진 모델에게 성능을 과대평가하게 하여 불공정한 우위를 제공한다.
  • 'Bottom' 평가 프로토콜은 동점 점수를 가진 모델을 부당하게 저격하여 성능 추정을 지나치게 낙관적으로 만든다.
  • 제안된 Random 평가 프로토콜 하에서 CapsE의 FB15k-237 MRR는 0.523에서 0.421로 하락하여 이전 결과에서의 성능 과대평가가 뚜렷하게 드러난다.
  • KBAT는 Random 프로토콜 하에서 FB15k-237에서 0.518에서 0.401로 성능이 하락하며, 원본 구현에서의 데이터 泄漏로 인해 결과가 더욱 왜곡되었다.
  • 영향을 받지 않은 모델들인 ConvE, RotatE, TuckER는 모든 프로토콜에서 일관된 성능을 보이며 그들의 강건성을 확인한다.
  • Random 프로토콜은 여러 랜덤 시드에서 안정적이며, 낮은 분산(예: ±0.005 MRR)을 보이며, 벤치마킹에 있어 신뢰성 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.