Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Embedding Representations for Knowledge Inference on Imperfect and Incomplete Repositories

Miao Fan, Qiang Zhou|arXiv (Cornell University)|2015. 03. 27.
Topic Modeling참고 문헌 17인용 수 3
한 줄 요약

이 논문은 Freebase와 NELL과 같은 불완전하고 완전하지 않은 지식 기반에서 실체와 관계의 저차원 벡터 표현을 학습하는 확률적 지식 임bedding 모델 IIKE를 제안한다. 기계 학습(NELL)에서의 신뢰도 손실과 커뮤니티 기반(_Freebase_)에서의 신뢰도 손실을 최소화함으로써, IIKE는 링크 예측과 삼중체 분류 성능을 향상시키며, FB15K와 NELL에서 각각 91.1%와 91.4%의 정확도로 최신 기술 수준(SOTA)을 달성한다.

ABSTRACT

This paper considers the problem of knowledge inference on large-scale imperfect repositories with incomplete coverage by means of embedding entities and relations at the first attempt. We propose IIKE (Imperfect and Incomplete Knowledge Embedding), a probabilistic model which measures the probability of each belief, i.e. $\langle h,r,t angle$, in large-scale knowledge bases such as NELL and Freebase, and our objective is to learn a better low-dimensional vector representation for each entity ($h$ and $t$) and relation ($r$) in the process of minimizing the loss of fitting the corresponding confidence given by machine learning (NELL) or crowdsouring (Freebase), so that we can use $||{\bf h} + {\bf r} - {\bf t}||$ to assess the plausibility of a belief when conducting inference. We use subsets of those inexact knowledge bases to train our model and test the performances of link prediction and triplet classification on ground truth beliefs, respectively. The results of extensive experiments show that IIKE achieves significant improvement compared with the baseline and state-of-the-art approaches.

연구 동기 및 목표

  • Freebase와 NELL과 같은 대규모이자 불완전하고 완전하지 않은 지식 저장소에서 지식 추론의 과제를 해결한다.
  • 기존 방법이 완전한 기저 진리 데이터에 의존하거나 외부 텍스트 자료가 필요로 하는 한계를 극복한다.
  • 관계별 규칙을 필요로 하지 않고 전역 연결 패턴을 학습하는 통합된 확률적 임베딩 모델을 개발한다.
  • 벡터 유사도를 통해 믿음의 타당성을 모델링하여, 불완전한 지식 기반에서 효과적인 추론을 가능하게 한다.
  • 기저 진리 데이터가 아닌 부정확하고 불완전한 훈련 데이터만을 사용하여 링크 예측 및 삼중체 분류 성능을 향상시킨다.

제안 방법

  • 실체와 관계의 임베딩을 기반으로 한 점수 함수를 사용하여 삼중체 ⟨h, r, t⟩의 타당성을 추정하는 확률적 모델 IIKE를 제안한다.
  • NELL(기계 학습)에서의 실제 신뢰도 또는 Freebase(커뮤니티 기반)에서의 실제 신뢰도와 예측된 신뢰도 간의 격차를 최소화하는 손실 함수를 사용한다.
  • 스토하스틱 그래디언트 하강(SGD) 동안 가짜 삼중체를 샘플링하여 모델을 효율적으로 훈련시킨다.
  • ||h + r - t||가 타당성을 측정하도록 실체(h, t)와 관계(r)에 대해 저차원 벡터 표현을 학습한다.
  • 하이퍼파ram터 d(임베딩 차원), α(학습률), b(마진), norm(L1 또는 L2)를 사용하여 SGD로 임베딩을 최적화한다.
  • 삼중체 분류에서 양성 또는 부정성으로 삼중체를 분류하기 위해 관계별 임계값 σr을 사용하며, 검증 세트 최적화를 통해 학습한다.

실험 결과

연구 질문

  • RQ1기저 진리 훈련 데이터에 의존하지 않고도, 불완전하고 완전하지 않은 지식 기반에서 확률적 임베딩 모델이 효과적으로 학습할 수 있는가?
  • RQ2NELL과 Freebase의 부정확한 믿음에서 훈련된 IIKE가 링크 예측 및 삼중체 분류에서 얼마나 잘 성능을 내는가?
  • RQ3NELL과 Freebase에서의 신뢰도 점수를 학습 신호로 사용하면, 기저 진리 데이터로 훈련된 모델보다 더 나은 일반화 성능을 달성할 수 있는가?
  • RQ4관계별 규칙 유도 없이도 통합된 임베딩 공간에서 전역 연결 패턴을 효과적으로 포착할 수 있는가?
  • RQ5정확도 및 식별 능력 측면에서 TransE, TransH, NTN과 같은 최신 기술 수준의 모델과 비교해 IIKE는 어떻게 성능을 내는가?

주요 결과

  • IIKE는 FB15K 삼중체 분류 벤치마크에서 91.1%의 정확도를 달성하여 TransH(80.2%), TransE(79.7%), NTN(66.7%)를 크게 앞서며 성능을 뛰어넘었다.
  • NELL 데이터셋에서는 IIKE가 91.4%의 정확도를 기록하여 TransH(89.1%)와 TransE(82.4%)를 초월했다.
  • IIKE의 정밀도-재현율 곡선은 AUC가 TransH와 TransE보다 더 크며, 더 뛰어난 전역 식별 능력을 나타낸다.
  • IIKE는 링크 예측 작업에서 강력한 일반화 능력을 보이며, FB15K와 NELL 양쪽에서 베이스라인 및 최신 기술 수준 방법보다 성능 향상을 보였다.
  • NELL과 Freebase에서의 신뢰도 점수를 감독 신호로 사용함으로써, 불완전하고 노이즈가 많은 지식 기반에서도 효과적인 학습이 가능했다.
  • 두 가지 서로 다른 특성을 가진 지식 기반에서의 검증을 통해 모델의 강건성과 확장성(스케일러빌리티)이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.