Skip to main content
QUICK REVIEW

[논문 리뷰] Soft Marginal TransE for Scholarly Knowledge Graph Completion

Mojtaba Nayyeri, Sahar Vahdati|arXiv (Cornell University)|2019. 04. 27.
Advanced Graph Neural Networks참고 문헌 18인용 수 9
한 줄 요약

이 논문은 학술 지식 그래프 완성에 특화된 TransE 지식 그래프 임베딩 모델의 소프트 마진 변종인 TransESM을 제안한다. 경직된 마진 순위 손실 대신 미분 가능한 소프트 마진 손실을 도입함으로써, 노이즈가 있는 부정 샘플에 대한 견고성을 향상시켜 학술 지식 그래프에서 Hit@10이 99.9%에 도달하였으며, 원본 TransE(95%) 및 ComplEx, TransH, TransR와 같은 다른 기준 모델들을 크게 능가하였다.

ABSTRACT

Knowledge graphs (KGs), i.e. representation of information as a semantic graph, provide a significant test bed for many tasks including question answering, recommendation, and link prediction. Various amount of scholarly metadata have been made vailable as knowledge graphs from the diversity of data providers and agents. However, these high-quantities of data remain far from quality criteria in terms of completeness while growing at a rapid pace. Most of the attempts in completing such KGs are following traditional data digitization, harvesting and collaborative curation approaches. Whereas, advanced AI-related approaches such as embedding models - specifically designed for such tasks - are usually evaluated for standard benchmarks such as Freebase and Wordnet. The tailored nature of such datasets prevents those approaches to shed the lights on more accurate discoveries. Application of such models on domain-specific KGs takes advantage of enriched meta-data and provides accurate results where the underlying domain can enormously benefit. In this work, the TransE embedding model is reconciled for a specific link prediction task on scholarly metadata. The results show a significant shift in the accuracy and performance evaluation of the model on a dataset with scholarly metadata. The newly proposed version of TransE obtains 99.9% for link prediction task while original TransE gets 95%. In terms of accuracy and Hit@10, TransE outperforms other embedding models such as ComplEx, TransH and TransR experimented over scholarly knowledge graphs

연구 동기 및 목표

  • 학술 지식 그래프(SKG)의 불완전성 문제를 해결하기 위해 지식 그래프 임베딩(KGE) 모델을 활용한 링크 예측 정확도 향상을 목표로 한다.
  • 실제 학술 지식 그래프에서 잘못된 음성 샘플에 민감한 경직된 마진 순위 기반의 TransE의 한계를 극복하고자 한다.
  • 학습 중 마진 제약 조건을 점진적으로 완화할 수 있도록 허용하는 새로운 손실 함수인 소프트 마진을 개발하고 평가하고자 한다.
  • 공저자 추천을 위한 실제 학술 지식 그래프에서 제안된 TransESM 모델의 효과성을 입증하고자 한다.
  • 도메인 특화의 이질적인 학술 메타데이터에 적합한 더 견고하고 정확한 KGE 접근 방식을 제공하고자 한다.

제안 방법

  • 거짓 음성 샘플이 마진에 부분적으로 포함될 수 있도록 슬랙 변수 ξhr를 사용해 하드 마진을 소프트 경계로 대체하는 TransE의 수정된 손실 함수를 제안한다.
  • 정규화와 허프 손실을 포함한 복합 목표 함수로 최적화 문제를 재정의한다: min ∑(λ₀ξ² + λ₁max(fr(h,t)−γ₁,0) + λ₂max(γ₂−fr(h′,t′)−ξhr,0)).
  • 하이퍼파라미터를 검증 세트에서 튜닝한 AdaGrad를 사용하여 최적화를 수행하며, 임베딩 차원 d ∈ {50,100,200}, γ₁ ∈ {0.1,…,2}, γ₂ ∈ {0.2,…,2.1}, λ₀ ∈ {0.01,0.1,1,10,100}를 포함한다.
  • PyKEEN에 의존하지 않고 TransE와 TransESM을 다시 구현함으로써 훈련 및 손실 계산에 대한 완전한 제어를 확보한다.
  • 평가 지표로 필터링된 평균 순위와 필터링된 Hit@10을 사용하며, 테스트 트리플의 헤드 또는 테일 엔티티를 교체하여 부정 샘플을 생성한다.
  • 9명의 연구자에 대해 상위 50개 예측된 공저자에 대한 공저 이력과 연구 프로필을 수동으로 점검하여 추천 결과를 검증한다.

실험 결과

연구 질문

  • RQ1표준 TransE에 비해 학술 지식 그래프에서 불완전한 데이터를 다룰 때 소프트 마진 변종의 TransE가 링크 예측 성능을 향상시킬 수 있는가?
  • RQ2제안된 소프트 마진 손실이 실제 학술 지식 그래프에서 잘못된 음성 샘플의 부정적 영향을 어떻게 완화하는가?
  • RQ3ComplEx, TransH, TransR와 같은 기존 KGE 모델에 비해 TransESM은 학술 링크 예측 작업에서 어느 정도 뛰어난 성능을 보이는가?
  • RQ4모델은 실제 연구 협업 패턴과 일치하는 고품질의 공저자 추천을 생성할 수 있는가?
  • RQ5손실 함수에 미분 가능한 슬랙 변수를 사용함으로써 도메인 특화 지식 그래프에서 더 견고하고 정확한 임베딩을 얻을 수 있는가?

주요 결과

  • TransESM은 학술 지식 그래프에서 필터링된 Hit@10이 99.9%에 도달하여 원본 TransE의 95%보다 뚜렷한 향상을 보였다.
  • 모델은 필터링된 평균 순위를 1.67로 낮추었으며, TransE(2.17), TransH(985.16), TransR(1200.35), ComplEx(56.2% 필터링된 Hit@10)를 모두 능가하였다.
  • TransESM은 이전 최고 성능 모델인 TransE-RS보다 평균 순위(1.67 vs. 3.03)와 Hit@10(99.9% vs. 95.6%)에서 모두 뛰어난 성능을 보였다.
  • 공저자 추천 과정에서 9명의 연구자에 대해 상위 50개 예측의 89%가 프로필 및 논문 이력 기반으로 타당한 협업으로 확인되었다.
  • 소프트 마진 손실은 잘못된 음성 샘플에 대한 민감도를 효과적으로 감소시켜 노이즈가 많은 실세계 학술 데이터에서 모델의 견고성과 일반화 능력을 향상시켰다.
  • 하이퍼파라미터 튜닝 결과, λ₁=1 및 λ₂=1이 최적의 성능을 내며, 다양한 임베딩 차원과 마진 범위에서도 모델이 안정적인 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.