Skip to main content
QUICK REVIEW

[논문 리뷰] DualDE: Dually Distilling Knowledge Graph Embedding for Faster and Cheaper Reasoning

Yushan Zhu, Wen Zhang|arXiv (Cornell University)|2020. 09. 13.
Advanced Graph Neural Networks인용 수 8
한 줄 요약

DualDE는 고차원 지식 그래프 임bedding(KGE)를 저차원 학생 모델로 압축하기 위해 지식 정착 기법을 제안한다. 이는 더 빠르고 저비용으로 추론할 수 있도록 한다. 소프트 레이블 평가 메커니즘을 사용해 교사 모델이 제공한 점수를 적응적으로 가중치를 부여하고, 학생 학습을 향상시키기 위해 이중 단계 정착 과정을 적용한다. 이를 통해 벤치마크 데이터셋에서 성능 손실가장 최소화하면서도 파라미터 수를 7배에서 15배 감소시키고, 추론 속도를 2배에서 6배 향상시킨다.

ABSTRACT

Knowledge Graph Embedding (KGE) is a popular method for KG reasoning and training KGEs with higher dimension are usually preferred since they have better reasoning capability. However, high-dimensional KGEs pose huge challenges to storage and computing resources and are not suitable for resource-limited or time-constrained applications, for which faster and cheaper reasoning is necessary. To address this problem, we propose DualDE, a knowledge distillation method to build low-dimensional student KGE from pre-trained high-dimensional teacher KGE. DualDE considers the dual-influence between the teacher and the student. In DualDE, we propose a soft label evaluation mechanism to adaptively assign different soft label and hard label weights to different triples, and a two-stage distillation approach to improve the student's acceptance of the teacher. Our DualDE is general enough to be applied to various KGEs. Experimental results show that our method can successfully reduce the embedding parameters of a high-dimensional KGE by 7 times - 15 times and increase the inference speed by 2 times - 6 times while retaining a high performance. We also experimentally prove the effectiveness of our soft label evaluation mechanism and two-stage distillation approach via ablation study.

연구 동기 및 목표

  • 자원 제약 환경에서 고차원 KGE의 높은 저장 및 계산 비용을 해결하기 위해.
  • 추론 성능을 희생시키지 않고도 빠르고 저비용의 추론을 가능하게 하기 위해.
  • 고차원 교사 KGE에서 저차원 학생 KGE로 지식을 전달할 수 있는 일반화 가능한 정착 방법을 개발하기 위해.
  • 교사가 제공한 소프트 레이블의 품질을 고려해 학생 모델 성능을 향상시키기 위해.
  • 이중 단계 정착 과정을 통해 교사와 학생 간 상호 적응을 가능하게 하기 위해.

제안 방법

  • 각 트리플에 대해 교사 모델 예측의 신뢰도를 평가하고 소프트 레이블과 하드 레이블에 대해 적응적인 가중치를 할당하는 소프트 레이블 평가 메커니즘을 도입한다.
  • 이중 단계 정착 방식을 적용한다: 첫 번째 단계에서는 소프트 레이블과 하드 레이블을 사용해 학생을 훈련시고, 두 번째 단계에서는 교사와 학생을 함께 최적화하여 상호 적응을 가능하게 한다.
  • 교사의 출력 점수를 소프트 레이블로 사용하고, 신뢰도 기반 가중치를 적용해 예측이 불량한 트리플에서 발생하는 노이즈를 줄인다.
  • 온도 스케일링을 사용한 지식 정착을 적용해 학생의 일반화 능력과 지식 전달 능력을 향상시킨다.
  • 모델 아키텍처에 관계없이 다양한 KGE(예: TransE, ComplEx, RotatE)에 적용 가능하게 하여 일반성과 유연성을 확보한다.
  • 소프트 레이블과 진정 레이블에 대한 교차 엔트로피 손실을 결합하고, 레이블 품질에 따라 동적 가중치를 적용한다.

실험 결과

연구 질문

  • RQ1지식 정착 기법이 고차원 KGE를 저차원 모델로 효과적으로 압축하면서도 추론 성능을 유지할 수 있는가?
  • RQ2신뢰할 수 없는 예측에서 유래한 부정적 지식 전달을 방지하기 위해 교사가 제공한 소프트 레이블의 품질을 어떻게 평가할 수 있는가?
  • RQ3초기 학생 훈련 후 공동 최적화를 수행하는 이중 단계 정착 과정이 단일 단계 정착보다 학생 성능을 향상시키는가?
  • RQ4적응형 소프트 레이블 가중치가 예측이 어려운 트리플에서 성능 향상에 얼마나 기여하는가?
  • RQ5제안된 방법이 다양한 KGE 아키텍처에서 뚜렷한 속도 향상과 파라미터 감소를 달성할 수 있는가?

주요 결과

  • DualDE는 WN18RR와 같은 벤치마크 데이터셋에서 KGE 임베딩 파라미터를 7배에서 15배 감소시키면서도 높은 추론 성능를 유지한다.
  • 이 방법은 추론 속도를 2배에서 6배 향상시켜 실시간 또는 엣지 환경에 적합하게 한다.
  • 소프트 레이블 평가 메커니즘이 64차원 학생 모델에서 MRR 평균 3.7% 향상, Hit@10에서 2.8% 향상되었고, 32차원 학생 모델에서는 각각 7.9%와 5.4% 향상되었다.
  • 첫 번째 정착 단계(S1)를 제거하면 32차원 SimplE에서 MRR가 최대 21.4% 감소하여 이 단계가 안정적인 훈련에 핵심적인 역할을 한다는 것을 보여준다.
  • 두 번째 단계 공동 최적화(S2)는 64D 학생 모델에서 평균 MRR 2.4% 향상, 32D 학생 모델에서는 3.8% 향상되었으며, 상호 적응의 효과성을 확인한다.
  • 제거 실험 결과, 소프트 레이블 평가와 이중 단계 정착 모두 최적 성능 달성에 필수적임을 확인하였으며, 정확도와 강인성 향상에 뚜렷한 기여를 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.