Skip to main content
QUICK REVIEW

[論文レビュー] DualDE: Dually Distilling Knowledge Graph Embedding for Faster and Cheaper Reasoning

Yushan Zhu, Wen Zhang|arXiv (Cornell University)|Sep 13, 2020
Advanced Graph Neural Networks被引用数 8
ひとこと要約

DualDEは、高速で安価な推論を実現するため、高次元の知識グラフ埋め込み(KGE)を低次元の学生モデルに圧縮する知識蒸留手法を提案する。柔ららかなラベル評価メカニズムを用いて教師が提供するスコアの重みを動的に調整し、2段階の蒸留プロセスを採用することで学生の学習を強化する。ベンチマークデータセット上で、パラメータ数を7×–15×に削減し、推論速度を2×–6×に向上させながら、性能の低下を最小限に抑える。

ABSTRACT

Knowledge Graph Embedding (KGE) is a popular method for KG reasoning and training KGEs with higher dimension are usually preferred since they have better reasoning capability. However, high-dimensional KGEs pose huge challenges to storage and computing resources and are not suitable for resource-limited or time-constrained applications, for which faster and cheaper reasoning is necessary. To address this problem, we propose DualDE, a knowledge distillation method to build low-dimensional student KGE from pre-trained high-dimensional teacher KGE. DualDE considers the dual-influence between the teacher and the student. In DualDE, we propose a soft label evaluation mechanism to adaptively assign different soft label and hard label weights to different triples, and a two-stage distillation approach to improve the student's acceptance of the teacher. Our DualDE is general enough to be applied to various KGEs. Experimental results show that our method can successfully reduce the embedding parameters of a high-dimensional KGE by 7 times - 15 times and increase the inference speed by 2 times - 6 times while retaining a high performance. We also experimentally prove the effectiveness of our soft label evaluation mechanism and two-stage distillation approach via ablation study.

研究の動機と目的

  • リソース制約のある環境における高次元KGEの高い保存領域と計算コストを軽減すること。
  • 推論性能を損なわず、高速で低コストの推論を可能にすること。
  • 高次元教師KGEから低次元学生KGEへと知識を転送できる汎用的な蒸留手法の開発。
  • 教師が提供する柔らかなラベルの品質を考慮することで、学生モデルの性能を向上させること。
  • 2段階の蒸留プロセスを通じて、教師と学生の相互適応を可能にすること。

提案手法

  • 各トリプルの教師モデル予測の信頼性を評価する柔らかなラベル評価メカニズムを導入し、柔らかなラベルとハードラベルに適応的な重みを付与する。
  • 2段階の蒸留アプローチを採用:まず、柔らかなラベルとハードラベルを用いて学生を訓練する。次に、教師と学生を同時に最適化することで相互適応を実現する。
  • 教師の出力スコアを柔らかなラベルとして用い、信頼性に基づいた重み付けされた監督により、予測が不正確なトリプルからのノイズを低減する。
  • 温度スケーリングを用いた知識蒸留により、学生の一般化性能と知識転送効果を向上させる。
  • モデルアーキテクチャに依存しないため、さまざまなKGE(例:TransE, ComplEx, RotatE)に適用可能で、汎用性がある。
  • ラベル品質に基づく動的重み付けを施した、柔らかなラベルと正解ラベルの両方の交差エントロピー損失を組み合わせた蒸留損失を用いる。

実験結果

リサーチクエスチョン

  • RQ1知識蒸留は、推論性能を維持したまま、高次元KGEを低次元モデルに効果的に圧縮できるか?
  • RQ2信頼性の低い予測から生じる悪影響を避けるために、教師が提供する柔らかなラベルの品質をどのように評価できるか?
  • RQ3初期の学生訓練の後、教師と学生を同時に最適化する2段階の蒸留プロセスは、単一段階の蒸留に比べて学生の性能を向上させるか?
  • RQ4柔らかなラベルの適応的重み付けは、予測が難しいトリプルの性能向上にどの程度寄与するか?
  • RQ5提案手法は、多様なKGEアーキテクチャにわたり、顕著な高速化とパラメータ削減を達成できるか?

主な発見

  • DualDEは、WN18RRなどのベンチマークデータセットで、KGE埋め込みのパラメータ数を7×から15×に削減しながらも、高い推論性能を維持した。
  • 推論速度が2×から6×に向上し、リアルタイムまたはエッジデプロイメントに適した性能を達成した。
  • 柔らかなラベル評価メカニズムにより、64次元の学生モデルではMRRが平均3.7%、Hit@10が2.8%向上し、32次元の学生モデルではそれぞれ7.9%と5.4%向上した。
  • 最初の段階(S1)を除外すると、32次元のSimplEではMRRが最大21.4%低下し、安定した学習における重要性が示された。
  • 2番目の段階の共同最適化(S2)により、64D学生ではMRRが平均2.4%、32D学生では3.8%向上し、相互適応の有効性が確認された。
  • アブレーションスタディにより、柔らかなラベル評価と2段階の蒸留の両方が最適性能を達成するために不可欠であることが確認され、精度と耐障害性の両面で顕著な向上が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。