Skip to main content
QUICK REVIEW

[論文レビュー] Distilling Knowledge from Graph Convolutional Networks

Yiding Yang, Jiayan Qiu|arXiv (Cornell University)|Mar 23, 2020
Advanced Neural Network Applications参考文献 48被引用数 21
ひとこと要約

本稿では、グラフ畳み込みネットワーク(GCN)のための最初の専用の知識蒸留手法を提案し、局所的ノード構造の分布を一致させることで、教師GCNから学生モデルへのトポロジカルな意味を保持するためのローカル構造保存(LSP)モジュールを導入する。この手法は、複数のGCNアーキテクチャおよびデータセットにおいて最先端の性能を達成しており、教師モデルのパラメータの1/18しか使用しない学生モデルでModelNet40で91.9%の精度を達成している。

ABSTRACT

Existing knowledge distillation methods focus on convolutional neural networks (CNNs), where the input samples like images lie in a grid domain, and have largely overlooked graph convolutional networks (GCN) that handle non-grid data. In this paper, we propose to our best knowledge the first dedicated approach to distilling knowledge from a pre-trained GCN model. To enable the knowledge transfer from the teacher GCN to the student, we propose a local structure preserving module that explicitly accounts for the topological semantics of the teacher. In this module, the local structure information from both the teacher and the student are extracted as distributions, and hence minimizing the distance between these distributions enables topology-aware knowledge transfer from the teacher, yielding a compact yet high-performance student model. Moreover, the proposed approach is readily extendable to dynamic graph models, where the input graphs for the teacher and the student may differ. We evaluate the proposed method on two different datasets using GCN models of different architectures, and demonstrate that our method achieves the state-of-the-art knowledge distillation performance for GCN models. Code is publicly available at https://github.com/ihollywhy/DistillGCN.PyTorch.

研究の動機と目的

  • グリッドでないデータ(点群や分子構造など)における非定型データ処理に急速に広がるGCNの分野において、知識蒸留が未だ十分に検討されていないというギャップに対処すること。
  • 事前に学習された教師GCNから、より小型で効率的な学生GCNに、入力グラフのトポロジカル構造を保持したまま効果的な知識転送を可能にすること。
  • 標準的な出力や活性化の蒸留を超えて、GCN表現に埋め込まれたトポロジカルな意味を明示的に考慮する手法の設計。
  • 教師と学生の間でグラフ構造が異なる動的グラフモデルに対してもこのアプローチを拡張すること。
  • ノード分類および3次元物体認識の分野で、さまざまなGCNアーキテクチャと実世界のデータセットに対して一般化を示すこと。

提案手法

  • ローカル構造保存(LSP)モジュールは、特徴空間における各ノードとその近隣ノードの類似度の分布を計算し、グラフの局所的構造を表現する。
  • LSPモジュールは、カーネルベースの発散測度(例:RBFカーネル)を用いて、教師GCNと学生GCNの局所的構造分布の距離を最小化することで、トポロジーに配慮した知識転送を実現する。
  • この手法は、教師と学生のグラフ構造が異なる場合でも、学生モデルが教師と同様の局所的構造的組織を学習するよう促す蒸留損失として定式化される。
  • このアプローチは、事前に固定されていない、推論または学習中に構築される動的グラフモデルとも互換性がある。
  • LSP損失は、学習中に標準的な交差エントロピー損失と組み合わせられ、学生モデルのエンドツーエンド最適化を可能にする。
  • この手法はPyTorchで実装され、公開されており、さまざまなGCNアーキテクチャとハイパーパramータ設定をサポートしている。

実験結果

リサーチクエスチョン

  • RQ1非グリッドでトポロジカルに構造化されたデータを処理するグラフ畳み込みネットワーク(GCN)に対して、知識蒸留を効果的に適用できるか?
  • RQ2ノード予測や中間活性化を超えて、教師GCNから学生モデルに、トポロジカルな意味をどのように蒸留できるか?
  • RQ3特に層数、チャネル数、グラフの複雑さの観点から、教師モデルと比べて著しく小さいが、性能は同程度の学生GCNは達成可能か?
  • RQ4教師と学生の間で局所的構造の分布を保存することで、さまざまなGCNアーキテクチャおよびデータセットにおいて、より良い一般化性と耐性が得られるか?
  • RQ5入力グラフ構造が教師と学生で異なる動的グラフモデルに対しても、この蒸留手法を拡張可能か?

主な発見

  • ModelNet40 3次元物体認識データセットにおいて、本手法は、教師モデルの1.81Mパラメータに対して、学生モデルがたった0.1Mパラメータで91.9%のテスト精度を達成した。
  • LSPモジュールを用いて訓練された学生モデルは、KD、AT、FitNetを含むすべてのベースラインを上回り、平均クラス精度88.6%を達成した。KDは88.1%、ATは87.9%であった。
  • RBFカーネル関数は、全テストカーネル関数の中で最も優れた性能を示し、ModelNet40で91.9%の精度と88.6%の平均クラス精度を達成した。
  • 教師モデルのパラメータ数の1/18しか持たない学生モデルでも、LSP手法は同等の性能を達成しており、優れたパラメータ効率性を示している。
  • アブレーションスタディの結果、学生モデルのモデル容量(例えば、チャネル数や層数の増加)を高めると、精度が向上した(チャネル数を増やすことで最大92.3%に達した)。これは、本手法のスケーラビリティと有効性を確認している。
  • 可視化結果から、LSPで訓練された学生モデルは、特に初期学習段階で教師モデルと同様の特徴空間の構造を素早く学習していることが確認され、効果的なトポロジカル知識転送が行われていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。