Skip to main content
QUICK REVIEW

[論文レビュー] Effective Stabilized Self-Training on Few-Labeled Graph Data

Ziang Zhou, Shi, Jieming|arXiv (Cornell University)|Oct 7, 2019
Advanced Graph Neural Networks参考文献 62被引用数 6
ひとこと要約

本稿では、高信頼度の偽ラベルを繰り返し追加し、低信頼度のものをフィルタリングすることで、極度のラベル不足下におけるグラフニューラルネットワーク(GNN)の性能を向上させる、Stabilized Self-Training(SST)というフレームワークを提案する。SSTは訓練の安定性と正確性を向上させ、Coraでは1クラスあたり1つのラベル付きノードでのテスト精度が62.5%に達し、GCNおよびDAGNNと比べてそれぞれ17.9%および6.6%高い。

ABSTRACT

Graph neural networks (GNNs) are designed for semi-supervised node classification on graphs where only a subset of nodes have class labels. However, under extreme cases when very few labels are available (e.g., 1 labeled node per class), GNNs suffer from severe performance degradation. Specifically, we observe that existing GNNs suffer from unstable training process on few-labeled graphs, resulting to inferior performance on node classification. Therefore, we propose an effective framework, Stabilized Self-Training (SST), which is applicable to existing GNNs to handle the scarcity of labeled data, and consequently, boost classification accuracy. We conduct thorough empirical and theoretical analysis to support our findings and motivate the algorithmic designs in SST. We apply SST to two popular GNN models GCN and DAGNN, to get SSTGCN and SSTDA methods respectively, and evaluate the two methods against 10 competitors over 5 benchmarking datasets. Extensive experiments show that the proposed SST framework is highly effective, especially when few labeled data are available. Our methods achieve superior performance under almost all settings over all datasets. For instance, on a Cora dataset with only 1 labeled node per class, the accuracy of SSTGCN is 62.5%, 17.9% higher than GCN, and the accuracy of SSTDA is 66.4%, which outperforms DAGNN by 6.6%.

研究の動機と目的

  • 1つのラベル付きノードしか利用できない状況におけるGNNの著しい性能低下を解消すること。
  • 極度のラベル不足下における既存のGNN(例:GCN、DAGNN)の不安定な訓練ダイナミクスを特定すること。
  • 既存のGNNに適用可能な安定的で汎用性の高い自己訓練フレームワークを開発し、少サンプル設定下でのノード分類性能を向上させること。
  • 標準的な自己訓練で一般的な不均衡な偽ラベル化問題を軽減するため、低信頼度の予測をフィルタリングすること。

提案手法

  • 高信頼度の予測ラベルを信頼性の高い偽ラベルとして訓練セットに選択的に追加する安定化自己訓練フレームワーク(SST)を導入する。
  • 低信頼度の予測を除外するための信頼度しきい値ηを定義する。
  • 理論的分析により、高信頼度の偽ラベルがラベル分布のバランスを取ることで分類誤差を低減できることを示す。
  • SSTをGCNおよびDAGNNに適用し、SSTGCNおよびSSTDAを構築した。これにより訓練が安定化され、一般化性能が向上した。
  • 未ラベルノードの均一なサンプリングを用いて、ラベル予測信頼度の確率的境界を導出する。
  • 理論的境界(補題1〜3)を活用し、選択された偽ラベルが統計的に信頼性があり、誤差伝搬を低減できることを保証する。

実験結果

リサーチクエスチョン

  • RQ1なぜGCNやDAGNNといった既存のGNNは、1クラスあたり1つのラベル付きノードという極度のラベル不足下で失敗するのか?
  • RQ2少数のラベル付きノードしか利用できない状況で、GNNにおける不安定な訓練がどのように現れるのか?
  • RQ3アーキテクチャの変更なしに、自己訓練を安定化させ、低ラベルレジームでの性能を向上させることは可能か?
  • RQ4偽ラベルが不均衡や低信頼度のため性能を劣化させないよう保証するための基準は何か?
  • RQ5提案されたSSTフレームワークは、既存の自己訓練およびGNN手法と比べて、正確性と安定性の面でどのように差をつけるか?

主な発見

  • Coraで1クラスあたり1つのラベル付きノードを使用した場合、SSTGCNは62.5%のテスト精度を達成し、GCNよりも17.9%高い。
  • 同じ設定でSSTDAは66.4%の精度を達成し、DAGNNを6.6%上回った。
  • 実験的結果から、SSTは実行回数にわたる予測ラベル分布の分散を顕著に低減しており、訓練の安定性が向上していることが示された。
  • 理論的分析により、高信頼度の偽ラベルが正しい予測確率の下限を保証することで、分類誤差を低減できることを確認した。
  • SSTは5つのベンチマークデータセットおよび10の競合手法において、特に低ラベルレジーム下で優れた性能を維持した。
  • 低信頼度の偽ラベルをフィルタリングすることで、誤差伝搬を防ぎ、標準的な自己訓練で見られるラベルの不均衡問題を緩和できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。