Skip to main content
QUICK REVIEW

[論文レビュー] RIM: Reliable Influence-based Active Learning on Graphs

Wentao Zhang, Yexin Wang|arXiv (Cornell University)|Oct 28, 2021
Advanced Graph Neural Networks被引用数 10
ひとこと要約

本稿では、影響拡散とラベル品質推定を統合することで、情報量が多く信頼性の高いノードを選択する、グラフニューラルネットワーク向けの新規なアクティブラーニング手法RIMを提案する。影響の大きさと質の両方をモデル化することにより、GPAなどの最先端手法と比較して2.2%〜5.1%高い精度を達成し、ノイズの多いラベル設定下でも最大18,652倍の高速化を実現する。

ABSTRACT

Message passing is the core of most graph models such as Graph Convolutional Network (GCN) and Label Propagation (LP), which usually require a large number of clean labeled data to smooth out the neighborhood over the graph. However, the labeling process can be tedious, costly, and error-prone in practice. In this paper, we propose to unify active learning (AL) and message passing towards minimizing labeling costs, e.g., making use of few and unreliable labels that can be obtained cheaply. We make two contributions towards that end. First, we open up a perspective by drawing a connection between AL enforcing message passing and social influence maximization, ensuring that the selected samples effectively improve the model performance. Second, we propose an extension to the influence model that incorporates an explicit quality factor to model label noise. In this way, we derive a fundamentally new AL selection criterion for GCN and LP--reliable influence maximization (RIM)--by considering quantity and quality of influence simultaneously. Empirical studies on public datasets show that RIM significantly outperforms current AL methods in terms of accuracy and efficiency.

研究の動機と目的

  • グラフ構造データにおけるノードラベリングの高コスト性と誤りの多い性質に対処する。
  • ノード選択を影響拡散として定式化することで、GCNにおけるメッセージパッシングとアクティブラーニングを統合する。
  • 各ラベルの信頼性を推定する品質要因を導入することで、ラベルノイズを明示的にモデル化する。
  • 影響の大きさと質の両方をバランスさせる新しい選択基準を開発し、ノイズの多いラベル下でもモデル性能を向上させる。
  • ディープラーニングモデルやGPUアクセcelerationに依存せずに、高い効率性とロバスト性を実現するノード選択を達成する。

提案手法

  • GCNまたはLPにおけるメッセージパッシングを通じて、ラベル付きノードが他のノードの出力特徴量やラベルに与える影響の程度としてノードの影響を定義する。
  • 各ノードに対して、そのラベルが正しい確率を表す品質要因を導入し、グラフエッジに沿った特徴量/ラベルのスムージングによって推定する。
  • 影響の大きさと質を同時に最適化する信頼性のある影響最大化(RIM)目的関数を提案し、高品質な影響のみが拡散されるように保証する。
  • サブモジュラリティを活用したグリーディ近似アルゴリズムを用いて信頼性のある影響を最大化し、(1−1/e)の近似比を達成する。
  • 既に選択済みのノードからの信頼性を、グラフ構造と特徴量類似性を用いて再帰的に伝搬することで、ラベル品質を推定する。
  • トレーニングの必要なディープモデルを避けるモデルフリーで軽量なフレームワークを設計し、CPUおよびGPU上での高速推論を実現する。

実験結果

リサーチクエスチョン

  • RQ1ノード選択を影響拡散として定式化することで、グラフモデル向けアクティブラーニングとメッセージパッシングを統合できるか?
  • RQ2ラベルノイズを明示的にモデル化することで、メッセージパッシング中に誤ったラベルが拡散されるのを防げるか?
  • RQ3影響の大きさと質の組み合わせた指標が、既存手法よりも優れたアクティブラーニング性能をもたらすか?
  • RQ4RIMは、ラベルノイズの度合いやデータセット規模の変動に対して、精度と効率の面でどのように性能を発揮するか?
  • RQ5RIMは、ベースラインと比較してノード活性化パターンにおいて解釈可能性とロバスト性を維持できるか?

主な発見

  • ラベル精度が70%の状態でも、PFAというノイズ耐性機構を備えたGPAと比較して、RIMは2.2%〜5.1%高い予測精度を達成する。
  • GPU上ではGPA比最大4,670倍、CPU上では最大18,652倍の高速化を達成し、優れた効率性を示している。
  • 30%のラベルノイズ下でもRIMは強固な性能を維持し、ノイズ条件下で著しく劣化するベースラインを上回る。
  • 解釈可能性分析の結果、RIMはAGEやRIM(No RS)と比較して、ノイズラベルによる誤った活性化を少なく、より正確にノードを活性化している。
  • 信頼性のある影響最大化目的関数はサブモジュラー性を有しており、(1−1/e)の近似保証を持つグリーディアルゴリズムの適用が可能である。
  • Cora、PubMed、Redditといった多様なデータセットにおいて、RIMの性能は一貫して精度と速度の両面で優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。