Skip to main content
QUICK REVIEW

[論文レビュー] Contrastive Self-supervised Learning for Graph Classification

Jiaqi Zeng, Pengtao Xie|arXiv (Cornell University)|Sep 13, 2020
Advanced Graph Neural Networks被引用数 9
ひとこと要約

本稿では、低データ環境における過学習を軽減するため、グラフ分類のための2つの対照的自己教師付き学習(CSSL)手法—CSSL-Pretrain および CSSL-Reg—を提案する。対照的自己教師付き学習により、ラベルなしグラフ上でグラフエンコーダーを事前学習するか、CSSLをデータ依存の正則化子として用いることで、一般化性能が向上し、CSSL-Regは5つのデータセットのうち4つで優れた性能を示した。

ABSTRACT

Graph classification is a widely studied problem and has broad applications. In many real-world problems, the number of labeled graphs available for training classification models is limited, which renders these models prone to overfitting. To address this problem, we propose two approaches based on contrastive self-supervised learning (CSSL) to alleviate overfitting. In the first approach, we use CSSL to pretrain graph encoders on widely-available unlabeled graphs without relying on human-provided labels, then finetune the pretrained encoders on labeled graphs. In the second approach, we develop a regularizer based on CSSL, and solve the supervised classification task and the unsupervised CSSL task simultaneously. To perform CSSL on graphs, given a collection of original graphs, we perform data augmentation to create augmented graphs out of the original graphs. An augmented graph is created by consecutively applying a sequence of graph alteration operations. A contrastive loss is defined to learn graph encoders by judging whether two augmented graphs are from the same original graph. Experiments on various graph classification datasets demonstrate the effectiveness of our proposed methods.

研究の動機と目的

  • 限られたラベル付き学習データによるグラフ分類における過学習を緩和すること。
  • 人為的ラベルに依存せずに、強力なグラフレベル表現を学習する自己教師付き手法を開発すること。
  • 対照的自己教師付き学習を用いて、広く利用可能なラベルなしグラフ上でグラフエンコーダーを事前学習することで、一般化性能を向上させること。
  • 分類と対照的学習の目的関数を同時に最適化するCSSLに基づく正則化子を設計すること。
  • これらの手法の有効性を多様なグラフ分類ベンチマークで評価すること。

提案手法

  • CSSL-Pretrain は、対照的自己教師付き学習を用いてラベルなしグラフ上でグラフエンコーダーを事前学習し、その後ラベル付きデータで微調整する。
  • CSSL-Reg は、対照的損失を正則化子として統合し、訓練中に教師あり分類損失と同時に最適化する。
  • グラフの増幅は、4つの操作を逐次適用することで生成される:エッジ削除、エッジ挿入、ノード削除、ノード挿入。
  • 対照的損失は、2つの増幅グラフが同じ元のグラフから来ているかどうかを区別するように定義される。
  • 両方のタスク(事前学習および微調整)で、グラフニューラルネットワークをバックボーンエンコーダーとして使用する。
  • 増幅操作のランダム選択により、対照的タスクの難易度が向上し、表現の頑健性が向上する。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしグラフ上で対照的自己教師付き学習を実行することで、限られたラベル付きデータにおけるグラフ分類の一般化性能が向上するか?
  • RQ2教師あり分類タスクと対照的自己教師付きタスクを同時に最適化することで、標準的な微調整と比較して過学習が軽減されるか?
  • RQ3グラフ増幅戦略の選択が、自己教師付き事前学習の性能にどのように影響するか?
  • RQ4ドメインの差異を有する複数のデータセットで事前学習すると、ターゲットのグラフ分類タスクでの性能が低下するか?
  • RQ5分類損失とCSSL正則化子の間の最適なバランスは、モデルの精度と一般化性能の観点からどのように特定できるか?

主な発見

  • CSSL-Pretrain および CSSL-Reg は、5つのグラフ分類データセットにおいてベースライン手法を上回り、過学習に対する頑健性が向上していることが示された。
  • CSSL-Reg は5つのデータセットのうち4つでCSSL-Pretrainを上回る性能を示しており、同時に最適化することで、小規模なラベル付きデータセットへのバイアスが低減していることが示された。
  • CSSL-Reg では、CSSL-Pretrain よりもトレーニングとテストの精度差が小さく、より優れた一般化能力を確認した。
  • 3つのランダムなグラフ増幅操作を逐次適用することで、単一の操作を用いる場合よりも高い性能が得られ、タスクの難易度が向上したためである。
  • ランダムな増幅操作の選択が、決定論的な選択よりも優れている。これは、より挑戦的な対照的タスクを生成し、より頑健な表現を生み出すからである。
  • CSSL-Reg には最適な正則化強度が存在する:あまりに高い値は分類損失を圧倒し、性能を低下させる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。