Skip to main content
QUICK REVIEW

[論文レビュー] Automated Data Augmentations for Graph Classification

Youzhi Luo, Michael McThrow|arXiv (Cornell University)|Feb 26, 2022
Machine Learning and ELM被引用数 8
ひとこと要約

本稿では、強化学習を用いてラベル不変のグラフ変換を学習する自動データ拡張手法であるGraphAugを提案する。ノードマスキング、エッジドロップ、エッジ摂動の3つの変換を、学習された方策に従って動的に選択することで、複数のグラフデータセットで最先端の性能を達成するとともに、ラベル不変性を高い水準で維持している。アブレーションおよび一般化の検証によってその有効性が裏付けられている。

ABSTRACT

Data augmentations are effective in improving the invariance of learning machines. We argue that the core challenge of data augmentations lies in designing data transformations that preserve labels. This is relatively straightforward for images, but much more challenging for graphs. In this work, we propose GraphAug, a novel automated data augmentation method aiming at computing label-invariant augmentations for graph classification. Instead of using uniform transformations as in existing studies, GraphAug uses an automated augmentation model to avoid compromising critical label-related information of the graph, thereby producing label-invariant augmentations at most times. To ensure label-invariance, we develop a training method based on reinforcement learning to maximize an estimated label-invariance probability. Experiments show that GraphAug outperforms previous graph augmentation methods on various graph classification tasks.

研究の動機と目的

  • グラフ分類におけるデータ不足を解消するため、自動的かつラベル不変なデータ拡張戦略を開発すること。
  • ラベル関連の情報を破壊するおそれがある、一様で手作業によるグラフ拡張の限界を克服すること。
  • グラフ構造とラベル文脈に基づいて最適な変換を選択する学習可能な拡張方策を設計すること。
  • ラベル不変性の推定確率を最大化する強化学習フレームワークを用いて、拡張中に高いラベル不変性を確保すること。
  • 手動でのハイパーパrameterチューニングなしに、多様なグラフデータセットに対して一般化性とロバストネスを示すこと。

提案手法

  • GraphAugは、3つの学習可能な拡張カテゴリ(MaskNF(ノード特徴マスキング)、DropNode(ノードドロップ)、PerturbEdge(エッジ摂動))から選択する強化学習エージェントを採用する。
  • エージェントは、元のグラフと拡張後のグラフの予測の類似度に基づく報酬を最大化することで、ラベル不変性確率を推定し、それを最大化するように訓練される。
  • グラフレベルの表現を符号化するために、仮想ノードを備えたグラフニューラルネットワークが使用され、エージェントが情報に基づいた拡張意思決定が可能になる。
  • 拡張方策を最適化するためにポリシー勾配法が用いられ、報酬は元のグラフと拡張グラフの予測類似度に基づく。
  • メッセージパッシングの向上とグラフレベル表現学習の支援を目的として、仮想ノードが導入され、より良い拡張カテゴリ予測を可能にする。
  • 合成および実世界のグラフデータセットを組み合わせて評価され、交差検証下での分類精度を指標として性能が測定される。

実験結果

リサーチクエスチョン

  • RQ1自動的かつ学習可能な拡張方策は、一様で手作業によるグラフ拡張を上回ることができるか?
  • RQ2強化学習を用いて、意味的意味を保持するラベル不変のグラフ変換を学習できる程度はどの程度か?
  • RQ3仮想ノードの導入は、拡張方策の性能と安定性にどのような影響を与えるか?
  • RQ4マスキング、ドロップ、摂動などの複数の変換タイプを組み合わせることで、単一タイプよりも良い一般化性能が得られるか?
  • RQ5ラベルが既知の合成データセットにおいて、GraphAugのラベル不変性比は一様ベースラインと比べてどの程度優れているか?

主な発見

  • GraphAugは、GINモデルを用いてPROTEINS(0.816 ± 0.001)、IMDB-BINARY(0.762 ± 0.004)、NCI1(0.816 ± 0.001)など、複数のグラフ分類ベンチマークで最先端の性能を達成した。
  • COLORSおよびTRIANGLESの合成データセットでは、それぞれラベル不変性比が0.9994および1.0000に達し、一様ベースラインを著しく上回った。
  • アブレーションスタディの結果、特定のデータセットでは1つの変換タイプ(例:学習可能なDropNode)のみを用いることも有効であるが、GraphAugの組み合わせ戦略は多様なデータ分布にわたってより優れた一般化性能を示した。
  • GNNバックボーンに仮想ノードを導入したことで、グラフレベル表現としての和、平均、最大プーリングよりも優れた性能が得られ、メッセージパッシングと表現学習の向上に寄与することが確認された。
  • GraphAugは、小規模データセットにおいて一貫して一般化性能を向上させ、過学習を低減し、複数回の10-fold交差検証においてロバストであることが示された。
  • すべての評価対象データセットおよびモデルで、一様およびランダムな拡張ベースラインを含む先行手法を上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。