[論文レビュー] First Place Solution of KDD Cup 2021 & OGB Large-Scale Challenge Graph Prediction Track.
本論文は、KDD Cup 2021 OGB-LSC PCQM4M-LSCグラフ予測トラックにおける優勝ソリューションを提示しており、テストセットで0.1200のMAEを達成した。この手法は、GraphormerとExpC⋆モデルを組み合わせ、RDKitで計算された3次元ユークリッド距離やRBF埋め込み済み結合長といった分野特化型の分子特徴を追加することで強化され、8分割交差検証を経て、単純平均によるアンサンブルにより汎化性能と性能を向上させた。
In this technical report, we present our solution of KDD Cup 2021 OGB Large-Scale Challenge - PCQM4M-LSC Track. We adopt Graphormer and ExpC as our basic models. We train each model by 8-fold cross-validation, and additionally train two Graphormer models on the union of training and validation sets with different random seeds. For final submission, we use a naive ensemble for these 18 models by taking average of their outputs. Using our method, our team MachineLearning achieved 0.1200 MAE on test set, which won the first place in KDD Cup graph prediction track.
研究の動機と目的
- 2次元分子グラフを用いて、分子のHOMO-LUMOエネルギー差を予測する高精度なグラフニューラルネットワークモデルの開発。
- RDKitから得られる3次元分子構造的特徴を組み込むことで、大規模グラフ回帰における汎化性能を向上させ、過学習を低減すること。
- 大規模な量子化学グラフベンチマークであるPCQM4M-LSCデータセットにおいて、最先端のパフォーマンスを達成すること。
- グラフ表現学習における分子性質予測の文脈で、モデルアンサンブルと特徴工学の有効性を示すこと。
提案手法
- 空間符号化特徴としてユークリッド距離を用いた12層、768次元の隠れ層、32ヘッドのGraphormerを採用。
- 256個の基底関数を有するガウス型RBFカーネルを用い、原始的なユークリッド距離をより汎化性の高い表現に変換。
- Q検定データ上でキャリブレーションされたラプラスノイズを結合距離に追加することで、エッジ特徴を強化し、過学習を低減。
- 隠れ次元を拡張(d′ = 1200)し、集約の前に非線形活性化関数を導入した、改良版ExpC⋆を採用。
- 訓練・検証データの結合集合を用いた8分割交差検証によりモデルを訓練し、異なるランダムシードを用いて、全訓練+検証データに対する追加学習も実施。
- 16個のGraphormerおよび2個のExpC⋆バリアントを含む18個のモデルを、予測の単純平均によるアンサンブル化により、耐性と最終パフォーマンスを向上。
実験結果
リサーチクエスチョン
- RQ1グラフニューラルネットワークは、3次元分子構造的特徴をどのように統合することで、量子化学的性質予測タスクにおける予測精度を向上させることができるか?
- RQ2RBF埋め込み済み空間特徴は、グラフ回帰タスクにおけるモデルの汎化性能にどのような影響を与えるか?
- RQ3異なるトレーニング実行とアーキテクチャを用いたモデルアンサンブルは、大規模な分子グラフ予測において個々のモデルを上回る性能を発揮できるか?
- RQ4埋め込みドロップアウトなどのハイパーパrameter設定の違いが、ノード表現に敏感な小さな分子グラフ(中央値~15原子)における性能に与える影響はいかほどか?
- RQ5DFTで最適化された構造と比較して精度が低いものの、RDKitで生成された3次元座標は、モデル性能をどの程度向上させることができるか?
主な発見
- 最終的なモデルアンサンブルは、テストMAEが0.1200に達し、KDD Cup 2021 OGB-LSCグラフ予測トラックで1位を獲得した。
- RBF埋め込み済みユークリッド距離とラプラスノイズを加えた結合特徴を用いた、微調整されたGraphormerモデルは、汎化性能が向上し、検証MAEが低くなった。
- DFT構造よりも精度が低いものの、RDKitから得られる3次元分子構造的特徴は、モデル性能の向上に寄与する意味のあるインダクティブバイアスを提供した。
- 埋め込みドロップアウトをデフォルトの0.1から0.0に設定したことで、分子グラフが小さい(中央値~15原子)という点を考慮すると、性能が著しく向上した。
- 異なるランダムシードとデータ分割でトレーニングされた、複数のGraphormerおよびExpC⋆バリアントを含む、単純な18モデルアンサンブルが、最良の汎化性能と最終スコアを達成した。
- PyTorch Geometricのバージョンの違いによるモデル出力の差はわずか(MAE ≤ 1e-4)であったため、大規模な機械学習実験における再現性の重要性が浮き彫りになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。