Skip to main content
QUICK REVIEW

[論文レビュー] Improving Molecular Graph Neural Network Explainability with Orthonormalization and Induced Sparsity

Ryan Henderson, Djork-Arné Clevert|arXiv (Cornell University)|May 11, 2021
Machine Learning in Materials Science被引用数 12
ひとこと要約

本論文は、分子グラフニューラルネットワーク(GNN)の解釈可能性を向上させる2つの正則化手法——バッチ表現直交化(BRO)とジニ正則化——を導入する。BROは学習中にノード埋め込みの直交性を強制するのに対し、ジニ正則化は出力層の重みをスパース化させ、より集中的で化学的に合理的な帰属マップを生成する。人間の専門家は、特に溶解度およびlogD予測において、正則化モデルからの説明を顕著に好んだ。

ABSTRACT

Rationalizing which parts of a molecule drive the predictions of a molecular graph convolutional neural network (GCNN) can be difficult. To help, we propose two simple regularization techniques to apply during the training of GCNNs: Batch Representation Orthonormalization (BRO) and Gini regularization. BRO, inspired by molecular orbital theory, encourages graph convolution operations to generate orthonormal node embeddings. Gini regularization is applied to the weights of the output layer and constrains the number of dimensions the model can use to make predictions. We show that Gini and BRO regularization can improve the accuracy of state-of-the-art GCNN attribution methods on artificial benchmark datasets. In a real-world setting, we demonstrate that medicinal chemists significantly prefer explanations extracted from regularized models. While we only study these regularizers in the context of GCNNs, both can be applied to other types of neural networks

研究の動機と目的

  • 予測の明確さと帰属マップの合理性を向上させることで、分子グラフニューラルネットワークの解釈の難しさに対処すること。
  • GNNにおける相関的または密集したノード表現が原因で生じる説明の混乱を軽減すること。
  • 予測性能を損なわずに、学習された表現におけるスパarsityと直交性を促進する正則化手法を開発すること。
  • 正則化モデルが現実世界の設定において医薬化学者が好む説明を生成するかどうかを評価すること。
  • 単純で一般化可能なトレーニング時正則化によって、解釈可能性の向上を達成できることを示すこと。

提案手法

  • バッチ表現直交化(BRO)は、線形原子軌道結合理論(LCAO)理論にインspiredされ、ミニバッチ全体におけるノード埋め込みの直交性を強制する正則化損失を適用する。
  • BRO損失は、ノード表現のグラム行列が単位行列からどれほど逸脱しているかをフロベニウスノルムで最小化することで、その偏差を抑える。
  • ジニ正則化は出力層の重みに適用され、予測に使用する次元数を減らすことを促進する。
  • 出力層重みのジニ係数をトレーニング中に最小化することで、主要な特徴がいくつかに集中し、余分な特徴が抑制されるようにする。
  • 両正則化手法はPyTorch Geometricで実装されており、マルチタスクモデルを含む既存のGNNアーキテクチャと互換性がある。
  • 手法は人工ベンチマークおよび実世界の物理的・化学的性質予測タスクで評価され、専門家の好みに関するアンケート調査が実施された。

実験結果

リサーチクエスチョン

  • RQ1ノード表現における直交性の強制が、分子GNNにおける帰属マップの品質を向上させるか?
  • RQ2出力層重みのスパarsityを促進することは、より解釈可能で集中した予測をもたらすか?
  • RQ3これらの正則化は、ベンチマークデータセット上で最先端の帰属手法の性能を向上させるか?
  • RQ4医薬化学者がBROおよびジニ正則化でトレーニングされたモデルから生成された帰属マップを、ベースラインモデルよりも好むか?
  • RQ5これらの正則化は、実世界の分子性質予測タスクにおける予測性能にどの程度の影響を及ぼすか?

主な発見

  • 医薬化学者は、BROおよびジニ正則化でトレーニングされたモデルからの帰属マップを顕著に好んだ。特に溶解度およびlogDのエンドポイントにおいて顕著で、logDのための変動係数は0.95であった。
  • 専門家の好みは、logDのような化学的に説明しやすいエンドポイントで最も顕著であり、融点のようなより複雑なエンドポイントでは合意が低かった。
  • 人工ベンチマークでは、ジニおよびBRO正則化が複数の帰属手法のAUROCを向上させ、関連する原子寄与の識別が改善された。
  • 実世界のタスクにおける予測性能はわずかに低下し、両正則化を適用した場合、LOP溶解度エンドポイントでR²が最大で0.47から0.34に低下したが、ハイパーパrameterチューニングにより回復可能である可能性がある。
  • BRO正則化はすべてのタスクでわずかに性能を低下させ、ベンゼンタスクにおけるほぼ完璧な分類性能に対しても同様の影響を示したため、解釈可能性と正確性のトレードオフが生じていると考えられる。
  • BROとジニ正則化の組み合わせにより、より分離され局所化された表現が得られ、明確で化学的に直感的な説明が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。