Skip to main content
QUICK REVIEW

[論文レビュー] BERT Learns (and Teaches) Chemistry

Josh Payne, M. Sammer Srouji|arXiv (Cornell University)|Jul 11, 2020
Machine Learning in Materials Science参考文献 34被引用数 21
ひとこと要約

本稿では、分子のSMILES文字列表現を用いてBERTを活用し、分野特化のヒューリスティクスに依存せずに、アテンション機構の分析によって化学的に関連するサブ構造(例:機能性基)を自動的に同定することを提案する。実証的に、BERTのアテンションヘッドが特性に影響を与えるサブ構造を強調できることを示し、溶解度、ドライッグリッネス、合成可能性のタスクでBERTを微調整することで、解釈可能で化学的に意味のあるアテンションパターンが得られ、特に溶解度予測において顕著である。

ABSTRACT

Modern computational organic chemistry is becoming increasingly data-driven. There remain a large number of important unsolved problems in this area such as product prediction given reactants, drug discovery, and metric-optimized molecule synthesis, but efforts to solve these problems using machine learning have also increased in recent years. In this work, we propose the use of attention to study functional groups and other property-impacting molecular substructures from a data-driven perspective, using a transformer-based model (BERT) on datasets of string representations of molecules and analyzing the behavior of its attention heads. We then apply the representations of functional groups and atoms learned by the model to tackle problems of toxicity, solubility, drug-likeness, and synthesis accessibility on smaller datasets using the learned representations as features for graph convolution and attention models on the graph structure of molecules, as well as fine-tuning of BERT. Finally, we propose the use of attention visualization as a helpful tool for chemistry practitioners and students to quickly identify important substructures in various chemical properties.

研究の動機と目的

  • ドメイン固有のヒューリスティクスや専門知識に依存せずに、データ駆動的に化学的に有意義な分子サブ構造を同定すること。
  • BERTのアテンション機構が、溶解度、毒性、ドライッグリッネスなどの分子特性に影響を与える機能性基を学習して強調できるかどうかを検討すること。
  • BERTが学習した表現をグラフニューラルネットワークの特徴として用いること、および下流の化学的回帰タスクにおける微調整の有効性を評価すること。
  • アテンション可視化を化学者が分子特性における重要なサブ構造を同定するための実用的で解釈可能なツールとして開発すること。
  • 大規模なSMILESデータで事前学習することで、標準的な原子特徴化を超えて化学的に意味のある表現をBERTが学習できるかどうかを調査すること。

提案手法

  • 分子を表す大規模なSMILES文字列データセットでBERTを微調整し、原子およびサブ構造の文脈的表現を学習する。
  • 予測タスク中にどの原子やサブ構造が高頻度でアテンションを受けるかを、BERTの各レイヤーにおけるアテンションヘッドを分析することで特定する。
  • BERTで学習した表現を、分子グラフ上でグラフ畳み込みおよび自己アテンションモデルの入力特徴として用い、溶解度、ドライッグリッネス、合成可能性を予測する。
  • ZINC15データセットを用いて、QED、SAS、溶解度などの回帰タスクに対してBERTを直接微調整し、性能とアテンション行動を評価する。
  • アテンション行列の可視化により、特定の化学的性質に最も影響を与える分子断片を解釈可能に特定する。
  • 同じ分子の異なるSMILES表現間で一貫した埋め込みを学習するよう促すための対照的損失を提案する。

実験結果

リサーチクエスチョン

  • RQ1BERTのアテンション機構は、事前の分野知識なしに、分子内に化学的に関連するサブ構造を自動的に同定できるか?
  • RQ2BERTで学習した表現は、溶解度、ドライッグリッネス、合成可能性といった分子特性予測タスクの性能を向上させるか?
  • RQ3異なる化学的回帰タスクで微調整した際、BERTのアテンションパターンはどのように変化するか?
  • RQ4アテンション可視化は、化学者が分子特性における主要な機能性基を同定するための実用的で解釈可能なツールとして機能できるか?
  • RQ5大規模なSMILESデータで事前学習することで、標準的な原子特徴化よりもより強固で化学的に意味のある表現が得られるか?

主な発見

  • 特に溶解度タスクで微調整した後、BERTのアテンションヘッドは、既知の特性に影響を与えるサブ構造を直感的に注目しており、意味のあるパターン認識が可能であることが示された。
  • 回帰タスクでBERTを微調整することで、初期値をランダムに設定した場合よりも性能が向上した。これは、事前学習が有用な誘導バイアスを提供していることを示している。
  • 異なるタスク間でのアテンションパターンは概ね類似していたが、溶解度タスクにおいてレイヤー10および11に顕著な差が見られ、タスク固有のアテンション学習が行われていることが示された。
  • 学習済み埋め込み表現は、標準的な原子特徴化よりも性能が優れていないことが判明した。これは、分子グラフ全体の情報を十分に捉えていない可能性を示唆している。
  • 性能向上が限定的であったものの、アテンション可視化により解釈可能で化学的に妥当なサブ構造の強調が得られ、解釈可能性ツールとしての有効性が裏付けられた。
  • 著者らは、BERTの語彙に含まれないレアアトムが影響をほとんど及ぼさないことを観察し、語彙制限に対するロバストネスが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。