Skip to main content
QUICK REVIEW

[論文レビュー] BARTSmiles: Generative Masked Language Models for Molecular Representations

Gayane Chilingaryan, Hovhannes Tamoyan|arXiv (Cornell University)|Nov 29, 2022
Machine Learning in Materials Science被引用数 15
ひとこと要約

BARTSmilesは、ZINC20データセットの17億個の分子を用いて、前例に比べて10倍の計算資源を活用して、自己教師付き生成型マスク言語モデルとして大規模に事前学習された分子表現用のモデルを紹介する。11の分類・回帰・生成タスクにおいて最先端の性能を達成しており、解釈可能性解析では統合勾配法が既知の有害性官能基を明確に特定している。

ABSTRACT

We discover a robust self-supervised strategy tailored towards molecular representations for generative masked language models through a series of tailored, in-depth ablations. Using this pre-training strategy, we train BARTSmiles, a BART-like model with an order of magnitude more compute than previous self-supervised molecular representations. In-depth evaluations show that BARTSmiles consistently outperforms other self-supervised representations across classification, regression, and generation tasks setting a new state-of-the-art on 11 tasks. We then quantitatively show that when applied to the molecular domain, the BART objective learns representations that implicitly encode our downstream tasks of interest. For example, by selecting seven neurons from a frozen BARTSmiles, we can obtain a model having performance within two percentage points of the full fine-tuned model on task Clintox. Lastly, we show that standard attribution interpretability methods, when applied to BARTSmiles, highlight certain substructures that chemists use to explain specific properties of molecules. The code and the pretrained model are publicly available.

研究の動機と目的

  • マスク言語モデルを用いて、分子表現に特化した堅牢でスケーラブルな自己教師付き事前学習戦略を開発すること。
  • 従来のモデルよりもはるかに多くの計算資源を活用して、BARTSmilesと呼ばれる大規模な生成型言語モデルを分子用に訓練すること。
  • 分類・回帰・生成を含む多様な下流タスクにおいてBARTSmilesの性能を評価し、最先端の性能を確立すること。
  • 事前学習された表現が、ニューロンレベルの解析と解釈可能性手法を通じて、タスク関連の情報を暗黙的にエンコードしているかどうかを調査すること。
  • 特徴量の重み付け(例:統合勾配法)を用いて、化学的に知られた構造的アラートと照合することで、モデルの解釈可能性を検証すること。

提案手法

  • ZINC20データセット全量(17億個の分子)を用いて、SMILES文字列上でBART型トランスフォーマー・モデルをマスク言語モデルの目的関数で事前学習する。
  • 分子表現学習のためのハイパーパramータとアーキテクチャ選択を最適化するため、頑健でアブレーション駆動の事前学習戦略を採用する。
  • 微調整用に固定されたBARTSmilesモデルを、11の多様な下流タスク(例:毒性予測(ClinTox)、溶解度(ESOL)、反応予測)に適用する。
  • 予測に寄与する原子/サブストラクチャを特定するために、統合勾配法を特徴量の重み付けに適用する。
  • 下流タスクの性能と相関が高い活性化を示す個々のニューロンを同定することで、ニューロンレベルの解析を実施する。
  • 固定されたニューロン(7~15個)の線形プローブを用いることで、ClinToxタスクで完全な微調整性能の90%以上を達成し、タスク固有の表現学習が有効であることを示した。

実験結果

リサーチクエスチョン

  • RQ1SMILES文字列上で大規模かつ自己教師付きのマスク言語モデルを学習することで、多様なタスクにおいて先行手法を上回る汎用的な分子表現を学習できるか?
  • RQ2BARTSmilesの事前学習済み表現が、毒性や溶解度などの下流タスクに関連する情報をどの程度暗黙的にエンコードしているか?
  • RQ3統合勾配法などの解釈可能性手法が、ミュタゲン性に関連する既知の構造的アラート(例:ニトロ基、エポキシ基)といった化学的に意味のあるサブストラクチャを明確に特定できるか?
  • RQ4BARTSmilesの固定されたニューロンの少数(7~15個)が、下流タスクで準最先端の性能を達成できるか?これは効率的な表現学習を示唆する。
  • RQ5モデルの注意機構や特徴量の重み付け行動が、医薬化学分野の専門的知識(例:ミュタゲン性の構造的アラート)とどの程度整合しているか?

主な発見

  • BARTSmilesは、評価した11の分子特性予測、生成、回帰タスクすべてで最先端の性能を達成した。
  • モデルの規模と頑健な事前学習戦略のおかげで、特にデータが少ない状況下でも、先行する自己教師付き分子表現を大きく上回った。
  • 統合勾長法による特徴量の重み付けマップは、ミュタゲン性に関連する既知の構造的アラート(例:ニトロ基、エポキシ基)を一貫して強調しており、専門家の知識と整合していることを確認した。
  • ClinToxタスクにおいて、わずか7~15個の固定ニューロンの線形結合が、完全な微調整モデル性能の90%以上を達成した。これは、タスク固有の表現学習が強いことを示している。
  • ESOL回帰タスクでは、極性官能基(例:-OH、C=O)が溶解度に寄与する主要因であると特定され、炭化水素鎖の部分には負の重み付けが付与されており、化学的直観と整合している。
  • 統合勾長法スコアに一貫したバイアスが観察された(最初のトークンが常に高い重み付けを受ける)が、平均値の減算によってこれを是正し、解釈可能性の忠実度を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。