[論文レビュー] ChemBERTa-2: Towards Chemical Foundation Models
ChemBERTa-2は大規模なSMILESベースのトランスフォーマー(77M化合物)を事前学習し、MLMとMTRの事前学習を比較する。事前学習が下流タスクへ拡張可能であることを分析し、MoleculeNetの結果で競争力を示している。
Large pretrained models such as GPT-3 have had tremendous impact on modern natural language processing by leveraging self-supervised learning to learn salient representations that can be used to readily finetune on a wide variety of downstream tasks. We investigate the possibility of transferring such advances to molecular machine learning by building a chemical foundation model, ChemBERTa-2, using the language of SMILES. While labeled data for molecular prediction tasks is typically scarce, libraries of SMILES strings are readily available. In this work, we build upon ChemBERTa by optimizing the pretraining process. We compare multi-task and self-supervised pretraining by varying hyperparameters and pretraining dataset size, up to 77M compounds from PubChem. To our knowledge, the 77M set constitutes one of the largest datasets used for molecular pretraining to date. We find that with these pretraining improvements, we are competitive with existing state-of-the-art architectures on the MoleculeNet benchmark suite. We analyze the degree to which improvements in pretraining translate to improvement on downstream tasks.
研究の動機と目的
- 大規模言語モデルの事前学習概念をSMILESベース表現に転用して化学基盤モデルを動機づける。
- 事前学習データセットサイズと目的(MLM対MTR)が下流の分子予測タスクに与える影響を探る。
- 事前学習の改善がMoleculeNetベンチマーク全体で性能向上へどう翻訳されるかを特定する。
- 大規模分子モデルの事前学習戦略とハイパーパラメータの実践的ガイダンスを提供する。
提案手法
- PubChemからの77M SMILESに対してMLM事前学習を行う RoBERTaベースのトランスフォーマー(ChemBERTa-2)を用いる。
- MLMとマルチタスク回帰(MTR)事前学習目的を比較する。
- アーキテクチャと学習設定のハイパーパラメータ探索を5M、10M、77Mデータセットで実施する。
- スキャフォールドベースの分割と、適切にタスクごとに正規化またはクラス重み付けを行い、下流タスクで事前学習済みモデルをファインチューニングする。
- 事前学習損失と下流パフォーマンスの転移を分析する。
- 再現性のためにトレーニング済みモデルをオープンソース化する。
実験結果
リサーチクエスチョン
- RQ1より大規模なSMILES事前学習はMoleculeNetのタスクで分子特性予測の性能を向上させるか?
- RQ2MLMとマルチタスク回帰(MTR)の事前学習は下流のパフォーマンスとトレーニング効率の点でどう比較されるか?
- RQ3事前学習損失が特定の下流データセット(例:溶解性、毒性)にどの程度改善をもたらすか?
主な発見
- より大規模データセット(最大77M SMILES)での事前学習は事前学習損失を低下させ、複数のタスクで下流性能を向上させる。
- MTR事前学習は下流タスクで一般にMLMより優れているが、MLMベースのアーキテクチャ探索は相関する損失によりMTR事前学習の選択を効率的に導くことができる。
- 77MデータでMLMまたはMTRで事前学習したChemBERTa-2の設定は競争的な結果を達成し、表1の8タスク中6タスクでD-MPNNを上回る。
- 事前学習損失の改善は一部タスク(例:脂質親和性)での利得と相関するが、転移効率はデータセットとタスクによって異なる。
- より遅いMTRトレーニングに着手する前にMLMを用いてハイパーパラメータを選択する実用的なワークフローを構築できる。
- 次元削減分析(UMAP)はChemBERTaの埋め込みが下流の分類タスクの強力な事前知識となり得ることを示す。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。