[論文レビュー] A Large Encoder-Decoder Family of Foundation Models For Chemical Language
本稿では、PubChemから収集された9100万件のSMILES(40億個の分子トークンに相当)を用いて事前学習された大規模なエンコーダデコーダーファンダメンタルモデル、SMI-TED289Mを紹介する。このモデルは、分子性質予測および分子再構築において最先端の性能を達成しており、潜在空間に明確な構成的構造を示しており、分子断片間の線形関係を用いた少サンプル推論や、生成タスクにおける高いTanimoto類似度を実現している。
Large-scale pre-training methodologies for chemical language models represent a breakthrough in cheminformatics. These methods excel in tasks such as property prediction and molecule generation by learning contextualized representations of input tokens through self-supervised learning on large unlabeled corpora. Typically, this involves pre-training on unlabeled data followed by fine-tuning on specific tasks, reducing dependence on annotated datasets and broadening chemical language representation understanding. This paper introduces a large encoder-decoder chemical foundation models pre-trained on a curated dataset of 91 million SMILES samples sourced from PubChem, which is equivalent to 4 billion of molecular tokens. The proposed foundation model supports different complex tasks, including quantum property prediction, and offer flexibility with two main variants (289M and $8 imes289M$). Our experiments across multiple benchmark datasets validate the capacity of the proposed model in providing state-of-the-art results for different tasks. We also provide a preliminary assessment of the compositionality of the embedding space as a prerequisite for the reasoning tasks. We demonstrate that the produced latent space is separable compared to the state-of-the-art with few-shot learning capabilities.
研究の動機と目的
- 大規模なラベルなし分子データを用いた自己教師付き事前学習により、スケーラブルでオープンソースの化学言語表現用のファンドメンタルモデルを開発すること。
- エンコーダデコーダー変換器アーキテクチャを用いて文脈的で構成的な表現を学習することで、分子性質予測と生成の性能を向上させること。
- 化学的推論および少サンプル一般化の前提となる、学習済み分子埋め込みの構成的構造を調査すること。
- ドラッグディスカバリーや材料科学の多様な科学的応用に適した柔軟で高性能なモデル族(289Mおよび8×289Mパラメータバージョン)を提供すること。
- 今後の化学ファンドメンタルモデルの事前学習のための、9100万件の高品質なSMILESから構成される収集済みデータセットを公開すること。
提案手法
- PubChemの9100万件の収集済みSMILESを用いて、自己教師付きマスキング言語モデル化を用いて、変換器ベースのエンコーダデコーダーモデルを事前学習する。このデータは40億個の分子トークンに相当する。
- 共通の語彙と階層的トークン化を用いた二重エンコーダー機構を採用し、SMILES文字列を介して分子構造と結合性をモデル化する。
- より大きなバージョン(SMI-TED8x289M)にMixture-of-Experts(MoE)アーキテクチャを導入し、スパース活性化を用いてパラメータ効率的なスケーリングを実現する。
- t-SNE可視化と埋め込み投影上の線形回帰を用いて、潜在空間における構成的構造を定量的に評価し、断片の加法を表すSMILESの三つ組みを用いる。
- 少数の例題三つ組みからの埋め込み生成とTanimoto類似度を用いたターゲットSMILESの再構築により、少サンプル推論を評価する。
- 標準ベンチマーク(QM9、MOSES)および回帰/分類タスクを用いて、量子的、物理的、バイオ物理的、生理的性質のあらゆる分野において性能を検証する。
実験結果
リサーチクエスチョン
- RQ1大規模なエンコーダデコーダーファンダメンタルモデルは、ラベルなしSMILESを自己教師付き事前学習することで、構成的分子表現を学習できるか?
- RQ2SMI-TED289Mの学習済み潜在空間は、少サンプル推論および分子再構築をどの程度サポートするか?
- RQ3モデルの埋め込み空間は、分子断片間の階層的および線形的関係をどの程度反映しているか?
- RQ4収集済みの大規模SMILESコーパスを用いた事前学習は、先行手法と比較して分子性質予測の性能を向上させるか?
- RQ5最小限のファインチューニングで、多様な化学的タスクに一般化可能であり、強力な少サンプル能力を示せるか?
主な発見
- SMI-TED289Mは、量子力学的性質予測のためのQM9ベンチマークで12のタスクのうち11で最先端の性能を達成した。
- 断片加法タスクにおける線形回帰では、R²が0.99、MSEが0.002を達成し、潜在空間に明確な構成的構造があることを示している。
- 少サンプル生成タスクでは、平均Tanimoto類似度スコアが0.52を記録し、正解のSMILES再構築では最高で0.92に達した。
- SMI-TED289Mの埋め込みのt-SNE可視化は、分子ファミリーと階層的距離に応じた明確な分離を示しており、MoLFormer(R²=0.55、MSE=0.237)を上回った。
- モデルは、わずか数個の三つ組みを入力として用いても、顕著な少サンプル一般化を示しており、類似度スコアが高く維持された。
- PubChemから収集された9100万件のSMILESデータセットが、事前学習に効果的であることが示され、モデル性能と構成的推論の両方を顕著に向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。