[論文レビュー] MolXPT: Wrapping Molecules with Text for Generative Pre-training
MolXPT は、科学的テキスト、SMILES配列、および分子名とその対応するSMILESを交互に配置した「ラッピング済み」配列を事前学習した3.5億パラメータの生成言語モデルである。このラッピング手法により、テキストと分子構造を統合的にモデル化することで、MoleculeNetにおける分子性質予測で最先端の性能を達成し、より大きなモデルと同等の結果を44%少ないパラメータで達成するテキスト-分子翻訳、および微調整なしの強力なゼロショット分子生成を実現した。
Generative pre-trained Transformer (GPT) has demonstrates its great success in natural language processing and related techniques have been adapted into molecular modeling. Considering that text is the most important record for scientific discovery, in this paper, we propose MolXPT, a unified language model of text and molecules pre-trained on SMILES (a sequence representation of molecules) wrapped by text. Briefly, we detect the molecule names in each sequence and replace them to the corresponding SMILES. In this way, the SMILES could leverage the information from surrounding text, and vice versa. The above wrapped sequences, text sequences from PubMed and SMILES sequences from PubChem are all fed into a language model for pre-training. Experimental results demonstrate that MolXPT outperforms strong baselines of molecular property prediction on MoleculeNet, performs comparably to the best model in text-molecule translation while using less than half of its parameters, and enables zero-shot molecular generation without finetuning.
研究の動機と目的
- 科学的テキストとSMILES配列を統合的に事前学習することで、分子表現学習を向上させること。
- 既存のモデルが分子名とその構造的表現の間の意味的関係を明示的に活用していないという限界を是正すること。
- 微調整なしのゼロショット分子生成および多様な分子的・テキスト的タスクへの少数ショット転移学習を可能にすること。
- より大きな最先端モデルと比較して性能を維持または向上させつつ、マルチモodalな分子生成におけるモデルサイズを縮小すること。
提案手法
- MolXPT は、PubMedのタイトルおよび要旨、PubChemのSMILES、および800万件の「ラッピング済み」配列(分子名をその対応するSMILESに置換)の3つのデータソースで事前学習されている。
- BERT2を用いた名前付きエンティティ認識(NER)により、テキスト内に含まれる分子の記載を特定し、ChEBIなどの知識ベースに照合してSMILESを取得する。
- 検出された分子名をSMILESに置換することで、文脈的および構造的情報を保持するハイブリッドなテキスト-SMILES配列(ラッピング済み配列)を構築する。
- トークン化は別々に実施:テキストにはBPE(4万回のマージ)を、SMILESには正規表現ベースのトークン化を用い、分子の開始および終了を示す特別トークンを追加する。
- モデルは24層のTransformerアーキテクチャを採用し、3.5億パラメータで構成され、すべての3種類のデータタイプに対してマスク言語モデル学習により訓練されている。
- 微調整は、分子性質予測やテキスト-分子生成などの下流タスクにおいてプロンプトベースのチューニングにより実施されている。
実験結果
リサーチクエスチョン
- RQ1テキストとSMILES配列の統合的事前学習に、ラッピング済み配列による明示的対応付けを組み込むことで、分子表現学習が向上するか?
- RQ2MolXPT は、MoleculeNetのような分子性質予測ベンチマークで、既存のGNNベースおよびマルチモーダルモデルを上回る性能を示すか?
- RQ3MolXPT は、最先端モデルと比較して顕著に少ないパラメータで、テキスト-分子翻訳タスクで競争力ある性能を達成できるか?
- RQ4MolXPT は、微調整なしに、どの程度のゼロショットテキスト-分子生成能力を示すか?
- RQ5ラッピング済み配列の使用は、生のテキストとSMILESを一括して事前学習する手法と比較して、モデルの整合性および下流タスク性能にどのように寄与するか?
主な発見
- MolXPT は、MoleculeNetベンチマークで強力なGNNベースのベースラインを上回り、平均RMSEが0.859を達成した。これは、GEMなどの先行手法よりも優れている。
- CheBI-20テキスト-分子翻訳データセットにおいて、MolXPT は8億パラメータのMolT5-largeと同等の性能を達成したが、パラメータ数は44%にまで削減された。BLEUスコアは0.859、Text2Molスコアは0.983であった。
- ゼロショットテキスト-分子生成において、MolXPT はトップ1のタンニンコーエンスコアとして、MACCS(0.540)、RDK(0.383)、Morgan(0.228)のフィンガープrintを示し、微調整なしで意味のある生成を実現した。
- ゼロショット環境下で、33の分子がテキスト記述から正確に回復された。これは、未学習の生成タスクに対しても一般化能力を有していることを裏付けた。
- ラッピング済み配列の使用は、生のテキストとSMILESを一括して事前学習するが明示的対応付けを行わないモデル(例:Galactica)と比較して顕著に性能が向上しており、構造的なクロスモーダル監視の価値を示している。
- 分子からテキストへの生成タスクにおいて、MolXPT はMETEORスコア0.757、Text2Molスコア0.983を達成し、MolT5-small や MolT5-base を上回る最先端の性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。