[論文レビュー] Augmented Transformer Achieves 97% and 85% for Top5 Prediction of Direct and Classical Retro-Synthesis.
本稿では、入力および目的データの両方にSMILESシーケンスの拡張を適用することで、データの記憶を軽減し一般化性能を向上させる拡張されたTransformerモデルを提案する。この手法により、古典的逆合成における最大の断片を予測する際、USPTO-MIT分離セットで97%のTop-5精度、USPTO-50kテストセットで85.4%の精度を達成した。
We investigated the effect of different augmentation scenarios on predicting (retro)synthesis of chemical compounds using SMILES representation. We showed that augmentation of not only input sequences but also, importantly, of the target data eliminated the effect of data memorization by neural networks and improved their generalization performance for prediction of new sequences. The Top-5 accuracy was 85.4% for the prediction of the largest fragment (thus identifying principal transformation for classical retro-synthesis) for USPTO-50k test dataset and was achieved by a combination of SMILES augmentation and beam search. The same approach also outperformed best published results for prediction of direct reactions from the USPTO-MIT test set. Our model achieved 90.4% Top-1 and 96.5% Top-5 accuracy for its most challenging mixed set and 97% Top-5 accuracy for the USPTO-MIT separated set. The appearance frequency of the most abundantly generated SMILES was well correlated with the prediction outcome and can be used as a measure of the quality of reaction prediction.
研究の動機と目的
- 神経ネットワークにおける化学反応予測のためのデータ記憶問題に対処すること。
- シーケンス拡張を用いて逆合成予測の一般化性能を向上させること。
- 古典的逆合成における主な転換を特定するためのTop-5精度を向上させること。
- 入力および目的データの拡張がモデルの一般化に与える影響を評価すること。
- モデルの解釈可能性のため、SMILES生成頻度と予測品質の相関を調査すること。
提案手法
- 記憶効果を軽減するため、入力および目的シーケンスの両方にSMILESシーケンス拡張を適用すること。
- 予測の多様性と正確性を向上させるために推論時にビームサーチを用いること。
- 一般化性能を向上させるために、拡張データ上でTransformerベースのモデルを学習すること。
- ベンチマークデータセットにおけるTop-1およびTop-5精度を測定することで予測品質を評価すること。
- 予測信頼性の代理指標として、最も頻繁に生成されたSMILESの出現頻度を分析すること。
- USPTO-50kおよびUSPTO-MITテストセット、特に混合および分離済みの反応セットを含む性能評価を行うこと。
実験結果
リサーチクエスチョン
- RQ1入力および目的シーケンスの両方を拡張することで、逆合成予測における一般化性能が向上するか?
- RQ2データ拡張により、化学反応予測におけるニューラルネットワークの記憶を軽減できるか?
- RQ3SMILES拡張が、古典的逆合成における最大断片の識別におけるTop-5精度に与える影響は何か?
- RQ4ビームサーチとデータ拡張の組み合わせが予測性能をどのように向上させるか?
- RQ5生成されたSMILESの頻度は、予測品質の信頼性ある指標として使用できるか?
主な発見
- 本モデルは、直接反応予測のためのUSPTO-MIT分離テストセットで97%のTop-5精度を達成した。
- USPTO-50kテストセットでは、最大断片の予測において85.4%のTop-5精度を達成し、主な転換を特定した。
- 本モデルは、USPTO-MITテストセットにおいて、以前に発表された結果を上回り、最も挑戦的な混合セットでTop-1精度90.4%、Top-5精度96.5%を達成した。
- 最も頻繁に生成されたSMILESの出現頻度は、正しく予測された結果と強く相関していた。
- 入力および目的シーケンスの共同拡張は、記憶の軽減とモデルの一般化性能の向上に顕著に寄与した。
- SMILES拡張とビームサーチの組み合わせが、複数のベンチマークで最先端の性能を達成する鍵であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。