Skip to main content
QUICK REVIEW

[論文レビュー] Chemical Structure Elucidation from Mass Spectrometry by Matching Substructures

Jing Shan Lim, Joshua M. Wong|arXiv (Cornell University)|Nov 17, 2018
Computational Drug Discovery Methods参考文献 10被引用数 6
ひとこと要約

本論文では、質量分析スペクトルからサブ構造の存在をニューラルネットワークで予測し、与えられた分子式から生成された候補構造と照合することで、質量スペクトルからの化学構造の同定を自動的・データ駆動的に行う手法を提案する。この手法は、2種類の化学兵器物質クラスにおいて、それぞれ88%および71%の確率で正しい構造を上位20位以内にランク付けでき、同定作業における人的作業を顕著に削減する。

ABSTRACT

Chemical structure elucidation is a serious bottleneck in analytical chemistry today. We address the problem of identifying an unknown chemical threat given its mass spectrum and its chemical formula, a task which might take well trained chemists several days to complete. Given a chemical formula, there could be over a million possible candidate structures. We take a data driven approach to rank these structures by using neural networks to predict the presence of substructures given the mass spectrum, and matching these substructures to the candidate structures. Empirically, we evaluate our approach on a data set of chemical agents built for unknown chemical threat identification. We show that our substructure classifiers can attain over 90% micro F1-score, and we can find the correct structure among the top 20 candidates in 88% and 71% of test cases for two compound classes.

研究の動機と目的

  • 質量スペクトルと分子式からの化学構造同定(CSE)に人的作業が数日を要する分析化学分野におけるボトル neck を解消すること。
  • サブ構造選択およびスクリーニングに専門家による干渉に依存することなく、同定ワークフローを自動化すること。
  • 特に化学兵器禁止条約(CWC)に定められた化学兵器の同定を、迅速かつ正確に行うことを目的とすること。
  • 機械学習を用いて候補構造を効率的にランク付けし、短縮リストに対して後続の計算的検証を可能にすること。

提案手法

  • 質量スペクトルのみを入力として、化合物内のサブ構造の存在を予測する深層ニューラルネットワークを学習する。
  • 手動によるスペクトル解釈を必要とせず、質量スペクトルの特徴からサブ構造パターンをデータドリブンで学習するアプローチを採用する。
  • MOLGENを用いて、与えられた分子式からすべての可能な候補構造を生成する。
  • ニューラルネットワークから予測されたサブ構造を候補構造と照合し、ランク付けのための関連スコアを計算する。
  • 多様な官能基の検出を向上させるために、1化合物クラスあたり1〜2個の代表的サブ構造を用いたマルチレプレゼンタティブサブ構造分類を適用する。
  • サブ構造マッチングの信頼度に基づいて候補構造をランク付けし、OPCW VGWDデータベースのテストセットで上位-k性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1質量スペクトルデータのみを用いて、ニューラルネットワークが未知化合物内のサブ構造の存在を正確に予測できるか?
  • RQ2質量スペクトルからのサブ構造予測が、数百万もの候補構造の中から正しい化学構造を効果的にランク付けできるか?
  • RQ3複数の代表的サブ構造(例:シリル化されたものと非シリル化されたもの)を含めることで、モデルの性能およびランク付け精度にどのような影響を与えるか?
  • RQ4この自動ワークフローによって、化学構造同定における専門家による干渉の必要性はどの程度削減できるか?
  • RQ5手動によるスクリーニングや化学者によるサブ構造選択に依存する従来の手法と比較して、本手法はどのように異なるか?

主な発見

  • サブ構造分類器はテストデータで90%を超えるマイクロF1スコアを達成し、優れた予測性能を示した。
  • PPTN化合物クラスでは、テストケースの88%で正しい構造が上位20候補内にランク付けされた。
  • PPN化合物クラスでは、テストケースの71%で正しい構造が上位20にランク付けされた。
  • 2つの代表的サブ構造(例:シリル化変種を含む)を用いることで、複雑な官能基を有する化合物のランク付け精度が顕著に向上した。
  • 大多数のケースで候補リストが20構造未満に短縮され、シミュレーションやNMRによる効率的な後続検証が可能になった。
  • サポートベクターマシンはニューラルネットワークより性能が劣り、PPTN(2代表)ではF1スコア69.4%であったのに対し、ニューラルネットワークでは87.8%を記録した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。