Skip to main content
QUICK REVIEW

[논문 리뷰] Chemical Structure Elucidation from Mass Spectrometry by Matching Substructures

Jing Shan Lim, Joshua M. Wong|arXiv (Cornell University)|2018. 11. 17.
Computational Drug Discovery Methods참고 문헌 10인용 수 6
한 줄 요약

이 논문은 질량 분석에서의 화학 구조 해석을 자동화하고 데이터 기반으로 접근하는 방법을 제안한다. 질량 스펙트럼에서 신경망을 사용해 부분구조의 존재를 예측하고, 주어진 분자식으로부터 생성된 후보 구조와 매칭함으로써 이를 실현한다. 이 방법은 OPCW 화학 물질 계열의 두 테스트 케이스에서 각각 88%와 71%의 정확도로 정답 구조를 상위 20개 이내로 순위 매기며, 식별 과정에서의 수작업을 크게 줄인다.

ABSTRACT

Chemical structure elucidation is a serious bottleneck in analytical chemistry today. We address the problem of identifying an unknown chemical threat given its mass spectrum and its chemical formula, a task which might take well trained chemists several days to complete. Given a chemical formula, there could be over a million possible candidate structures. We take a data driven approach to rank these structures by using neural networks to predict the presence of substructures given the mass spectrum, and matching these substructures to the candidate structures. Empirically, we evaluate our approach on a data set of chemical agents built for unknown chemical threat identification. We show that our substructure classifiers can attain over 90% micro F1-score, and we can find the correct structure among the top 20 candidates in 88% and 71% of test cases for two compound classes.

연구 동기 및 목표

  • 질량 분석 스펙트럼과 분자식으로부터의 수작업 화학 구조 해석(CSE)이 수일이 소요되는 분석 화학의 한계를 해결하기 위해.
  • 전문가의 개입 없이 부분구조 선택 및 걸러내기를 자동화하여 식별 워크플로우를 개선하기 위해.
  • 특히 화학무기무기금조약(CWC)에 포함된 화학 무기물질을 신속하고 정확하게 식별하기 위해.
  • 기계학습을 활용해 후보 구조를 효율적으로 순위 매기고, 단기 목록에 대해 후속 계산 검증을 가능하게 하기 위해.

제안 방법

  • 질량 스펙트럼만을 기반으로 화합물의 부분구조 존재 여부를 예측하기 위해 깊이 신경망을 훈련한다.
  • 수작업 스펙트럼 해석이 필요 없이 질량 스펙트럼 특징에서 부분구조 패턴을 데이터 기반으로 학습한다.
  • MOLGEN을 사용해 주어진 분자식으로부터 가능한 모든 후보 구조를 생성한다.
  • 신경망에서 예측된 부분구조를 후보 구조와 매칭하여 순위 매기기 위한 관련성 점수를 계산한다.
  • 다양한 기능기능기를 효과적으로 탐지하기 위해 각 화합물 계열당 1~2개의 대표 부분구조를 사용하는 다중 대표 부분구조 분류 기법을 적용한다.
  • 부분구조 매칭 신뢰도에 따라 후보 구조를 순위 매기고, OPCW VGWD 데이터베이스의 테스트 세트에서 상위-k 성능을 평가한다.

실험 결과

연구 질문

  • RQ1질량 스펙트럼 데이터만을 사용해 신경망이 알려지지 않은 화합물의 부분구조 존재 여부를 정확하게 예측할 수 있는가?
  • RQ2질량 스펙트럼에서의 부분구조 예측이 수백만 개의 후보 중에서 정답 화학 구조를 효과적으로 순위 매길 수 있는가?
  • RQ3다양한 대표 부분구조(예: 실릴화된 대비 비실릴화된 형태)의 포함이 모델 성능과 순위 정확도에 어떤 영향을 미치는가?
  • RQ4이 자동화 워크플로우가 화학 구조 해석에서 전문가 개입의 필요성을 얼마나 줄일 수 있는가?
  • RQ5수작업 필터링과 화학자 주도의 부분구조 선택에 의존하는 전통적 접근 방식과 비교해 이 방법은 어떻게 다른가?

주요 결과

  • 부분구조 분류기는 테스트 데이터에서 90% 이상의 마이크로 F1 스코어를 기록하여 강력한 예측 성능를 입증했다.
  • PPTN 화합물 계열의 경우, 정답 구조가 상위 20개 후보 내에 포함된 경우가 테스트 케이스의 88%에 달했다.
  • PPN 화합물 계열의 경우, 정답 구조가 상위 20개 내에 포함된 경우가 테스트 케이스의 71%에 달했다.
  • 두 개의 대표 부분구조(예: 실릴화된 변형 포함)를 사용함으로써 복잡한 기능기능기를 가진 화합물의 순위 정확도가 뚜렷이 향상되었다.
  • 대부분의 경우 후보 목록이 20개 이하로 줄어들어 시뮬레이션 또는 NMR을 통한 효율적인 후속 검증이 가능해졌다.
  • 서포트 벡터 머신은 신경망보다 성능이 열등했으며, PPTN(2개 대표)의 경우 F1 스코어 69.4%를 기록한 데 비해, 신경망은 87.8%의 F1 스코어를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.