Skip to main content
QUICK REVIEW

[논문 리뷰] Discovering Molecular Functional Groups Using Graph Convolutional Neural Networks

Phillip B. Pope, Soheil Kolouri|arXiv (Cornell University)|2018. 12. 01.
Computational Drug Discovery Methods인용 수 12
한 줄 요약

이 논문은 독성 또는 혈뇌장벽 침투성과 같은 특정 화학적 성질을 담당하는 분자의 기능기들을 자동으로 발견하기 위해 설명 가능성 기법을 GCNN에 적응시킨 그래프 컬러션 신경망(GCNN) 기반 프레임워크를 제안한다. Grad-CAM은 가장 높은 대비력과 가장 정확한 기능기 위치 특정 능력을 보이며, 실험적 테스트 없이 기존 및 신규 구조를 데이터 기반으로 발견할 수 있게 한다.

ABSTRACT

Functional groups (FGs) are molecular substructures that are served as a foundation for analyzing and predicting chemical properties of molecules. Automatic discovery of FGs will impact various fields of research, including medicinal chemistry and material sciences, by reducing the amount of lab experiments required for discovery or synthesis of new molecules. In this paper, we investigate methods based on graph convolutional neural networks (GCNNs) for localizing FGs that contribute to specific chemical properties of interest. In our framework, molecules are modeled as undirected relational graphs with atoms as nodes and bonds as edges. Using this relational graph structure, we trained GCNNs in a supervised way on experimentally-validated molecular training sets to predict specific chemical properties, e.g., toxicity. Upon learning a GCNN, we analyzed its activation patterns to automatically identify FGs using four different explainability methods that we have developed: gradient-based saliency maps, Class Activation Mapping (CAM), gradient-weighted CAM (Grad-CAM), and Excitation Back-Propagation. Although these methods are originally derived for convolutional neural networks (CNNs), we adapt them to develop the corresponding suitable versions for GCNNs. We evaluated the contrastive power of these methods with respect to the specificity of the identified molecular substructures and their relevance for chemical functions. Grad-CAM had the highest contrastive power and generated qualitatively the best FGs. This work paves the way for automatic analysis and design of new molecules.

연구 동기 및 목표

  • 비용이 많이 들는 실험적 절차에 의존하지 않고 데이터 기반의 자동 기능기 탐색 방법을 개발하기 위해.
  • 화학적 그래프에 적용된 그래프 컬러션 신경망(GCNN)에 대해 기존 컨볼루션 신경망(CNN)의 설명 가능성 기법을 적응시키기 위해.
  • 특정 분자 성질에 기여하는 화학적으로 관련 있는 부분구조를 식별하는 데 다수의 설명 가능성 기법을 평가하고 비교하기 위해.
  • 화학 및 약물 설계 분야에서 기능기 탐색을 위한 전통적 실험 방법의 확장 가능한 자동 대체 방법을 제공하기 위해.
  • 모델의 해석 가능성성을 통해 독성 또는 용해도와 같은 성질에 영향을 주는 새로운 또는 알려진 기능기를 식별할 수 있도록 하기 위해.

제안 방법

  • 원자는 노드로, 결합은 간선으로 구성된 무방향 관계 그래프로 분자를 표현한다.
  • 독성 또는 혈뇌장벽 침투성과 같은 특정 화학적 성질을 예측하기 위해 실험적으로 검증된 분자 데이터셋을 기반으로 GCNN을 지도학습 방식으로 훈련한다.
  • 기울기 기반 활성도 지도, 클래스 활성도 맵(CAM), Grad-CAM, 자극 역전파(EB)의 네 가지 설명 가능성 기법을 GCNN에 적응시켜 관련 분자 부분구조를 국소화한다.
  • 이 기법들은 예측에 기여하는 원자 수준 기여도를 강조하는 활성도 지도를 생성하며, 이를 집계하여 반복되는 부분구조를 식별한다.
  • 서브스트럭처는 빈도 기반 비율 지표 $ R_e $ 를 사용해 설명 내에서 랭킹되며, 알려진 양성 레이블과의 비교를 위해 $ R_p $ 를 사용해 관련성 평가를 수행한다.
  • 해석 품질과 특이성의 정량적 평가를 위해 충실도, 대비력, 희박성 지표를 사용해 모델 성능을 평가한다.

실험 결과

연구 질문

  • RQ1GCNN에 적응된 설명 가능성 기법이 특정 화학적 성질을 담당하는 분자 부분구조를 효과적으로 국소화할 수 있는가?
  • RQ2CAM, Grad-CAM, EB 또는 c-EB 중에서 어떤 기법이 다양한 분자 성질에 대해 가장 대비력 있고 특이적인 부분구조 설명을 생성하는가?
  • RQ3제안된 방법은 사전 화학 지식 없이도 할로젠, 아미드 또는 방향족 고리와 같은 알려진 기능기를 자동으로 탐지할 수 있는가?
  • RQ4충실도, 대비력, 희박성 지표가 식별된 부분구조의 해석 가능성과 화학적 관련성과 어떻게 상관되는가?
  • RQ5이 프레임워크는 실험적으로 검증될 수 있는 새로운 또는 잠재적으로 관련 있는 기능기를 식별할 수 있는가?

주요 결과

  • Grad-CAM은 모든 데이터셋에서 CAM, EB, c-EB를 앞서는 가장 높은 대비력과 가장 우수한 질적 기능기 설명을 제공하였다.
  • 메서드는 알려진 기능기를 성공적으로 식별하였다: BBBP에 대해 CF3, BACE에 대해 아미드, TOX21에 대해 방향족 고리로, 이는 화학적 관련성을 입증하였다.
  • Grad-CAM의 대비력 스코어는 BBBP에서 0.01 ± 0.07, BACE에서 0.0 ± 0.0, TOX21에서 0.01 ± 0.11을 기록하여 부분구조 국소화의 높은 특이성을 나타내었다.
  • c-EB는 더 희박한 활성도를 보였음(희박성: BBBP에서 40.54 ± 21.69) 그러나 과도하게 희박한 출력으로 인해 벤젠 고리 전체를 포착하지 못해 희박성과의 상충 관계가 드러났다.
  • Grad-CAM의 충실도 스코어는 BBBP에서 41.06 ± 19.05, BACE에서 29.22 ± 14.04, TOX21에서 44.03 ± 23.7로, 예측에 대한 설명의 중간에서 높은 충실도를 보였다.
  • $ R_e $ 를 기준으로 상위 10개의 주요 서브스트럭처에는 할로젠과 아미드와 같은 알려진 약리학적 핵심 구조가 포함되어 있어, 이 방법이 생물학적으로 관련된 패턴을 회복할 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.