Skip to main content
QUICK REVIEW

[논문 리뷰] BERT Learns (and Teaches) Chemistry

Josh Payne, M. Sammer Srouji|arXiv (Cornell University)|2020. 07. 11.
Machine Learning in Materials Science참고 문헌 34인용 수 21
한 줄 요약

이 논문은 분자의 SMILES 문자열 표현을 사용하여 BERT를 활용해 도메인 전문 지식에 의존하지 않고도 화학적으로 관련성이 있는 서브스트럭처(예: 기능기 등)를 주의 메커니즘 분석을 통해 자동으로 식별하는 방법을 제안한다. BERT의 주의 헤드가 성질에 영향을 미치는 서브스트럭처를 강조함을 입증하였으며, 용해도, 약물 유사성, 합성 가능성 등의 작업에 대해 BERT를 피지터링하면 해석 가능하고 화학적으로 의미 있는 주의 패턴을 얻을 수 있다. 특히 용해도 예측에서 뚜렷한 성과를 보였다.

ABSTRACT

Modern computational organic chemistry is becoming increasingly data-driven. There remain a large number of important unsolved problems in this area such as product prediction given reactants, drug discovery, and metric-optimized molecule synthesis, but efforts to solve these problems using machine learning have also increased in recent years. In this work, we propose the use of attention to study functional groups and other property-impacting molecular substructures from a data-driven perspective, using a transformer-based model (BERT) on datasets of string representations of molecules and analyzing the behavior of its attention heads. We then apply the representations of functional groups and atoms learned by the model to tackle problems of toxicity, solubility, drug-likeness, and synthesis accessibility on smaller datasets using the learned representations as features for graph convolution and attention models on the graph structure of molecules, as well as fine-tuning of BERT. Finally, we propose the use of attention visualization as a helpful tool for chemistry practitioners and students to quickly identify important substructures in various chemical properties.

연구 동기 및 목표

  • 수동으로 설정된 규칙나 도메인 전문 지식에 의존하지 않고 데이터 기반 방식으로 분자의 화학적으로 중요한 서브스트럭처를 식별하는 것.
  • BERT의 주의 메커니즘이 용해도, 독성, 약물 유사성 등의 분자 성질에 영향을 미치는 기능기를 자동으로 강조할 수 있는지 탐색하는 것.
  • 그래프 신경망의 입력 특징으로서 BERT가 학습한 표현을 활용하거나, 하류 화학 회귀 작업에 대해 BERT를 피지터링할 때의 유용성을 평가하는 것.
  • 화학자들이 분자 성질의 핵심 서브스트럭처를 식별하는 데 실용적인 해석 가능성 도구로 주의 시각화를 개발하는 것.
  • 대규모 SMILES 데이터에서 사전 훈련을 통해 BERT가 표준 원자 특징화를 초월해 화학적으로 의미 있는 표현을 학습할 수 있는지 조사하는 것.

제안 방법

  • 분자의 SMILES 문자열 데이터셋을 대규모로 활용해 BERT를 훈련하여 원자 및 서브스트럭처의 문맥적 표현을 학습하는 것.
  • 예측 작업 중에 어떤 원자나 서브스트럭처가 높은 주의를 받는지 분석하기 위해 BERT의 각 레이어에서 주의 헤드를 분석하는 것.
  • 분자 그래프에서 그래프 컨볼루션 및 자기 주의 모델에 BERT로 학습한 표현을 입력 특징으로 사용하여 용해도, 약물 유사성, 합성 가능성 예측을 수행하는 것.
  • ZINC15 데이터셋을 사용해 QED, SAS, 용해도 등의 회귀 작업에 대해 BERT를 직접 피지터링하여 성능과 주의 행동을 평가하는 것.
  • 주의 행렬을 시각화하여 특정 화학 성질에 가장 영향을 미치는 분자의 조각이 무엇인지 해석하는 것.
  • 동일한 분자의 다양한 SMILES 표현 간에 일관된 임베딩을 학습하도록 유도하기 위해 대비 손실(contrastive loss)을 제안하는 것.

실험 결과

연구 질문

  • RQ1BERT의 주의 메커니즘이 사전 도메인 지식 없이도 분자 내에서 화학적으로 관련성이 있는 서브스트럭처를 자동으로 식별할 수 있는가?
  • RQ2BERT가 학습한 표현은 용해도, 약물 유사성, 합성 가능성 등의 분자 성질 예측 작업에서 성능 향상에 기여하는가?
  • RQ3다른 화학 회귀 작업에 대해 피지터링할 경우 BERT의 주의 패턴은 어떻게 변화하는가?
  • RQ4주의 시각화가 화학자들이 분자 성질의 핵심 기능기를 식별하는 데 실용적인 해석 가능성 도구로 기능할 수 있는가?
  • RQ5대규모 SMILES 데이터에서의 사전 훈련이 표준 원자 특징화를 초월해 더 강력하고 화학적으로 의미 있는 표현을 제공하는가?

주요 결과

  • 특히 용해도에 대해 피지터링한 후 BERT의 주의 헤드가 알려진 성질에 영향을 미치는 서브스트럭처를 직관적으로 강조함으로써 의미 있는 패턴 인식이 가능하다는 것을 보여주었다.
  • BERT를 회귀 작업에 대해 피지터링하면 무작위 가중치로 학습하는 것보다 성능이 향상되었으며, 이는 사전 훈련이 유용한 인덕티브 바이어스를 제공한다는 것을 시사한다.
  • 다양한 작업 간 주의 패턴은 대부분 유사하지만, 용해도 작업의 경우 레이어 10과 11에서 뚜렷한 차이를 보여, 작업별로 주의 학습 방식이 다를 수 있음을 나타낸다.
  • 학습된 임베딩이 표준 원자 특징화보다 성능 면에서 열등하여 분자 그래프 정보를 완전히 포괄하지 못하는 한계가 있음을 시사한다.
  • 성능 향상이 제한적이지만, 주의 시각화를 통해 이해 가능하고 화학적으로 타당한 서브스트럭처 강조가 이루어졌으며, 이는 해석 가능성 도구로의 활용 가능성을 뒷받침한다.
  • 저자들은 BERT의 어휘에 포함되지 않은 희귀 원자가 영향을 미치지 않음을 관찰하여, 어휘 제한에 대한 강건성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.