Skip to main content
QUICK REVIEW

[논문 리뷰] A mechanistically interpretable neural network for regulatory genomics

Alex M. Tseng, Gökçen Eraslan|arXiv (Cornell University)|2024. 10. 08.
Gene Regulatory Network AnalysisBiochemistry, Genetics and Molecular Biology인용 수 3
한 줄 요약

이 논문은 모티프와 그 문법적 관계를 학습 가능한 가중치와 활성화에 직접적으로 포함시켜 기계적 해석이 가능한 딥 뉴럴 네트워크인 ARGMINN를 소개한다. 필터 정규화를 통해 모티프 학습의 중복을 방지하고, 수정된 어텐션 메커니즘을 통해 즉각적인 모티프 인스턴스 탐지를 실현함으로써, ARGMINN는 완전히 해석 가능한 모티프 발견, 시퀀스 변동에 대한 강건성, 그리고 복잡한 조절 문법을 유지하면서도 전체 표현력을 확보한 채 기능적 새로운 시퀀스 생성이 가능하다.

ABSTRACT

Deep neural networks excel in mapping genomic DNA sequences to associated readouts (e.g., protein-DNA binding). Beyond prediction, the goal of these networks is to reveal to scientists the underlying motifs (and their syntax) which drive genome regulation. Traditional methods that extract motifs from convolutional filters suffer from the uninterpretable dispersion of information across filters and layers. Other methods which rely on importance scores can be unstable and unreliable. Instead, we designed a novel mechanistically interpretable architecture for regulatory genomics, where motifs and their syntax are directly encoded and readable from the learned weights and activations. We provide theoretical and empirical evidence of our architecture's full expressivity, while still being highly interpretable. Through several experiments, we show that our architecture excels in de novo motif discovery and motif instance calling, is robust to variable sequence contexts, and enables fully interpretable generation of novel functional sequences.

연구 동기 및 목표

  • 기존 딥 러닝 모델이 필터에 분산된 정보와 신뢰할 수 없는 중요도 점수로 인해 모티프 발견에 한계를 가진다는 점을 해결하기 위해.
  • 생물학적으로 의미 있는 모티프와 그 문법적 구성이 읽기 쉽게 해석 가능한 가중치와 활성화에 직접 인코딩된 신경망 아키텍처를 개발하기 위해.
  • 메커니즘적 해석 가능성을 포스트호크 분석 파이프라인 없이도 유지하면서도 복잡한 조절 문법을 위한 전체 표현력을 유지하기 위해.
  • 자연적 및 악성 시퀀스 변형에 걸쳐도 모티프 발견 및 인스턴스 호출에 강건성을 확보하기 위해.
  • 학습된 모티프 패턴을 바탕으로 기능적으로 타당하고 해석 가능한 DNA 시퀀스를 생성할 수 있는 새로운 능력을 입증하기 위해.

제안 방법

  • 첫 번째 컨볼루션 필터에서 비중복 모티프 학습을 강제하기 위한 필터 정규화를 통합한 새로운 아키텍처인 ARGMINN를 제안한다.
  • 단일 포워드 패스 내에서 모티프 인스턴스와 그 문법적 관계(예: 간격, 방향성)를 직접 노출하는 수정된 자기어텐션 메커니즘을 도입한다.
  • 모티프 겹침 정규화와 L1 희박성의 조합을 통한 손실 함수를 사용하여 독립적이고 생물학적으로 관련된 모티프 표현을 촉진한다.
  • TOMTOM을 사용하여 발견된 모티프를 알려진 위치 가중치 매트릭스(PWMs)와 정렬함으로써 모티프 해석 가능성의 정량적 평가를 가능하게 한다.
  • 생성된 시퀀스의 기능성을 검증하기 위해 ARGMINN 자체, Borzoi, 및 미세조정된 Enformer를 포함한 여러 오라클을 활용한다.
  • 엄격한 문법 규칙(예: 10bp 간격의 왼쪽-오른쪽 모티프 순서)을 가진 시뮬레이션된 REST 데이터셋을 사용하여 모델이 복잡한 조절 문법을 학습하고 표현하는 능력을 테스트한다.
Figure 1: Schematic of the ARGMINN architecture. a) The motif-scanner module produces activations denoting which motifs were found at each position, where activation magnitude reflects match strength. The activations are passed to the syntax builder, which learns higher-order logic between motif ins
Figure 1: Schematic of the ARGMINN architecture. a) The motif-scanner module produces activations denoting which motifs were found at each position, where activation magnitude reflects match strength. The activations are passed to the syntax builder, which learns higher-order logic between motif ins

실험 결과

연구 질문

  • RQ1모티프와 그 문법적 관계가 포스트호크 해석에 의존하지 않고도 학습된 가중치와 활성화에서 직접 읽을 수 있도록 하는 딥 뉴럴 네트워크 아키텍처를 설계할 수 있는가?
  • RQ2제안된 아키텍처가 비틀림 없는 간격과 방향성 의존성 포함 복잡한 조절 모티프와 문법 규칙을 위한 전체 표현력을 유지하는가?
  • RQ3모델의 모티프 발견 및 인스턴스 호출은 자연적 및 악성 시퀀스 변형에 대해 얼마나 강건한가?
  • RQ4학습된 모티프 패턴을 바탕으로 기능적으로 타당하고 해석 가능한 새로운 DNA 시퀀스를 생성할 수 있는가?
  • RQ5기존 방법과 비교할 때 모델의 해석 가능성은 안정성, 정확도 및 생물학적 관련성 측면에서 어떻게 평가되는가?

주요 결과

  • ARGMINN는 기존 방법에 비해 뛰어난 모티프 발견 능력과 모티프 인스턴스/문법 분석 성능를 확보하였으며, 진짜 모티프와 그 구성의 정확도가 매우 높았다.
  • 모델는 이중핵산 순서 뒤섞기 및 악성 편집과 같은 시퀀스 변형에 대해 강건성을 보였으며, 정확한 모티프 탐지를 유지했다.
  • ARGMINN는 완전히 해석 가능한 시퀀스 생성이 가능했다: 각 모티프 패턴당 100개의 새로운 시퀀스를 생성하였고, 모든 시퀀스가 ARGMINN, Borzoi, 및 미세조정된 Enformer를 포함한 다수의 독립 오라클에 의해 기능적일 것으로 예측되었다.
  • 시뮬레이션된 REST 데이터셋에서 ARGMINN는 정확한 결합 문법(10bp 간격의 왼쪽-오른쪽 모티프 순서)을 성공적으로 학습하였으며, 기준 모델 대비 더 높은 문법 충실도를 보였다.
  • 필터 정규화와 어텐션 메커니즘이 함께 작용하여 모티프가 비중복적이며 직접 해석 가능하도록 보장하였고, 복잡한 포스트호크 파이프라인의 필요 없이도 충분했다.
  • 100번의 학습 런에서 다양한 정규화 가중치를 적용하여 손실-가중치 강건성을 검증하였으며, 모든 설정에서 일관된 모티프 발견 성능를 확보했다.
Figure 2: Motif discovery. a) Example of SPI1 motifs discovered by ARGMINN, compared to interpreting the first-layer filters of a standard CNN, using ExplaiNN, and by clustering DeepLIFTShap importance scores using MoDISco. Note that MoDISco combines forward and reverse-complement orientations. b) F
Figure 2: Motif discovery. a) Example of SPI1 motifs discovered by ARGMINN, compared to interpreting the first-layer filters of a standard CNN, using ExplaiNN, and by clustering DeepLIFTShap importance scores using MoDISco. Note that MoDISco combines forward and reverse-complement orientations. b) F

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.