[논문 리뷰] Neural Architecture Search for Joint Optimization of Predictive Power and Biological Knowledge
BioNAS는 유전체 분석을 위한 딥러닝 모델에서 예측 성능과 생물학적 지식 일관성을 동시에 최적화하는 신경망 아키텍처 탐색 프레임워크이다. 지식 불일치 함수를 통합함으로써 BioNAS는 예측 가능성이 높고 해석 가능한 컨볼루션 신경망 아키텍처를 발견하며, 이는 기존의 in vitro 데이터를 초월해 U2AF2 3′-스プライ싱 사이트 패턴과 같은 새로운 조절 모티프를 드러낸다. 이는 기능 유전체학에서 모델의 해석 가능성과 생물학적 통찰을 향상시킨다.
We report a neural architecture search framework, BioNAS, that is tailored for biomedical researchers to easily build, evaluate, and uncover novel knowledge from interpretable deep learning models. The introduction of knowledge dissimilarity functions in BioNAS enables the joint optimization of predictive power and biological knowledge through searching architectures in a model space. By optimizing the consistency with existing knowledge, we demonstrate that BioNAS optimal models reveal novel knowledge in both simulated data and in real data of functional genomics. BioNAS provides a useful tool for domain experts to inject their prior belief into automated machine learning and therefore making deep learning easily accessible to practitioners. BioNAS is available at https://github.com/zj-zhang/BioNAS-pub.
연구 동기 및 목표
- 딥러닝의 흑박 상자 성격을 해결하기 위해 생물학적 지식을 모델 탐색에 통합한다.
- 생명과학 연구자들이 딥러닝을 도입하는 데 있어 계산적 및 기술적 장벽을 낮춘다.
- 기존 실험 지식과의 일관성을 최적화함으로써 새로운 생물학적 지식을 발견할 수 있도록 한다.
- 유전자 서열 분석을 위한 컨볼루션 신경망 아키텍처에서 예측 정확도와 해석 가능성의 균형을 맞춘다.
- 학습된 필터에 알려진 및 새로운 모티프를 주석 처리함으로써 후속 생물학적 해석을 촉진한다.
제안 방법
- 기존 생물학적 지식과 모델이 학습한 필터 간 일관성을 측정하기 위한 일반적인 지식 불일치 함수의 가족을 도입한다.
- 검증 손실과 지식 불일치를 동시에 최적화하는 컨트롤러 기반 신경망 아키텍처 탐색(NAS) 프레임워크를 구축한다.
- 일련의 염기서열을 one-hot 인코딩하여 컨볼루션 신경망에 입력함으로써 시퀀스 특성의 엔드 투 엔드 학습을 수행한다.
- 기존 RBP 결합 패턴과의 모티프 매칭을 통해 훈련된 컨볼루션 필터를 생물학적으로 해석 가능한 모티프로 디코딩한다.
- eCLIP(실시간 결합) 데이터와 RNAcompete(체외) 데이터를 활용해 기존 지식을 검증하고 확장한다.
- 9개의 레이어를 기반으로 총 1,166,400개의 아키텍처를 포함하는 탐색 공간을 구성하여 높은 해석 가능성과 성능을 갖춘 다양한 모델 구성 탐색
실험 결과
연구 질문
- RQ1생물학적 지식으로 유도된 신경망 아키텍처 탐색은 예측 성능을 희생시키지 않고도 모델의 해석 가능성 향상에 효과적으로 기여할 수 있는가?
- RQ2기존 실험 지식(예: RNAcompete에서의 데이터)을 어떻게 체계적으로 유전체학 딥러닝 모델 탐색에 통합할 수 있는가?
- RQ3eCLIP과 같은 실시간 데이터를 활용함으로써 기존의 in vitro 실험에 존재하지 않는 새로운 생물학적 모티프를 BioNAS가 발견할 수 있는가?
- RQ4지식 기반 아키텍처 탐색은 첫 번째 컨볼루션 레이어의 필터가 갖는 생물학적 해석 가능성에 어느 정도 기여하는가?
- RQ5표준 학습 방법에서는 놓치는 바이오로지컬하게 의미 있는 시퀀스 패턴(예: 스플라이싱 신호)을 이 프레임워크가 드러낼 수 있는가?
주요 결과
- BioNAS는 in vitro RNAcompete 데이터에 존재하지 않지만 스플라이싱 정확도에 핵심적인 역할을 하는 eCLIP 데이터에서 U2AF2 3′-스プライ싱 사이트 패턴 AG를 성공적으로 발견하였다.
- U2AF2, QKI, RBFOX2, RBM5에 대해 학습된 모델의 모티프는 기존 RNAcompete 모티프와 높은 유사성을 보였으며, 동시에 새로운 주변 서열 선호도를 드러내었다.
- 지식 불일치와 검증 손실이 훈련 반복 과정에서 감소함에 따라, 예측 능력과 지식 일관성의 효과적인 동시 최적화가 이루어졌음을 시사한다.
- BioNAS 최적 모델은 높은 예측 성능를 확보하면서도 생물학적 기능을 주석 처리할 수 있는 해석 가능한 필터를 생성하였다.
- 실시간 데이터와 이전의 in vitro 지식을 융합함으로써, 스플라이싱 신호와 같은 생물학적으로 관련성이 있는 패턴을 발견할 수 있었다.
- 지식 기반 아키텍처 탐색을 통합하지 않으면 발견되지 않았을 새로운 조절 모티프를 BioNAS가 드러내내는 능력을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.