Skip to main content
QUICK REVIEW

[논문 리뷰] Peak Detection On Data Independent Acquisition Mass Spectrometry Data With Semisupervised Convolutional Transformers

Leon L. Xu, Hannes Röst|arXiv (Cornell University)|2020. 10. 26.
Mass Spectrometry Techniques and Applications인용 수 4
한 줄 요약

이 논문은 데이터 독립적 분석(DIA) LC-MS 데이터에서 피크 검출을 위한 준지도 학습형 컨volution 신경망과 트랜스포머의 조합 모델을 제안한다. 이 모델은 국소적 특징 추출을 위해 컨volution 신경망(CNN)을, 다변량 시계열에서 장거리 상관관계를 포착하기 위해 자기주의 기반 메커니즘을 결합한다. 제안된 방법은 기준 DIA 데이터셋에서 최신 기술 수준의 성능을 달성하여 기준 신경망 모델을 능가하고, 수작업 주석을 기준으로 한 기존 자동 피크 검출 도구와 동등하거나 이를 초월한다.

ABSTRACT

Liquid Chromatography coupled to Mass Spectrometry (LC-MS) based methods are commonly used for high-throughput, quantitative measurements of the proteome (i.e. the set of all proteins in a sample at a given time). Targeted LC-MS produces data in the form of a two-dimensional time series spectrum, with the mass to charge ratio of analytes (m/z) on one axis, and the retention time from the chromatography on the other. The elution of a peptide of interest produces highly specific patterns across multiple fragment ion traces (extracted ion chromatograms, or XICs). In this paper, we formulate this peak detection problem as a multivariate time series segmentation problem, and propose a novel approach based on the Transformer architecture. Here we augment Transformers, which are capable of capturing long distance dependencies with a global view, with Convolutional Neural Networks (CNNs), which can capture local context important to the task at hand, in the form of Transformers with Convolutional Self-Attention. We further train this model in a semisupervised manner by adapting state of the art semisupervised image classification techniques for multi-channel time series data. Experiments on a representative LC-MS dataset are benchmarked using manual annotations to showcase the encouraging performance of our method; it outperforms baseline neural network architectures and is competitive against the current state of the art in automated peak detection.

연구 동기 및 목표

  • 복잡하고 고차원적인 DIA LC-MS 데이터에서 정확한 피크 검출 문제를 해결함으로써 정량 프로테오믹스에 기여하고자 한다.
  • 딥 러닝 모델을 향상시키기 위해 트랜스포머의 자기주의 기반 전역 시퀀스 모델링과 컨볼루션 레이어를 통한 국소 맥락 모델링을 통합하고자 한다.
  • 컴퓨터 비전 분야에서의 준지도 학습 기법을 다변량 시계열에 적용하여 제한된 레이블 데이터를 효과적으로 활용하고자 한다.
  • 기본 신경망 아키텍처를 능가하고 실제 DIA 데이터셋에서 최신 기술 수준의 자동 피크 검출 성능을 달성하는 방법을 개발하고자 한다.

제안 방법

  • 모델는 국소적 및 장거리 의존성을 동시에 모델링하기 위해 컨볼루션 레이어와 자기주의 기반 메커니즘을 조합한 하이브리드 아키텍처를 사용하며, 이를 '컨볼루션 자기주의'라고 명명한다.
  • 피크 검출을 다변량 시계열 분할 문제로 설정하며, 각 채널은 특정 m/z 값에 대한 추출 이온 크로마토그램(XIC)에 해당한다.
  • 모델는 준지도 학습 방식으로 학습되며, 수작업 주석이 달린 레이블 데이터와 대량의 레이블이 없는 데이터를 조합하여 일반화 능력을 향상시킨다.
  • 저자는 컴퓨터 비전 분야에서 최신 기술인 일관성 정규화 및 가짜 레이블링 기법을 다중채널 시계열 환경에 적응시켜 적용한다.
  • 시간적 관계를 모델링하기 위해 학습 가능한 위치 인코딩을 사용한 멀티헤드 자기주의를 활용한다.
  • 최종 출력은 각 XIC에 대한 피크 분할 결과와 모델의 주의 메커니즘 및 분류 헤드에서 유도된 신뢰도 점수로 구성된다.

실험 결과

연구 질문

  • RQ1기존의 딥 러닝 모델과 비교해 복합적인 컨볼루션-트랜스포머 아키텍처가 DIA LC-MS 데이터에서 피크 검출 성능을 향상시킬 수 있는가?
  • RQ2컴퓨터 비전 분야에서의 준지도 학습 기법이 프로테오믹스의 다변량 시계열에 효과적으로 적용될 수 있는가?
  • RQ3국소적(컨볼루션) 및 전역적(자기주의) 모델링의 통합이 DIA 데이터에서 복잡하고 겹치는 펩타이드 신호를 더 잘 탐지할 수 있는가?
  • RQ4기준 데이터셋에서 제안된 방법이 기존 최신 기술 수준의 피크 검출 도구와 정밀도, 재현율, F1 점수 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 방법은 대표적인 DIA LC-MS 데이터셋에서 기준 신경망 아키텍처보다 피크 검출 정확도에서 뛰어난 성능을 보였다.
  • 수작업 주석을 기준으로 한 F1 점수 측정 결과, 현재 최신 기술 수준의 자동 피크 검출 성능과 경쟁 가능했으며, 일부 경우를 제외하고는 이를 초월했다.
  • 준지도 학습 전략이 레이블 데이터가 제한된 상황에서 모델의 일반화 능력을 크게 향상시켰다.
  • 컨볼루션 레이어와 자기주의의 통합은 보다 정교한 시간적 패턴과 보다 넓은 시간 범위의 의존성 모델링을 가능하게 하였다.
  • 노이즈와 겹치는 피크에 대한 강건성도 입증되었으며, 이는 DIA 데이터에서 흔한 과제이다.
  • 제거 실험 결과, 컨볼루션 및 자기주의 구성 요소 모두가 최종 성능에 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.