Skip to main content
QUICK REVIEW

[논문 리뷰] A Mixed-effects Model for Incomplete Data With Batch-Level Abundance-Dependent Missing-Data Mechanism

Lin S. Chen, Jiebiao Wang|arXiv (Cornell University)|2016. 01. 23.
Statistical Methods and Inference참고 문헌 22인용 수 3
한 줄 요약

이 논문은 iTRAQ 단백질체 분석에서 배치 효과와 새로운 배치 수준의 농도 의존성 결측 데이터 메커니즘(BADMM)을 동시에 고려하는 혼합효과 모델인 mixEMM을 제안한다. 결측 확률을 지수 연결 함수를 통해 배치 수준 단백질 농도의 함수로 명시적으로 모델링함으로써, 결측 메커니즘을 忽시하거나 상대 농도에 의존하는 전통적 방법에 비해 모수 추정 정확도와 통계적 검정력이 향상된다.

ABSTRACT

In mass spectrometry based quantitative proteomics research, the emerging iTRAQ technique has been widely adopted for high throughput protein profiling, as it enables one to measure multiple samples simultaneously in one multiplex experiment and thus greatly enhances the throughput of protein quantification. However, the technical variation across different iTRAQ multiplex experiments is often large due to the dynamic nature of MS instruments. This leads to strong batch effects in the iTRAQ data. Moreover, the iTRAQ data often contain substantial batch-level non-ignorable missingness. Specifically, the abundance measures of a given protein/peptide are often missing altogether in all the samples from the same batch, with the missing probability depending on the combined batch-level abundances. We term this unique missing-data mechanism as the Batch-level Abundance-Dependent Missing-data mechanism (BADMM). We introduce a new method, mixEMM, for analyzing iTRAQ data with batch effects and batch-level non-ignorable missingness. The mixEMM method employs a linear mixed-effects model and explicitly models the batch effects and the BADMM in the likelihood function. With simulation studies, we showed that compared with existing approaches that utilize relative abundances and ignore the missing batches under the missing completely at random assumption, the mixEMM method achieves more accurate parameter estimation and inference.We applied the method to an iTRAQ proteomics data from a breast cancer study and identified phosphopeptides differentially expressed between different breast cancer subtypes. The method can be applied to general clustered data with cluster level non ignorable missing-data mechanisms.

연구 동기 및 목표

  • iTRAQ 기반 정량 단백질체 분석 실험에서 배치 효과와 무시할 수 없는 결측성 문제를 해결하기 위해.
  • 전체 배치의 단백질 측정치가 배치 수준의 총 농도에 기반해 결측되는 고유한 결측 데이터 메커니즘인 배치 수준 농도 의존성 결측 메커니즘(BADMM)을 모델링하기 위해.
  • likelihood 기반 혼합효과 모델에 BADMM을 명시적으로 통합함으로써 통계적 추론을 향상시키고, 모수 추정 정확도와 검정력을 높이기 위해.
  • 군집 수준에서 무시할 수 없는 결측이 발생하는 군집화된 데이터에 일반화 가능한 프레임워크를 제공하기 위해. 단백질체를 초월한 응용에도 적용 가능하다.

제안 방법

  • 랜덤 배치 효과와 표현형 변수의 고정 효과를 고려하기 위해 선형 혼합효과 모델을 사용한다.
  • 배치 수준 평균 농도의 지수 연결 함수를 사용하여 배치의 결측 확률을 모델링함으로써 BADMM을 기록한다.
  • 결측 데이터와 랜덤 효과를 동시에 처리하기 위해 최대우도추정(MLE)을 계산하기 위해 기대-조건부 최대화(ECM) 알고리즘을 사용한다.
  • 결측 데이터 메커니즘을 통합함으로써 무시할 수 없는 결측성 하에서 유효한 추론이 가능하도록 가능도 함수를 설정한다.
  • 유연성 확보를 위해 로짓 함수와 같은 대체 연결 함수도 탐색하지만, 계산 효율성을 고려해 지수 함수를 우선 선택한다.
  • 다변량 분석으로의 확장이 가능하며, 펩타이드 수준 또는 단백질 수준에 적용 가능하며, 펩타이드 수준 결과를 단백질 수준 추론으로 요약할 수 있는 옵션을 제공한다.

실험 결과

연구 질문

  • RQ1BADMM을 명시적으로 모델링함으로써 기존의 결측 메커니즘 忽시 또는 상대 농도에 의존하는 방법에 비해 iTRAQ 단백질체 데이터에서 모수 추정 정확도가 어떻게 향상되는가?
  • RQ2배치 수준의 결측이 농도에 의존하고 빈도가 높을 경우, mixEMM 방법이 차등 발현 분석에서 통계적 검정력과 편향을 유지할 수 있는가?
  • RQ3상대 농도를 사용하고 무시할 수 있는 결측을 가정하는 전통적 접근법에 비해 mixEMM의 성능은 어떻게 비교되는가?
  • RQ4결측 데이터 메커니즘 모델링에 다양한 연결 함수(예: 지수 함수 대비 로짓 함수)를 사용할 경우, 추정 정확도와 계산 효율성에 어떤 영향을 미치는가?

주요 결과

  • 시뮬레이션 연구 결과, BADMM을 忽시하거나 상대 농도에 의존하는 전통적 방법에 비해 mixEMM는 유의미하게 더 정확한 모수 추정과 높은 통계적 검정력을 확보한다.
  • mixEMM는 배치 수준의 결측성과 분산 구조를 적절히 고려함으로써 차등 발현 검정에서 유형 I 및 유형 II 오류 비율을 감소시킨다.
  • BADMM에 대해 지수 연결 함수를 사용할 경우, 로짓 함수와 비교해 유사하거나 더 우수한 성능를 보이며 계산 비용이 크게 낮다.
  • CPTAC 유방암 인산화단백질체 데이터셋에서, mixEMM는 유방암 아형 간에 차등 발현하는 인산화 펩타이드를 더 높은 민감도와 정밀도로 식별했다.
  • 특히 결측이 배치 수준의 농도에 강하게 의존할 경우, 다양한 결측 비율과 농도 분포에 대해 강건한 성능를 보였다.
  • R 패키지인 mixEMM는 CRAN에 제공될 예정으로, 유사한 고 throughput 옹오믹스 데이터에 대해 군집화되고 완전하지 않은 구조를 가진 데이터에 광범위하게 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.