[논문 리뷰] Uncertainty Quantification in Multivariate Mixed Models for Mass Cytometry Data
이 논문은 질량세포측정 데이터에서 불확실성 정량화를 위해 이元의 포isson 로그정규 분포 혼합모형과 로지스틱 선형 혼합모형을 제안한다. 이는 원시 단세포 다변량 구조를 유지한다. 임신 연구에 적용된 결과, 제1기에서 제3기로 갈수록 단백질 간 상관관계가 증가하는 것으로 드러났으며, 혼란변수를 고려하고 요약기반 방법보다 더 높은 재현성을 확보하였다.
Mass cytometry technology enables the simultaneous measurement of over 40 proteins on single cells. This has helped immunologists to increase their understanding of heterogeneity, complexity, and lineage relationships of white blood cells. Current statistical methods often collapse the rich single-cell data into summary statistics before proceeding with downstream analysis, discarding the information in these multivariate datasets. In this article, our aim is to exhibit the use of statistical analyses on the raw, uncompressed data thus improving replicability, and exposing multivariate patterns and their associated uncertainty profiles. We show that multivariate generative models are a valid alternative to univariate hypothesis testing. We propose two models: a multivariate Poisson log-normal mixed model and a logistic linear mixed model. We show that these models are complementary and that either model can account for different confounders. We use Hamiltonian Monte Carlo to provide Bayesian uncertainty quantification. Our models applied to a recent pregnancy study successfully reproduce key findings while quantifying increased overall protein-to-protein correlations between first and third trimester.
연구 동기 및 목표
- 단세포 질량세포측정 데이터를 요약 통계치로 압축함으로써 발생하는 정보 손실 문제를 해결하기 위해.
- 다변량 의존성 구조를 유지하고 고차원 단세포 데이터의 불확실성을 정량화하는 통계모형을 개발하기 위해.
- 혼란변수(충돌 및 파이프 유형)를 혼합효과 구조를 사용해 모델링하여 강건성 향상을 위해.
- 다변량 생성모형이 단변량 가설검정보다 생물학적으로 의미 있는 패턴 탐지에 더 우수한 성능을 보이는지 확인하기 위해.
- 복잡한 실험 설계에서 재현 가능하고 불확실성 인식이 가능한 분석을 가능하게 하기 위해.
제안 방법
- 과분산과 마커 간 상관관계를 고려한 다변량 포isson 로그정규 혼합모형(PLMM)을 사용하여 카운트 데이터를 모델링한다.
- 기부자별 랜덤 효과를 포함한 로지스틱 선형 혼합모형(LLMM)을 사용하여 이진 마커 발현 상태를 모델링한다.
- 완전한 베이지안 사후분석 및 불확실성 정량화를 위해 하이퍼볼릭 몬테카를로(HMC)를 적용한다.
- 기부자 간 계층적 변동성을 고려하기 위해 기부자 및 샘플에 대한 랜덤 효과를 통합한다.
- 두 가지 상호보완적인 모형을 사용: 연속 카운트 데이터에 대한 PLMM와 이진 발현 상태에 대한 LLMM로, 혼란변수 탐지에 강건한 방법을 제공한다.
- 엔드 투 엔드 분석을 위한 두 개의 R 패키지—CytoGLMM와 cytoeffect—를 개발하였으며, 재현 가능한 비네트 및 자동 데이터 다운로드 기능을 포함한다.
실험 결과
연구 질문
- RQ1다변량 생성모형이 요약기반 접근법보다 원시 질량세포측정 데이터의 불확실성 정량화와 다변량 구조 유지에 더 효과적인가?
- RQ2임신 3개기 중 단백질 간 상관관계는 어떻게 변화하며, 이 변화는 불확실성 정량화를 통해 신뢰성 있게 측정될 수 있는가?
- RQ3충돌 및 파이프 혼란변수의 영향은 단세포 데이터의 차등 발현 분석에 어느 정도 미치며, 이를 어떻게 모델링할 수 있는가?
- RQ4HMC를 사용한 베이지안 혼합모형이 단변량 검정이나 중앙값 기반 요약보다 더 정확하고 재현 가능한 추론을 제공하는가?
- RQ5모형 선택(PLMM 대비 LLMM)은 복잡한 실험 설계에서 생물학적으로 의미 있는 패턴 탐지에 어떤 영향을 미치는가?
주요 결과
- 모형들은 원래의 임신 연구에서 확인된 주요 결과를 성공적으로 재현하였으며, 제3기에서 제1기보다 단백질 간 상관관계가 증가한 것으로 확인되었다.
- 다변량 포isson 로그정규 혼합모형(PLMM)은 단세포 마커 카운트의 과분산과 상관관계를 효과적으로 포착하였으며, 사후 점검 결과 대부분의 마커에 대해 적합도가 우수한 것으로 나타났다.
- 로지스틱 선형 혼합모형(LLMM)은 특정 마커의 발현이 낮거나 높은 세포집단에서 이진 마커 발현에 대해 강건한 추론을 제공하였다.
- PLMM는 16명의 기부자에 대해 18만 개의 세포를 8개의 CPU 코어로 6일 정도 소요하여 피팅한 것으로, 계산 비용이 주요 제약임을 시사한다.
- 1명의 기부자당 1,000개의 세포로 샘플링한 결과 고정효과와 표준편차에는 영향이 미미했지만, 상관관계 비교에는 더 큰 영향을 미쳐 전체 데이터 분석이 정확한 상관관계 추론을 위해 필수적임을 시사한다.
- 사후 모형 점검에서 일부 세포집단에서 pERK1/2에 대해 모형 적합도가 떨어지는 것으로 나타났으며, 향후 연구에서는 영향을 받는 영역에 대해 제로 과잉 확장 모형이 필요할 것으로 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.