[논문 리뷰] Testing for differential abundance in compositional counts data, with application to microbiome studies
이 논문은 구성형 마이크로바이옴 데이터에서 비차수적 방법인 DACOMP을 제안한다. 이 방법은 영점이 많은 카운트와 구성성 편향을 고려하여 차등 존재량을 탐지한다. 기준 종을 가정하여 비차등 존재량을 가진 것으로 간주함으로써, 높은 영점 비율이 존재하는 상황에서도 타당한 추론을 제공하며, 시뮬레이션 및 실제 데이터셋(크로운 병, 인간 마이크로바이옴 프로젝트, 스파이크인 실험 포함)에서 기존 방법보다 거짓 양성률을 낮추는 데 성공한다.
Identifying which taxa in our microbiota are associated with traits of interest is important for advancing science and health. However, the identification is challenging because the measured vector of taxa counts (by amplicon sequencing) is compositional, so a change in the abundance of one taxon in the microbiota induces a change in the number of sequenced counts across all taxa. The data is typically sparse, with zero counts present either due to biological variance or limited sequencing depth (technical zeros). For low abundance taxa, the chance for technical zeros is non-negligible. We show that existing methods designed to identify differential abundance for compositional data may have an inflated number of false positives due to improper handling of the zero counts. We introduce a novel non-parametric approach which provides valid inference even when the fraction of zero counts is substantial. Our approach uses a set of reference taxa that are non-differentially abundant, which can be estimated from the data or from outside information. We show the usefulness of our approach via simulations, as well as on three different data sets: a Crohn's disease study, the Human Microbiome Project, and an experiment with 'spiked-in' bacteria.
연구 동기 및 목표
- 구성형 마이크로바이옴 데이터에서 영점 수를 적절히 다루지 못해 발생하는 과도한 거짓 양성률 문제를 해결하기 위해.
- 특히 저발현 종에 대해 영점 비율이 높을 경우에도 통계적 추론이 타당하게 유지되는 방법을 개발하기 위해.
- 비모수적 분포를 가정하지 않고 기준 종을 활용하여 구성성 편향을 보정하는 강력한 비차수적 접근법을 제공하기 위해.
- 실제 마이크로바이옴 데이터셋(스파이크인 실험 포함)에서 알려진 차등 존재량 패턴을 가진 데이터에 대해 방법의 성능을 평가하기 위해.
- 실제 마이크로바이옴 연구에 활용 가능한 공개된 R 패키지(dacomp)를 제공하기 위해.
제안 방법
- 기준 종을 사용하며, 이는 데이터로부터 추정하거나 외부에서 제공받을 수 있다.
- 각 테스트 대상 종의 상대적 존재량을 기준 종과 비교하기 위해 비차수적 검정(예: 윌콕슨 순위합 검정 또는 스피어만 상관계수)을 적용한다.
- 검정 통계량은 각 종의 기준 종에 대한 로그비율과 관심 있는 군집 또는 연속형 특성 간 순위 상관계수 기반이다.
- 기준 종을 사용하여 구성성 기반을 정의함으로써 정규화를 달성하여 구성성에 의해 유도되는 잘못된 상관관계를 감소시킨다.
- 영점 카운트는 이론적 또는 기술적 영점으로 간주하여 데이터를 왜곡시키는 임퓨티션 또는 변환 없이 처리한다.
- 다중 검정 보정은 거짓 발견률 q=0.1에서 벤자민리 Hochberg 절차를 사용한다.
실험 결과
연구 질문
- RQ1높은 영점 비율과 구성성 편향이 있는 마이크로바이옴 데이터에서 비차수적 방법이 차등 존재량을 효과적으로 탐지할 수 있는가?
- RQ2기준 종을 사용함으로써 구성성 무시 방법보다 차등 존재량 테스팅의 타당성이 향상되는가?
- RQ3ALDEx2, TSS, CSS, CLR 변환과 같은 기존 방법과 비교해 DACOMP는 거짓 양성률 통제에서 어떻게 성능을 발휘하는가?
- RQ4진짜로 차등 존재량이 알려진 스파이크인 실험에서 DACOMP는 알려진 차등 존재량 종을 신뢰성 있게 탐지할 수 있는가?
- RQ5크로운 병 연구 및 인간 마이크로바이옴 프로젝트와 같은 실제 데이터셋에서 DACOMP는 유의수준을 유지하면서도 통계적 검정력을 유지하는가?
주요 결과
- ALDEx2, TSS, CSS, CLR 변환과 같은 기존 방법과 비교해 DACOMP는 영점 비율이 높을수록 거짓 양성률을 크게 감소시켰다.
- 스파이크인 실험에서 DACOMP는 높은 정밀도로 두 개의 차등 존재량 종(Rhizobium radiobacter와 Alicyclobacillus acidiphilus)을 정확히 식별했으며, 다른 방법들은 거짓 양성률이 높았다.
- 영점 비율이 최대 90%에 이르는 상황에서도 DACOMP는 타당한 제1종 오류 통제를 유지했으며, 파라미터 기반 및 변환 기반 접근법보다 뛰어난 성능을 보였다.
- 크로운 병 데이터셋 분석에서 DACOMP는 ALDEx2 및 기타 방법보다 더 높은 특이도로 생물학적으로 의미 있는 종을 탐지했다.
- 인간 마이크로바이옴 프로젝트 데이터셋 분석 결과, DACOMP는 다른 방법보다 더 일관되게 숙주 형질과 관련된 알려진 미생물 연관성을 식별했다.
- R 패키지 'dacomp'는 성공적으로 구현되어 공개되었으며, 마이크로바이옴 연구에서의 재현 가능하고 접근 가능한 방법 적용을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.