Skip to main content
QUICK REVIEW

[논문 리뷰] Regression Analysis for Microbiome Compositional Data

Pixu Shi, Anru R. Zhang|arXiv (Cornell University)|2016. 03. 03.
Geochemistry and Geologic MappingComputer Science참고 문헌 23인용 수 16
한 줄 요약

이 논문은 조건부 회귀 프레임워크를 제안하여 조성비율이 1이 되는 마이크로바이옴 구성 데이터에 대해 선형 제약 조건을 회귀 계수에 도입함으로써 부분조합 일관성을 보장하고, 타당한 변수 선택과 추론을 가능하게 한다. 이 방법은 펜라이즈드 추정과 보정되지 않은 추론을 사용하여 渐近적으로 정규분포를 따르는, 신뢰구간을 적용할 수 있는 추정치를 생성하며, 식이 조절 후 *Oscillibacter* 가 체질량지수(BMI)와 관련이 있음을 밝혀낸다.

ABSTRACT

One important problem in microbiome analysis is to identify the bacterial taxa that are associated with a response, where the microbiome data are summarized as the composition of the bacterial taxa at different taxonomic levels. This paper considers regression analysis with such compositional data as covariates. In order to satisfy the subcompositional coherence of the results, linear models with a set of linear constraints on the regression coefficients are introduced. Such models allow regression analysis for subcompositions and include the log-contrast model for compositional covariates as a special case. A penalized estimation procedure for estimating the regression coefficients and for selecting variables under the linear constraints is developed. A method is also proposed to obtain de-biased estimates of the regression coefficients that are asymptotically unbiased and have a joint asymptotic multivariate normal distribution. This provides valid confidence intervals of the regression coefficients and can be used to obtain the $p$-values. Simulation results show the validity of the confidence intervals and smaller variances of the de-biased estimates when the linear constraints are imposed. The proposed methods are applied to a gut microbiome data set and identify four bacterial genera that are associated with the body mass index after adjusting for the total fat and caloric intakes.

연구 동기 및 목표

  • 비율의 합이 1이 되는 고차원의 구성 마이크로바이옴 데이터에서 회귀 분석의 과제를 해결하기 위해.
  • 부분조합 일관성(즉, 부분조합을 분석할 때 결과가 일관성을 유지함)을 확보하기 위해 회귀 계수에 선형 제약 조건을 도입하기 위해.
  • 고차원 설정에서 이러한 제약 조건 하에서 변수 선택을 위한 펜라이즈드 추정 절차를 개발하기 위해.
  • 점점 정규분포를 따르는 보정되지 않은 추정치를 제공하여 타당한 신뢰구간과 p-값을 가능하게 하기 위해.
  • 실제 장 마이크로바이옴 데이터에 이 방법을 적용하여 총 지방 및 칼로리 섭취량을 조절한 후 체질량지수(BMI)와 관련된 분류군을 규명하기 위해.

제안 방법

  • 부분조합 일관성을 보장하기 위해 회귀 계수에 선형 제약 조건을 도입하여, 로그-대비 모델을 일반화한다.
  • 고차원 변수 선택을 위해 제약 조건이 부여된 펜라이즈드 우도 접근법을 사용하며, Lasso 유형 정규화와 선형 등식 제약 조건을 결합한다.
  • 제약 조건이 있는 최적화 문제를 효율적으로 해결하기 위해 다중수단의 좌표 강하 방법을 적용한다.
  • 고차원 설정에서의 추정 편향을 보정하기 위한 보정 절차를 개발하여 점점 정규분포를 따르는 추정치를 도출한다.
  • 보정된 추정치를 효율적으로 계산하기 위해 볼록 최적화를 활용하며, 표준 하드웨어에서 p=100일 경우 약 36초, p=200일 경우 약 300초가 소요된다.
  • 보정된 추정치의 점점 정규분포 성질을 유도하여, 추론을 위한 신뢰구간과 p-값을 구성할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1조성비율이 1이 되는 마이크로바이옴 데이터에 대한 회귀 모델이 부분조합의 분석에서도 부분조합 일관성을 유지할 수 있는가?
  • RQ2고차원의 구성 데이터에서 회귀 계수에 선형 제약 조건이 부여된 상황에서 변수 선택과 추론을 어떻게 수행할 수 있는가?
  • RQ3정확하게 지정된 선형 제약 조건이 회귀 계수의 신뢰구간의 정밀도와 커버리지에 어떤 영향을 미치는가?
  • RQ4제약 조건 하에서 보정되지 않은 회귀 계수 추정치를 구성하여 타당한 통계적 추론을 가능하게 할 수 있는가?
  • RQ5총 지방 및 칼로리 섭취량을 조절한 후 장 마이크로바이옴 데이터에서 어떤 박테리아 분류군이 BMI와 유의미하게 관련이 있는가?

주요 결과

  • 제안된 방법은 선형 제약 조건을 회귀 계수에 도입함으로써 설계상 부분조합 일관성을 보장한다.
  • 시뮬레이션 결과, 올바른 선형 제약 조건 하에서는 잘못된 제약 조건이나 제약 없음보다 더 짧고 커버리지가 우수한 신뢰구간을 얻는다. 특히 표본 크기가 작을 경우 두드러진다.
  • 보정된 추정치는 약간 정규분포를 따르며, 타당한 신뢰구간과 p-값을 제공한다.
  • 이 방법은 실제 장 마이크로바이옴 데이터셋에서 총 지방 및 칼로리 섭취량을 조절한 후 *Oscillibacter* 가 BMI와 유의미하게 관련이 있음을 규명한다.
  • 제약 조건이 정확하게 지정된 경우, 제약 조건 하에서의 펜라이즈드 추정은 예측 성능을 향상시킨다.
  • 보정 알고리즘은 계산적으로 실현 가능하며, 표준 PC에서 p=100일 경우 약 36초, p=200일 경우 약 300초가 소요된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.