[논문 리뷰] Bugs as Features (Part I): Concepts and Foundations for the Compositional Data Analysis of the Microbiome-Gut-Brain Axis
이 논문은 식이요법-장-뇌 축을 중심으로 쇼크 레이트 메타게놈 데이터의 구성적 편향을 다루기 위해 중심 로그비(CLR) 변환을 적용한 조합적 데이터 분석 프레임워크를 제안한다. 이는 조건부 분석을 통해 상대적 풍부도를 다변량 검정(예: PERMANOVA)에 적합한 척도로 변환함으로써 강력한 통계 분석을 가능하게 한다. 주요 결과로는 정신분열증 코hort에서의 미생물군집 차이가 유의미하게 관찰되었으며, 이는 CLR 변환을 통해 구성적 편향을 효과적으로 보정함으로써 가능해졌다.
There has been a growing acknowledgement of the involvement of the gut microbiome - the collection of microbes that reside in our gut - in regulating our mood and behaviour. This phenomenon is referred to as the microbiome-gut-brain axis. While our techniques to measure the presence and abundance of these microbes have been steadily improving, the analysis of microbiome data is non-trivial. Here, we present a perspective on the concepts and foundations of data analysis and interpretation of microbiome experiments with a focus on the microbiome-gut-brain axis domain. We give an overview of foundational considerations prior to commencing analysis alongside the core microbiome analysis approaches of alpha diversity, beta diversity, differential feature abundance and functional inference. We emphasize the compositional data analysis (CoDA) paradigm. Further, this perspective features an extensive and heavily annotated microbiome analysis in R in the supplementary materials, as a resource for new and experienced bioinformaticians alike.
연구 동기 및 목표
- 미생물군집 연구에서 구성적 데이터 분석을 위한 재현 가능하고 오픈소스 프레임워크를 구축하기 위해.
- 시퀀싱 데이터의 구성적 편향 문제를 해결하기 위해 CLR 변환을 적용하여 타당한 통계적 추론을 가능하게 하기 위해.
- 실제 정신분열증 연구 데이터를 활용하여 미생물군집 분석의 실용적 구현을 보여주기 위해.
- 연구자들이 R과 기존의 통계 방법을 사용하여 미생물군집 데이터를 사전처리, 변환, 분석할 수 있도록 도구를 제공하기 위해.
- CLR 변환된 데이터의 해석법과 원시 수치 또는 상대적 풍부도 대비 이점들을 명확히 하기 위해.
제안 방법
- 균수준의 풍부도 데이터에 중심 로그비(CLR) 변환을 적용하여 분산을 안정화하고 구성적 영향을 제거하기 위해.
- 0 값을 'const' 방법으로 보간하여, 0을 다음으로 낮은 값의 65%로 대체함으로써 로그비 구조를 유지하기 위해.
- 표본 간 유병률이 10% 미만인 특징을 필터링하여 잡음 감소와 통계적 검정력 향상에 기여하기 위해.
- 정신분열증 환자와 건강한 대조군 간의 미생물군집 구성 차이를 검정하기 위해 PERMANOVA를 사용하기 위해.
- 성별 및 흡연 상태와 같은 공변량을 분석에 통합하여 혼란 요인을 통제하기 위해.
- ggplot2, ggbeeswarm, patchwork를 활용한 시각화 도구를 사용하여 CLR 변환된 데이터와 그룹 간 차이를 탐색하고 시각화하기 위해.
실험 결과
연구 질문
- RQ1미생물군집 시퀀싱 데이터의 구성적 편향은 어떻게 효과적으로 통계 분석에 보정할 수 있는가?
- RQ2CLR 변환을 사용할 경우 정신분열증이 장 미생물군집 구성에 어떤 영향을 미치는가?
- RQ3성별 및 흡연 상태와 같은 공변량은 이 코hort 내에서 미생물군집 프로파일에 어떤 영향을 미치는가?
- RQ4CLR 변환은 다변량 미생물군집 분석의 해석 가능성과 타당성에 어느 정도 향상시키는가?
- RQ5식이요법-장-뇌 축의 맥락에서 재현 가능하고 오픈소스 기반의 R 기반 파ip라인을 구축할 수 있는가?
주요 결과
- CLR 변환은 상대적 풍부도를 다변량 분석에 적합한 척도로 효과적으로 변환하여 상대적 풍부도 간의 의미 있는 비교를 가능하게 하였다.
- 유병률이 10% 미만인 특징을 필터링한 후, 최종 데이터셋은 분석에 적합한 생물학적으로 의미 있는 균군 집합을 유지하였다.
- CLR 변환된 데이터를 대상으로 PERMANOVA를 수행한 결과, 정신분열증 환자와 건강한 대조군 간에 미생물군집 구성에 유의미한 차이가 관찰되었다.
- 'const' 보간 방법을 사용함으로써 0 값 처리 시 로그가 정의되지 않는 문제를 방지하면서도 데이터의 구조를 유지하였다.
- 분석 결과, 그룹 간 미생물군집 프로파일에 의미 있는 차이가 있음을 확인하였으며, 이는 정신분열증에서의 미생물군집-장-뇌 축 가설을 지지하는 데 기여하였다.
- 이 프레임워크는 재현 가능하고 재사용 가능하며, 모든 코드와 데이터는 GitHub의 Tjazi R 패키지를 통해 공개되어 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.