Skip to main content
QUICK REVIEW

[논문 리뷰] Finding the centre: corrections for asymmetry in high-throughput sequencing datasets

Jia Wu, Jean M. Macklaim|arXiv (Cornell University)|2017. 04. 06.
Geochemistry and Geologic Mapping인용 수 9
한 줄 요약

이 논문은 고 throughput 시퀀싱(HTS) 데이터에서 발생하는 비대칭성과 조합적 편향을 해결하기 위해 로그 비율 변환—특히 CLR와 ALR—를 확장하여 강력하고 베이지안 기반의 조합적 분석을 수행한다. 비교적 수정되지 않은 비대칭성은 차등 발현 분석에서 잘못된 양성 및 음성 결과를 초래하며, 사전에 정의된 기준을 사용한 기저에 의존하는 보정 방법을 제안한다. 이를 ALDEx2에 구현하여 희박하고 균형이 깨진 데이터셋에서의 추론 정확도를 크게 향상시켰다.

ABSTRACT

High throughput sequencing is a technology that allows for the generation of millions of reads of genomic data regarding a study of interest, and data from high throughput sequencing platforms are usually count compositions. Subsequent analysis of such data can yield information on tran- scription profiles, microbial diversity, or even relative cellular abundance in culture. Because of the high cost of acquisition, the data are usually sparse, and always contain far fewer observations than variables. However, an under-appreciated pathology of these data are their often unbalanced nature: i.e, there is often systematic variation between groups simply due to presence or absence of features, and this variation is important to the biological interpretation of the data. A simple example would be comparing transcriptomes of yeast cells with and without a gene knockout. This causes samples in the comparison groups to exhibit widely varying centres. This work extends a previously described log-ratio transformation method that allows for variable comparisons between samples in a Bayesian compositional context. We demonstrate the pathology in modelled and real unbalanced experimental designs to show how this dramatically causes both false negative and false positive inference. We then introduce several approaches to demonstrate how the pathologies can be addressed. An extreme example is presented where only the use of a predefined basis is appropriate. The transformations are implemented as an extension to a general compositional data analysis tool known as ALDEx2 which is available on Bioconductor.

연구 동기 및 목표

  • 고 throughput 시퀀싱(HTS) 데이터에서 기능의 존재/부재로 인한 체계적 변동이 진정한 생물학적 변화가 아닌, 아직 충분히 고려되지 않은 병태학적 문제를 다루기 위해.
  • 기본적인 카운트 기반 방법이 조합적 편향으로 인해 실패하여 차등 발현 분석에서 잘못된 양성 및 음성 결과를 초래함을 보여주기 위해.
  • 사전에 정의된 기반을 사용하여 비대칭성에 대한 보정을 도입함으로써, 희박하고 균형이 깨진 실험 설계에서 더 강력한 베이지안 조합적 데이터 분석을 확장하기 위해.
  • ALDEx2라는 Bioconductor 도구에 통합하여 실용적인 해결책을 제공함으로써, HTS 데이터의 정확하고 신뢰할 수 있는 해석을 가능하게 하기 위해.

제안 방법

  • 모든 기능의 기하 평균 g(x)를 사용하여 비율을 안정화하고 척도 불변성을 확보하기 위해 중심 로그 비율(CLR) 변환을 사용한다. 이는 log(xi / g(x))로 정의된다.
  • 선택된 기준 기능(예: 하우스키핑 유전자 또는 안정된 OTU)을 분모로 사용하여 상대적 비교를 가능하게 하기 위해 추가 로그 비율(ALR) 변환을 적용한다. 이는 log(xi / xD)로 정의된다.
  • 희박하거나 균형이 깨진 데이터에서 특히 중요한, 사전에 정의된 안정된 기능을 기준으로 선택함으로써 기저에 의존하는 보정을 도입한다.
  • 고차원적이고 희박한 HTS 데이터에서 잘못된 추론를 줄이고 강력성을 향상시키기 위해 조합적 프레임워크 내에서 베이지안 추정을 사용한다.
  • 모의 및 실제 HTS 데이터셋(예: 질 미생물군 연구 및 효모 노크아웃 전사체 연구)을 사용하여 방법을 검증한다.
  • ALDEx2에 대한 확장으로서 이 접근법을 구현하여, HTS 데이터의 조합적 분석을 위한 널리 사용되는 Bioconductor 패키지에서 사용할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1균형이 깨진 HTS 데이터에서 기인한 조합적 편향이 실제 실험 설계에서 차등 발현 추론에 어떤 영향을 미치는가?
  • RQ2표준 카운트 기반 방법(예: 음수 이항 모델)이 HTS 데이터의 본질적인 조합적 성격으로 인해 얼마나 실패하는가?
  • RQ3ALR 변환에서 사전에 정의된 기반 선택이 비대칭 데이터셋에서 잘못된 양성 및 음성 비율을 얼마나 줄일 수 있는가?
  • RQ4희박하고 균형이 깨진 HTS 데이터에서 기준 기능의 선택이 차등 발현 결과의 강력성에 어떤 영향을 미치는가?
  • RQ5CLR 및 ALR 보정을 포함한 베이지안 조합적 모델링이 기존의 정규화 및 검정 접근법보다 통계적 추론을 얼마나 향상시킬 수 있는가?

주요 결과

  • 기능의 존재/부재로 인한 체계적 변동이 있는 균형이 깨진 HTS 데이터는 표준 카운트 기반 모델로 분석할 경우 심각한 잘못된 양성 및 음성 추론을 초래한다.
  • CLR 변환은 비율을 효과적으로 안정화하고 척도 불변성을 유지하지만, 샘플 간 총 리드 수가 크게 변할 경우 실패한다.
  • 사전에 정의된 안정된 기준 기능(예: 하우스키핑 유전자 또는 풍부한 OTU)을 사용한 ALR 변환은 극도로 비대칭적인 데이터셋에서 강력한 해결책을 제공한다.
  • 극한의 경우, 예를 들어 오직 한 개의 기능만 일관되게 존재하는 경우, 기하 평균의 불안정성으로 인해 CLR은 실패하지만, 사전에 정의된 기반(즉, ALR)만이 신뢰할 수 있는 추론을 가능하게 한다.
  • 제안된 보정 방법은 효모 노크아웃 연구 및 인간의 질 미생물군 코hort를 포함한 실제 데이터셋에서 차등 발현 정확도를 크게 향상시켰다.
  • ALDEx2에 통합되어 연구자들이 이러한 보정을 직접 적용할 수 있게 되어, 조합적 HTS 데이터 분석의 재현성과 신뢰성은 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.