Skip to main content
QUICK REVIEW

[논문 리뷰] Supervised Penalized Canonical Correlation Analysis

Andrea Thum, Mönchgesang, Susann|arXiv (Cornell University)|2014. 05. 07.
Metabolomics and Mass Spectrometry Studies참고 문헌 19인용 수 3
한 줄 요약

이 논문은 실험 설계를 제3의 데이터 세트로 통합하여 생물학적 데이터(예: 유전자 발현과 대사물질 농도)와의 상관관계를 극대화하는, 보상된 CCA의 확장판인 감독형 보상된 공분산 분석(supervised penalized canonical correlation analysis, spCCA)을 제안한다. 이는 설명 가능하고 생물학적으로 의미 있는 공분산 변수를 가능하게 한다. *Arabidopsis thaliana* 데이터에 적용한 결과, spCCA는 병원균 방어와 시계 리듬과 관련된 여덟 가지 유의미한 공분산 변수를 규명하였으며, 기존의 표준 pCCA에 비해 해석 가능성이 향상되었다.

ABSTRACT

The canonical correlation analysis (CCA) is commonly used to analyze data sets with paired data, e.g. measurements of gene expression and metabolomic intensities of the same experiments. This allows to find interesting relationships between the data sets, e.g. they can be assigned to biological processes. However, it can be difficult to interpret the processes and often the relationships observed are not related to the experimental design but to some unknown parameters. Here we present an extension of the penalized CCA, the supervised penalized approach (spCCA), where the experimental design is used as a third data set and the correlation of the biological data sets with the design data set is maximized to find interpretable and meaningful canonical variables. The spCCA was successfully tested on a data set of Arabidopsis thaliana with gene expression and metabolite intensity measurements and resulted in eight significant canonical variables and their interpretation. We provide an R-package under the GPL license.

연구 동기 및 목표

  • 보상된 CCA에서 나타나는 공분산 변수의 해석 과제를 해결하기 위해, 이는 종종 통제되지 않은 생물학적 또는 기술적 요인을 반영할 뿐 아니라 생물학적으로 의미 있는 과정을 반영하지 못함.
  • 실험 설계를 지침 요소로 통합하여 고차원의 다오미크스 데이터에서 공분산 분석의 해석 가능성을 향상시키기 위해.
  • 기존의 실험 조건과 관련된 공분산 변수를 우선시하는 방법을 개발하여 통계적 결과를 생물학적 가설과 연결하기 위해.
  • 시스템 생물학자들이 실제 데이터에 이 방법을 적용할 수 있도록 실용적이고 오픈소스의 R 패키지를 제공하기 위해.

제안 방법

  • 실험 설계를 제3의 데이터 세트로 도입하여 보상된 CCA를 확장한다. 이는 치료 조건 또는 표현형 레이블의 행렬로 표현된다.
  • 생물학적 데이터 세트의 공분산 변수와 설계 데이터 세트의 선형 조합 간의 상관계수 합을 극대화한다.
  • 가중치 벡터의 희박성(스파arsity)을 확보하기 위해 엘라스틱넷 페널티(리지 + 라소)를 사용한다. 이는 각 생물학적 데이터 세트에서 가장 관련성이 높은 특징들만 선택한다.
  • 공분산 변수의 단위 분산을 보장하는 제약 조건 하에 일반화된 고유값 문제를 통해 최적화 문제를 해결한다.
  • 정규화 파rameter(λ)의 최적 선택을 위해 교차검증을 사용한다. 이는 희박성과 모델 안정성에 기여한다.
  • 모델 피팅, 시각화, 공분산 변수의 유의미성 검정을 위한 기능을 포함한 R 패키지를 제공한다.

실험 결과

연구 질문

  • RQ1공분산 분석에 실험 설계를 통합함으로써, 규명된 공분산 변수의 생물학적 해석 가능성이 향상되는가?
  • RQ2감독형 보상된 CCA는 다오미크스 데이터에서 의미 있는 생물학적 과정을 규명하는 데 있어 표준 보상된 CCA보다 어떻게 다를까?
  • RQ3*Arabidopsis thaliana*에서 이 방법을 통해 병원균 반응과 시계 조절과 가장 강하게 연관된 생물학적 과정은 무엇인가?
  • RQ4이 방법은 기술적 요인 또는 관측되지 않은 혼란 요인을 생물학적으로 관련된 신호에서 얼마나 잘 분리해낼 수 있는가?

주요 결과

  • 감독형 보상된 CCA는 유의미한 공분산 변수 8개를 α = 0.01 수준에서 규명하였으며, 병원균 방어와 시계 리듬과 관련된 명확한 생물학적 의미를 지녔다.
  • 첫 번째 공분산 변수는 조류균 감염에 대한 식물의 반응을 강하게 반영하며, PEN2와 같은 유전자와 사이다산과 같은 대사물질의 높은 가중치를 보였다.
  • 이 방법은 pen2 돌연변이 표현형을 별개의 공분산 변수와 연결하여 성공적으로 규명하였으며, 이는 기존의 표준 pCCA로는 탐지되지 않았다.
  • spCCA의 두 번째 및 여섯 번째 공분산 변수는 이전의 것들보다 더 높은 상관계수를 보였으며, 상관계수의 비단조화적 감소(비단조화적 감소) 특징을 보였는데, 이는 표준 CCA에서는 관찰되지 않았다.
  • 이 방법은 다섯 번째, 여섯 번째, 아홉 번째 공분산 변수가 샘플 처리 변화나 조류균 배양 조건의 차이와 같은 통제되지 않은 기술적 요인에 영향을 받을 수 있음을 드러냈다.
  • 표준 pCCA는 열 개의 유의미한 변수를 발견했지만 그 중 두 개만 해석 가능했고, spCCA는 아홉 개의 유의미하고 생물학적으로 설명 가능한 변수를 제공하여 해석 가능성이 크게 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.