Skip to main content
QUICK REVIEW

[논문 리뷰] Decomposing feature-level variation with Covariate Gaussian Process Latent Variable Models

Kaspar Märtens, Kieran R. Campbell|Research Explorer (The University of Manchester)|2018. 10. 16.
Gaussian Processes and Bayesian Inference인용 수 9
한 줄 요약

이 논문은 고차원 데이터의 특징 수준에서 변동성을 잠재 변수, 관측된 공변량, 그리고 그들의 비선형 상호작용 기여도로 분해하는 새로운 확률적 프레임워크인 공변량 가우시안 프로세스 잠재변수 모델(c-GPLVM)을 제안한다. 구조적 커널 분해를 가우시안 프로세스 프레임워크 내에 통합함으로써, c-GPLVM은 해석 가능하고 스케일러블한 차원 축소를 가능하게 하며, 잠재적 구조에 의한 분산과 외부 공변량에 의한 분산을 명시적으로 분리한다. 이는 유전자 발현 및 생존 데이터에서 입증되었다.

ABSTRACT

The interpretation of complex high-dimensional data typically requires the use of dimensionality reduction techniques to extract explanatory low-dimensional representations. However, in many real-world problems these representations may not be sufficient to aid interpretation on their own, and it would be desirable to interpret the model in terms of the original features themselves. Our goal is to characterise how feature-level variation depends on latent low-dimensional representations, external covariates, and non-linear interactions between the two. In this paper, we propose to achieve this through a structured kernel decomposition in a hybrid Gaussian Process model which we call the Covariate Gaussian Process Latent Variable Model (c-GPLVM). We demonstrate the utility of our model on simulated examples and applications in disease progression modelling from high-dimensional gene expression data in the presence of additional phenotypes. In each setting we show how the c-GPLVM can extract low-dimensional structures from high-dimensional data sets whilst allowing a breakdown of feature-level variability that is not present in other commonly used dimensionality reduction approaches.

연구 동기 및 목표

  • 잠재적 저차원 구조와 관측된 공변량에 의해 특징 수준의 변동성이 어떻게 영향을 받는지 명시적으로 모델링하는 차원 축소 모델을 개발하는 것.
  • 고차원 데이터의 분산을 잠재 변수, 공변량, 그리고 그들의 비선형 상호작용 기여도로 해석 가능한 방식으로 분해하는 것.
  • 기존 GPLVM이 잠재적 구조를 학습할 때 혼동 공변량 효과를 고려하지 못하는 한계를 해결하는 것.
  • 질병 진행 모델링과 같이, 유전자 수준의 반응이 잠재적 요인과 공변량 요인에 의해 어떻게 영향을 받는지 이해하는 데 핵심적인 복잡한 데이터에서의 발견을 위한 프레임워크를 제공하는 것.
  • 해석 가능성과 기능 수준의 변동성에 대한 후행 분석을 가능하게 하면서도, 공변량 정보를 포함하는 방식으로 GPLVM을 확장하는 것.

제안 방법

  • c-GPLVM는 잠재-공변량 공간에서의 사상에 대해 가감성 및 상호작용 성분으로 분해되는 구조적 커널을 사용하는 하이브리드 가우시안 프로세스 모델이다.
  • 각 특징의 발현을 잠재 변수 z와 공변량 x의 가우시안 프로세스 함수로 모델링하며, 가중치가 가감성 및 상호작용 효과를 명시적으로 분리한다.
  • 잠재 좌표에 대한 사후 분포 p(z|y,x)와 특징별 매핑 p(f^(j)|y,x,z)를 동시에 추정함으로써, 특징 수준에서의 분산 분해를 가능하게 한다.
  • 핵심적 혁신은 비선형적이고 비모수적인 방식으로 z, x, z×x 상호작용의 분산 기여도를 분리할 수 있도록 해주는 구조적 커널 분해의 사용이다.
  • 스Parser GP 근사와 같은 스케일러블 추론 기법을 활용하여, 유전자 발현 프로파일과 같은 대규모 고차원 데이터셋을 처리한다.
  • 이 프레임워크는 발견 응용과 배치 효과 또는 임상 데이터의 생존 시간과 같은 혼동 공변량 조정 모두를 지원한다.

실험 결과

연구 질문

  • RQ1고차원 데이터에서 특징 수준의 변동성을 잠재 변수, 관측된 공변량, 그리고 그들의 비선형 상호작용 기여도로 어떻게 분해할 수 있는가?
  • RQ2공변량 조정이 된 잠재 표현을 학습하여, 다양한 공변량 값에서 공통적인 구조를 드러내면서도 해석 가능성을 유지할 수 있는가?
  • RQ3c-GPLVM은 실제 생물학적 데이터에서 복잡한 비선형 의존성을 포괄하는 데 있어 기존 GPLVM 및 감독형 확장 모델보다 얼마나 뛰어나게 성능을 발휘할 수 있는가?
  • RQ4암 진행 모델링에서, 발현이 잠재 진행 좌표, 생존 시간, 또는 그 상호작용에 의해 영향을 받는 유전자가 어떤 것인지 어떻게 식별할 수 있는가?
  • RQ5생존 시간과 같은 케이싱된 공변량을 원칙적인 확률적 프레임워크 내에서 효과적으로 처리할 수 있는가?

주요 결과

  • c-GPLVM은 생존 시간과 같은 연속적 공변량에 의해 혼동되는 상황에서도 고차원 유전자 발현 데이터의 잠재적 구조를 성공적으로 포착하며, 특징 수준의 변동성을 모델링하는 데 있어 기존 GPLVM을 능가한다.
  • 시뮬레이션 데이터에서 c-GPLVM은 잠재적 차원과 공변량 차원에서의 가감성 및 상호작용 효과로의 진짜 분산 분해를 정확히 복원하였다.
  • TCGA 유방암 데이터에서 c-GPLVM은 TSPAN1이 잠재 진행 좌표를 따라 발현이 증가함을 규명하여, 생존과 무관하게 질병 진행에 기여할 수 있음을 시사하였다.
  • 모델은 KRT23이 생존 공변량에 의해 유의미한 가감성 효과를 가지며, 장수한 환자에서 발현 수준이 높아 보다 보호적 역할을 할 수 있음을 드러냈다.
  • LPL의 경우, c-GPLVM은 복잡한 비선형 상호작용을 탐지하였다: 특정 범위의 잠재 좌표에서 높은 발현은 생존율 감소와 관련이 있었으며, 이는 종양 침습성에 대한 맥락 의존적 역할을 시사하였다.
  • c-GPLVM의 커널 분해 기능 덕분에, 사후 분석이나 모델 수정 없이도 세 가지 유형의 유전자 행동—잠재적 요인에 의한, 공변량의 가감성 효과, 상호작용에 의해 유도된—를 직접 식별할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.