Skip to main content
QUICK REVIEW

[논문 리뷰] A Review of Statistical Methods in Imaging Genetics

Farouk S. Nathoo, Linglong Kong|arXiv (Cornell University)|2017. 07. 23.
Genetic Associations and Epidemiology참고 문헌 30인용 수 7
한 줄 요약

이 논문은 영상유전학에서 대용량 데이터 제곱(Big Data Squared, BD²)을 분석하기 위한 고급 통계 방법을 검토하며, 고차원 신경영상 및 유전 데이터의 동시 모델링에 초점을 맞춘다. 공간적 구조를 가진 베이지안 다변량 회귀 모델을 제안하여 마르코프 무작위 필드와 희소 정밀행렬을 활용해 공간적 의존성과 계산 확장성을 동시에 처리하며, 대규모 영상유전학 연구에서 효율적인 추론을 가능하게 한다.

ABSTRACT

With the rapid growth of modern technology, many large-scale biomedical studies have been/are being/will be conducted to collect massive datasets with large volumes of multi-modality imaging, genetic, neurocognitive, and clinical information from increasingly large cohorts. Simultaneously extracting and integrating rich and diverse heterogeneous information in neuroimaging and/or genomics from these big datasets could transform our understanding of how genetic variants impact brain structure and function, cognitive function, and brain-related disease risk across the lifespan. Such understanding is critical for diagnosis, prevention, and treatment of numerous complex brain-related disorders (e.g., schizophrenia and Alzheimer). However, the development of analytical methods for the joint analysis of both high-dimensional imaging phenotypes and high-dimensional genetic data, called big data squared (BD$^2$), presents major computational and theoretical challenges for existing analytical methods. Besides the high-dimensional nature of BD$^2$, various neuroimaging measures often exhibit strong spatial smoothness and dependence and genetic markers may have a natural dependence structure arising from linkage disequilibrium. We review some recent developments of various statistical techniques for the joint analysis of BD$^2$, including massive univariate and voxel-wise approaches, reduced rank regression, mixture models, and group sparse multi-task regression. By doing so, we hope that this review may encourage others in the statistical community to enter into this new and exciting field of research.

연구 동기 및 목표

  • 고차원 영상 및 유전 데이터의 동시 분석이 초래하는 계산적 및 통계적 과제를 해결하기 위해, 이를 '빅데이터 제곱'(BD²)으로 알려진 문제를 다루기 위함이다.
  • 신경영상 표현형의 공간적 의존성과 유전자 마커의 연합불균형을 고려한 통계 방법을 개발하고 검토하기 위함이다.
  • 대규모 코hort에서 다중 모odal 데이터를 통합함으로써 뇌 구조 및 기능과 관련된 유전자 연관성을 향상시킬 수 있도록 하기 위함이다.
  • 특히 베이지안 계층 모델을 포함한 고급 통계 기법의 통계 및 신경영상 연구 공동체 내 보급을 촉진하기 위함이다.
  • 영상, 유전체 및 임상 데이터의 통합 분석을 통해 뇌 관련 질병 위험과 관련된 유전자 변이를 규명하는 데 방법론적 기반을 제공하기 위함이다.

제안 방법

  • 영상 표현형에 대해 다변량 정규분포 우도를 사용하는 베이지안 계층 모델을 제안하며, 정밀행렬이 인접행렬 A와 공간 상관 계수 ρ를 통해 공간적 의존성을 표현하도록 구성한다.
  • 오차 구조에 대해 조건부자기회귀(CAR) 사양을 사용하여 각 반구 내의 공간적 의존성과 반구 간 동위 영역 간의 상관관계를 모델링한다.
  • 고차원 설정에서의 과적합을 줄이고 변수 선택을 가능하게 하기 위해 회귀 계수 W에 희박성 사전을 적용한다.
  • 희소 수치 선형대수 기법과 희소 정밀행렬을 활용한 게비스 샘플링을 통해 대규모 영상유전학 데이터에 대한 계산 확장성을 확보한다.
  • 대규모 추론을 위한 게비스 샘플링의 빠른 대안으로 평균장 변분 베이즈 알고리즘을 개발한다.
  • 모델은 R 패키지 'bgsmtr'에 구현되었으며, 공간적 구조를 가진 사전분포 및 희소 행렬 연산을 통한 효율적 계산을 지원한다.

실험 결과

연구 질문

  • RQ1공간적 의존성과 고차원성을 동시에 고려하면서 고차원 영상 및 유전 데이터를 동시 분석할 수 있는 통계 방법은 어떻게 개발될 수 있는가?
  • RQ2영상유전학에서 대용량 데이터 제곱(BD²)을 분석할 때 발생하는 계산적 및 이론적 과제는 무엇이며, 이를 어떻게 극복할 수 있는가?
  • RQ3통합된 통계 프레임워크 내에서 신경영상 표현형의 공간적 상관관계와 유전자 연합불균형을 효과적으로 모델링할 수 있는가?
  • RQ4희소 정밀행렬을 갖는 베이지안 계층 모델은 대규모 영상유전학 연구에서 확장 가능하고 정확한 추론을 가능하게 할 수 있는가?
  • RQ5복잡한 공간 모델을 위한 게비스 샘플링 대비 변분 베이즈의 상대적 이점은 무엇인가?

주요 결과

  • 제안된 공간적 베이지안 모델은 희소 인접행렬 A를 사용하는 마르코프 무작위 필드 구조를 통해 신경영상 표현형의 공간적 의존성을 효과적으로 포착한다.
  • 정밀행렬의 희소성 덕분에 전체 조건부 분포에서 정밀행렬가 여전히 희소하게 유지되어 효율적인 게비스 샘플링이 가능해지며, 계산 확장성이 확보된다.
  • 공간 상관 계수 ρ와 교차 반구 공분산 행렬 Σ를 포함함으로써 내부 및 반구 간 의존성에 대한 탄력적인 모델링이 가능해진다.
  • 회귀 계수 W에 대한 희박성 사전분포의 도입으로 고차원 설정에서의 과적합을 줄이고 변수 선택이 가능해진다.
  • 평균장 변분 베이즈 알고리즘이 게비스 샘플링의 확장 가능한 대안으로 개발되었으며, 대규모 데이터셋에서는 더욱 높은 효율성을 기대할 수 있다.
  • 모델은 R 패키지 'bgsmtr'에 구현되었으며, 향후 버전에서는 향상된 알고리즘과 대규모 영상유전학 데이터 처리를 위한 지원이 추가될 예정이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.