Skip to main content
QUICK REVIEW

[논문 리뷰] Identifying Genetic Risk Factors via Sparse Group Lasso with Group Graph Structure

Tao Yang, Paul M. Thompson|arXiv (Cornell University)|2017. 09. 12.
Genetic Associations and Epidemiology참고 문헌 27인용 수 4
한 줄 요약

이 논문은 SGLGG를 제안하며, 이는 노드 수준과 유전자 수준의 희박성과 유전자 네트워크 사전 지식을 희박 그룹 라소와 그래프 가속화된 융합 라소를 통해 통합하는 이중 수준의 구조적 희박 모델이다. ADMM 최적화를 통해 SGLGG는 ADNI 전장 게놈 시퀀싱 및 뇌 영상 데이터에서 알츠하이머병 관련 표현형을 예측하는 데 있어 최신 기술 모델들을 능가하며, 알츠하이머병 위험과 관련된 생물학적으로 타당하고 뭉치는 유전자 다형성( SNP)을 식별하여, 예측 가능성과 변수 선택 성능 향상에 기여한다.

ABSTRACT

Genome-wide association studies (GWA studies or GWAS) investigate the relationships between genetic variants such as single-nucleotide polymorphisms (SNPs) and individual traits. Recently, incorporating biological priors together with machine learning methods in GWA studies has attracted increasing attention. However, in real-world, nucleotide-level bio-priors have not been well-studied to date. Alternatively, studies at gene-level, for example, protein--protein interactions and pathways, are more rigorous and legitimate, and it is potentially beneficial to utilize such gene-level priors in GWAS. In this paper, we proposed a novel two-level structured sparse model, called Sparse Group Lasso with Group-level Graph structure (SGLGG), for GWAS. It can be considered as a sparse group Lasso along with a group-level graph Lasso. Essentially, SGLGG penalizes the nucleotide-level sparsity as well as takes advantages of gene-level priors (both gene groups and networks), to identifying phenotype-associated risk SNPs. We employ the alternating direction method of multipliers algorithm to optimize the proposed model. Our experiments on the Alzheimer's Disease Neuroimaging Initiative whole genome sequence data and neuroimage data demonstrate the effectiveness of SGLGG. As a regression model, it is competitive to the state-of-the-arts sparse models; as a variable selection method, SGLGG is promising for identifying Alzheimer's disease-related risk SNPs.

연구 동기 및 목표

  • 기존 GWAS가 SNP 상호작용과 생물학적 사전 지식을 忽시하는 한계를 해결하기 위해.
  • 인간 유전자 다형성의 원인을 특정하는 데 도움이 되는 핵산 수준과 유전자 수준의 희박성을 동시에 강제하는 모델을 개발하기 위해.
  • 단백질-단백질 상호작용 및 경로와 같은 생물학적으로 의미 있는 유전자 수준의 사전 지식을 SNP 선택에 통합하여 생물학적 해석 가능성 향상시키기 위해.
  • 다중 정규화 항을 포함하는 복잡한 구조적 희박 모델을 효율적인 ADMM 기반 알고리즘으로 최적화하기 위해.
  • 실제 알츠하이머병 유전체 및 뇌 영상 데이터에서 회귀 및 변수 선택 과제에 대한 모델 성능 평가하기 위해.

제안 방법

  • SGLGG를 제안하며, 이는 희박 그룹 라소와 그룹 수준의 그래프 라소를 융합하여 핵산 수준과 유전자 수준에서 희박성을 유도하는 하이브리드 모델이다.
  • 단백질-단백질 상호작용, 경로 등 유전자 수준의 생물학적 사전 지식을 유전자 수준 계수에 대한 그래프 구조 정규화를 통해 통합한다.
  • 유전자 네트워크 내 간선 제약 조건을 행렬 형태로 변환하여 효율적인 최적화를 가능하게 한다.
  • 다중 정규화 항이 포함된 비光滑, 비볼록 최적화 문제를 해결하기 위해 교대 방향 승수법(ADMM)을 사용한다.
  • 100회의 시뮬레이션을 통한 안정성 선택을 통해 다양한 정규화 파rameter에서의 SNP 선택의 신뢰성과 일관성 평가한다.

실험 결과

연구 질문

  • RQ1핵산 수준과 유전자 수준의 희박성을 통합하는 이중 수준의 구조적 희박 모델이 기존의 희박 모델 대비 GWAS에서 예측 정확도를 향상시킬 수 있는가?
  • RQ2SGLGG는 단백질-단백질 상호작용 네트워크와 같은 유전자 수준의 생물학적 사전 지식을 얼마나 효과적으로 활용하여 알츠하이머병과 관련된 생물학적으로 타당한 SNP 군집을 식별할 수 있는가?
  • RQ3SGLGG는 특히 안정성과 생물학적 타당성 측면에서 인과적 SNP를 변수 선택을 통해 최신 기술 모델들을 능가하는가?
  • RQ4그래프 구조 정규화가 GWAS에서 유전자 간 SNP-SNP 상호작용 탐지에 얼마나 기여하는가?
  • RQ5SGLGG는 구조적 희박성과 사전 지식 통합을 통해 뛰어난 해석 가능성과 함께 강력한 예측 성능를 유지할 수 있는가?

주요 결과

  • SGLGG는 알츠하이머병 관련 표현형 예측에서 경쟁적인 회귀 성능를 보였으며, 평균 제곱 오차(MSE) 측면에서 최신 기술 모델들을 능가하거나 동등하게 유지했다.
  • 안정성 선택 결과, SGLGG는 특정 유전자 내에서 밀집된 클러스터로 SNP를 선택하는 반면, Lasso나 SGL은 여러 유전자에 걸쳐 선택을 산산이 흩트는 경향을 보였다.
  • SGLGG는 총 선택된 유전자 수는 적었지만, 각 선택된 유전자 내에서 더 많은 관련 SNP를 선택하여 핵산 수준의 희박성과 유전자 수준의 군집화가 효과적으로 작용함을 시사했다.
  • 개별 P-값이 가장 낮지 않은 경우에도, SGLGG는 알츠하이머병과 높은 생물학적 관련성을 가진 SNP를 식별하여, 단순한 유의성 기준을 넘는 생물학적 의미 있는 신호를 포착함을 보였다.
  • 유전자 네트워크 사전 지식 통합을 통해 SGLGG는 유전자 간 잠재적 SNP-SNP 상호작용을 탐지할 수 있었으며, 이는 복잡한 유전적 구조를 밝혀내는 데 기여함을 뒷받침한다.
  • ADMM 기반 최적화 알고리즘이 SGLGG의 복잡한 정규화 항을 효과적으로 처리하여 전체 게놈 시퀀싱 데이터에서 확장 가능하고 안정적인 학습을 가능케 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.