Skip to main content
QUICK REVIEW

[논문 리뷰] Probabilistic analysis of the human transcriptome with side information

Leo Lahti|arXiv (Cornell University)|2011. 02. 27.
Gene expression and cancer classification참고 문헌 342인용 수 5
한 줄 요약

이 학위논문은 유전체 데이터베이스에서 유래한 보조 정보를 고 throughput 유전자 발현 데이터와 융합하여 인간 전사체를 분석하기 위한 확률적 모델링 방법을 개발한다. 이는 측정 정확도를 향상시키고, 기능적 상호작용 제약 조건을 활용하여 전신 수준의 조직 특이적 전사 네트워크 탐색을 가능하게 하며, 다오미크스 데이터 소스 간의 종속성을 모델링함으로써 체계생물학 및 암 연구를 위한 강건하고 확장 가능한 도구를 제공한다. 오픈소스 BioConductor 구현을 통해 공개되었다.

ABSTRACT

Understanding functional organization of genetic information is a major challenge in modern biology. Following the initial publication of the human genome sequence in 2001, advances in high-throughput measurement technologies and efficient sharing of research material through community databases have opened up new views to the study of living organisms and the structure of life. In this thesis, novel computational strategies have been developed to investigate a key functional layer of genetic information, the human transcriptome, which regulates the function of living cells through protein synthesis. The key contributions of the thesis are general exploratory tools for high-throughput data analysis that have provided new insights to cell-biological networks, cancer mechanisms and other aspects of genome function. A central challenge in functional genomics is that high-dimensional genomic observations are associated with high levels of complex and largely unknown sources of variation. By combining statistical evidence across multiple measurement sources and the wealth of background information in genomic data repositories it has been possible to solve some the uncertainties associated with individual observations and to identify functional mechanisms that could not be detected based on individual measurement sources. Statistical learning and probabilistic models provide a natural framework for such modeling tasks. Open source implementations of the key methodological contributions have been released to facilitate further adoption of the developed methods by the research community.

연구 동기 및 목표

  • 유전체 데이터베이스에서 유래한 보조 정보를 활용하여 고차원적이고 노이즈가 많은 전사체 데이터의 측정 신뢰도를 향상시키는 도전 과제를 해결한다.
  • 인간 전신에서 전사 활성의 전역적 패턴과 조직 기능적 유사성의 탐색적이고 확장 가능한 방법을 개발한다.
  • 동시 발생하는 전사체 및 유전체 데이터 소스를 융합하여 숨겨진 기능적 종속성과 생물학적 메커니즘을 밝혀내는 데 목적이 있다.
  • 통합 기능 게놈학 및 체계생물학 연구를 지원하기 위한 오픈소스로 재사용 가능한 계산 도구를 제공한다.
  • 통계학적 학습과 사전 생물학적 지식을 체계적인 확률적 프레임워크 안에서 융합하여 복잡한 생물학적 시스템의 분석을 발전시킨다.

제안 방법

  • 고 throughput 마이크어레이 측정에서 유도된 통계적 증거와 시퀀스 및 상호작용 데이터베이스에서 유래한 보조 정보를 결합하기 위해 확률적 모델을 적용한다.
  • 유전체 상호작용 데이터베이스에서 알려지거나 예측된 유전자-유전자 상호작용을 활용하여 데이터의 생물학적으로 타당한 영역에 모델링을 집중시킨다.
  • 전장 유전체 전사체 데이터 분석에 적합한 차원 감소 및 부분공간 모델링 기법을 구현한다.
  • 다양한 측정 소스(예: 유전자 발현, miRNA, 에피제네틱 마크)를 동시에 분석하여 다층적 관계를 포착하는 종속성 모델을 개발한다.
  • 대규모 유전체 관측치의 불확실성과 이질성을 다루기 위해 베이지안 및 잠재변수 프레임워크를 활용한다.
  • 핵심 방법론의 재현성과 커뮤니티 수용을 보장하기 위해 BioConductor에 오픈소스 구현체를 배포한다.

실험 결과

연구 질문

  • RQ1유전체 데이터베이스에서 유래한 보조 정보는 어떻게 고 throughput 마이크어레이 측정의 정확도를 향상시킬 수 있는가?
  • RQ2기능적 상호작용 제약 조건을 분석에 통합할 경우 정상 인간 조직 간에 전사 네트워크 활성화의 전역적 패턴은 어떻게 드러나는가?
  • RQ3동시 발생하는 전사체 및 기타 유전체 데이터 계층 간의 종속성은 어떻게 모델링되어 숨겨진 기능적 메커니즘을 드러낼 수 있는가?
  • RQ4보조 정보를 활용한 확률적 모델링은 노이즈가 많고 고차원적인 전사체 데이터에서 생물학적으로 관련된 신호를 얼마나 향상시킬 수 있는가?
  • RQ5이러한 방법은 인간 전사체에서 암과 진화적 변이와 같은 복잡한 질병을 연구하기 위해 어떻게 일반화되고 적용될 수 있는가?

주요 결과

  • 유전체 데이터베이스에서 유래한 보조 정보의 융합은 노이즈와 편향을 감소시켜 고 throughput 마이크어레이 측정의 정확도를 크게 향상시킨다.
  • 제안된 탐색적 방법은 상호작용 제약 조건을 활용하여 인간 기관 간에 조직 특이적 전사 네트워크 패턴과 기능적 유사성을 성공적으로 드러낸다.
  • 다오미크스 데이터 소스의 확률적 모델링은 단독으로는 탐지되지 않는 기능적 메커니즘과 조절 상호작용을 드러낸다.
  • 이 방법은 전장 유전체 전사체 데이터에 대해 효과적으로 확장 가능하여 사전 생물학적 가정 없이 전신 수준의 분석을 가능하게 한다.
  • BioConductor에 오픈소스 구현체를 배포하여 기능 게놈학 및 체계생물학 분야에서 방법의 수용과 확장이 용이해졌다.
  • 다양한 유전체 정보 계층을 융합함으로써 이 접근법은 암 연구 및 진화 게놈학 분야에 응용 가능성이 높다는 것이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.