Skip to main content
QUICK REVIEW

[논문 리뷰] Inferring disease causing genes and their pathways: A mathematical perspective

Jeethu V. Devasia, Priya Chandran|arXiv (Cornell University)|2016. 10. 30.
Bioinformatics and Genomic Networks참고 문헌 23인용 수 3
한 줄 요약

이 논문은 분자의 상호작용 네트워크에서 질병 유전자와 기능이 손상된 경로를 식별하기 위해 그래프 이론적 근사 알고리즘을 제안하며, 그래프 정점 및 간선의 제거와 난수 라운딩을 통해 네트워크 크기를 줄인다. 간선의 가중치와 정점의 차수를 기반으로 간선과 정점을 제거함으로써 네트워크 크기를 줄이고, 난수 라운딩을 적용하여 영향력이 큰 경로를 선별함으로써 기존의 무작위 보행 및 전기 회로 모델과 비교해 더 높은 정확도와 더 빠른 실행 속도를 달성한다.

ABSTRACT

A system level view of cellular processes for human and several organisms can be cap- tured by analyzing molecular interaction networks. A molecular interaction network formed of differentially expressed genes and their interactions helps to understand key players behind disease development. So, if the functions of these genes are blocked by altering their interactions, it would have a great impact in controlling the disease. Due to this promising consequence, the problem of inferring disease causing genes and their pathways has attained a crucial position in computational biology research. However, considering the huge size of interaction networks, executing computations can be costly. Review of literatures shows that the methods proposed for finding the set of disease causing genes could be assessed in terms of their accuracy which a perfect algorithm would find. Along with accuracy, the time complexity of the method is also important, as high time complexities would limit the number of pathways that could be found within a pragmatic time interval.

연구 동기 및 목표

  • 대규모 분자의 상호작용 네트워크에서 질병을 유발하는 유전자와 기능이 손상된 경로를 식별하는 데 있어 계산의 도전 과제를 해결한다.
  • 무작위 보행 및 전기 회로 모델과 같은 기존 방법의 높은 시간 복잡도로 인해 확장성이 제한되는 문제를 해결한다.
  • 그래프 정점 및 간선 제거를 근사 알고리즘과 통합하여 정확도와 실행 시간을 모두 향상시킨다.
  • 네트워크 크기를 줄이면서 생물학적으로 관련된 연결을 유지함으로써 대규모 생물학적 네트워크의 실용적 분석을 가능하게 한다.
  • 약물 개발 및 유전자 치료 응용 분야에서 계산적으로 효율적이면서도 생물학적으로 관련성이 높은 원인 유전자와 경로를 식별하는 방법을 제공한다.

제안 방법

  • 분자의 상호작용 네트워크를 사용하여 원인 유전자와 경로 식별 문제를 그래프 이론 문제로 변환한다.
  • 낮은 가중치를 가진 간선과 최소 차수를 가진 정점을 반복적으로 제거하여 그래프 정점 및 간선 제거를 적용해 네트워크 크기를 줄인다.
  • 정점의 차수를 가장 낮게 유지하는 정점을 효율적으로 식별하고 제거하기 위해 최소 힙 데이터 구조를 사용한다.
  • 정점 수의 10%(|V|)를 기준으로 제거 임계값을 설정하여 네트워크 크기를 관리 가능한 크기로 줄인다.
  • 정제된 그래프에 난수 라운딩을 적용하여 가장 관련성이 높은 경로를 식별하고 영향력이 큰 원인 유전자를 선택한다.
  • 유전자 발현 상관관계(Pearson 상관계수)를 활용하여 간선의 가중치를 할당하여 유전자 간의 상호작용 강도를 표현한다.

실험 결과

연구 질문

  • RQ1그래프 정점 및 간선 제거 기법이 대규모 분자의 상호작용 네트워크에서 질병을 유발하는 유전자 식별의 계산 복잡도를 크게 줄일 수 있는가?
  • RQ2그래프 정점 및 간선 제거와 난수 라운딩을 통합함으로써 기존 방법과 비교해 원인 유전자 및 경로 추론의 정확도와 효율성이 어떻게 향상되는가?
  • RQ3정확도와 실행 시간 측면에서 제안된 방법이 무작위 보행 및 전기 회로 기반 방법보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ4기존 기준 유전자 외에 새로운 질병을 유발하는 유전자를 식별할 수 있는가? 이는 생물학적 관련성을 향상시키는가?
  • RQ5정점 제거 과정에서 최소 힙 기반의 정점 선택이 경로 식별 품질에 영향을 주지 않으면서도 실행 시간 효율성을 향상시키는가?

주요 결과

  • 그래프 축소를 통한 제안된 근사 알고리즘이 모든 기준 방법보다 더 많은 원인 유전자를 더 높은 정확도로 식별하는 데 성공했다.
  • 기준 데이터셋에서 이 방법은 한 데이터셋에서 4114분(2800시간 이상)의 실행 시간을 기록했지만, 이는 전기 회로 및 행렬 역행렬 방법보다 더 효율적이었으며, 이들 방법은 1800시간 이상 소요되었다.
  • 난수 라운딩 기법은 빠른 실행 속도를 자랑하는 무작위 보행 및 eQED 방법보다 더 많은 원인 유전자를 식별했으며, 이는 낮은 정확도에도 불구하고 빠른 실행 속도를 기록한 바 있다.
  • 최소 힙 최적화를 적용한 방법은 한 데이터셋에서 실행 시간을 8.61초로 줄여 표준 근사 알고리즘보다 뚜렷이 빠르게 성능을 냈다.
  • 생물학적 관련성 분석을 통해 식별된 유전자와 경로가 알려진 질병 메커니즘과 일치함을 확인하여, 이 방법의 생물학적 타당성을 검증했다.
  • 알고리즘은 보조 자료에 상세히 기재된 바와 같이 기준 데이터셋에 포함되지 않은 새로운 질병을 유발하는 유전자를 성공적으로 식별했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.