[논문 리뷰] Network embedding unveils the hidden interactions in the mammalian virome
이 연구는 선형 필터링과 특이값 분해를 조합한 새로운 LF-SVD 방법을 제안하여 육상 포유류 바이로omic 내 숨겨진 및 실현되지 않은 숙주-바이러스 상호작용을 예측한다. 네트워크 구조와 저질서 보간을 활용함으로써 생물학적으로 타당한 연관성을 회복하고, 아마존을 샘플링되지 않은 바이로omic 다양성의 글로벌 핫스팟으로 밝혀내며, 그래프 임bedded 바이러스 특징을 통합함으로써 조건에 따른 위험 예측을 향상시킨다.
At most 1-2% of the global virome has been sampled to date. Recent work has shown that predicting which host-virus interactions are possible but undiscovered or unrealized is, fundamentally, a network science problem. Here, we develop a novel method that combines a coarse recommender system (Linear Filtering; LF) with an imputation algorithm based on low-rank graph embedding (Singular Value Decomposition; SVD) to infer host-virus associations. This combination of techniques results in informed initial guesses based on directly measurable network properties (density, degree distribution) that are refined through SVD (which is able to leverage emerging features). Using this method, we recovered highly plausible undiscovered interactions with a strong signal of viral coevolutionary history, and revealed a global hotspot of unusually unique but unsampled (or unrealized) host-virus interactions in the Amazon rainforest. We develop several tests for quantifying the bias and realism of these predictions, and show that the LF-SVD method is robust in each aspect. We finally show that graph embedding of the imputed network can be used to improve predictions of human infection from viral genome features, showing that the global structure of the mammal-virus network provides additional insights into human disease emergence.
연구 동기 및 목표
- 현재까지 샘플링된 바이로omic의 1-2% 미만이라는 심각한 샘플링 부족 문제를 해결하기 위해.
- 낮은 희박성과 부분적으로 관찰된 네트워크에서 생물학적으로 타당하지만 실현되지 않은 숙주-바이러스 상호작용을 예측하기 위해.
- 샘플링 편향을 줄이면서도 숙주-바이러스 연관성 내 공진화 신호를 유지하기 위해.
- 바이러스 게놈 기반 모델에 글로벌 네트워크 구조를 통합하여 조건에 따른 위험 예측을 향상시키기 위해.
- 보정된 네트워크에서 유도된 그래프 임bedded 특징이 인간 감염 위험 예측 정확도를 향상시키는지 테스트하기 위해.
제안 방법
- LF-SVD 방법은 네트워크 성질인 진입 차수, 진출 차수, 연결도를 기반으로 초기 상호작용 확률을 생성하기 위해 선형 필터링(LF)을 사용한다.
- 낮은 질서 근사치를 사용한 네트워크 인cidency 행렬에 특이값 분해(SVD)를 적용하여 누락되거나 실현되지 않은 상호작용을 보간한다.
- 최적의 행렬 질서(최고 성능 모델에서 질서 12)를 선택하고 연결도를 차수보다 더 높게 가중하여 정보 활용도를 극대화하도록 모델을 튜닝한다.
- 관측된 네트워크와 보간된 네트워크 양쪽에 랜덤 도트 곱 그래프 분해를 사용해 왼쪽 특이부공간에서 잠재 특성(12차원)을 추출함으로써 그래프 임bedding을 수행한다.
- 이러한 잠재 특징은 바이러스 게놈 구성 지표와 조합되어 기울기 부스팅 트리 모델을 훈련시켜 조건에 따른 잠재력 예측에 사용된다.
- 데이터 泄露를 방지하기 위해 임베딩 생성 시 인간 전용으로 연결된 인간 숙주 및 바이러스는 제외되며, 모델 성능은 반복적인 1000개의 훈련-교정-테스트 분할을 통해 검증된다.
실험 결과
연구 질문
- RQ1희박하게 샘플링된 바이로omic에서 네트워크 기반 방법이 생물학적으로 타당하지만 실현되지 않은 숙주-바이러스 상호작용을 추론할 수 있는가?
- RQ2LF-SVD 방법은 숙주-바이러스 연관성 내 공진화 신호를 유지하면서도 샘플링 편향의 영향을 줄이는가?
- RQ3보정된 네트워크에 따르면 아마존 우림이 발견되지 않은 숙주-바이러스 상호작용의 글로벌 핫스팟인가?
- RQ4보정된 네트워크에서 유도된 그래프 임bedded 특징이 바이러스 게놈 구성만으로 조건에 따른 잠재력 예측을 향상시키는가?
- RQ5글로벌 네트워크 구조를 통합하면 인간에 감염될 수 있는 육상 포유류 바이러스를 예측하는 모델의 정확도가 향상되는가?
주요 결과
- LF-SVD 방법은 부분적으로 관찰된 네트워크에서 알려진 숙주-바이러스 상호작용 예측에 ROC-AUC 0.84를 달성하여 강력한 예측 성능을 입증했다.
- 보간으로 예측 상호작용 수가 약 15배 증가하여 이전에 감지되지 않았거나 실현되지 않은 숙주-바이러스 연관성의 광범위한 저류가 존재함을 시사했다.
- 아마존 우림은 고유한 샘플링되지 않은 숙주-바이러스 상호작용의 글로벌 핫스팟으로 부상했으며, LCBD 분석에서 다른 지역보다 바이러스 공동체 구성의 고유성이 높았다.
- 모델은 수동 샘플링 편향의 영향을 크게 줄였다: 보정 후 인용 수가 바이러스 다양성 예측에 미치는 영향이 약화되어 예측의 편향이 감소한 것으로 나타났다.
- 보정된 네트워크에서 유도된 그래프 임bedded 특징은 조건에 따른 위험 예측을 향상시켰으며, 최고 성능 모델에서 바이러스 게놈 특징과 보정된 네트워크 임bedded 특징을 조합할 경우 ROC-AUC가 더 높았다.
- 최종 모델은 바이러스 게놈 구성과 보정된 네트워크 임bedded 특징을 기반으로 훈련되어 상위 성능 모델의 앙상블 평균을 통해 612개 바이러스의 인간 감염 확률을 더 정확하게 예측했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.