Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal Positive-unlabeled Learning for Biomedical Hypothesis Generation via Risk Estimation

Uchenna Akujuobi, Jun Chen|arXiv (Cornell University)|2020. 10. 05.
Biomedical Text Mining and Ontologies참고 문헌 19인용 수 9
한 줄 요약

이 논문은 생물의학적 가설 생성을 위한 시간적 양성-무단일(PU) 학습 프레임워크인 TRP를 제안한다. 이 프레임워크는 변분 추론을 사용하여 양성 사전 확률를 추정함으로써 학술 문헌 내에서의 동적 용어 관계를 모델링한다. 변화하는 속성 부여된 그래프릿의 시퀀스 상에서 노드 쌍 임베딩을 학습함으로써 TRP는 기존의 최고 수준의 PU 방법보다 미래의 용어 관계 예측에서 뛰어난 성능을 보이며, 담배와 코로나19 사이의 새로운, 관측되지 않은 연결과 같은 관계도 포함한다.

ABSTRACT

Understanding the relationships between biomedical terms like viruses, drugs, and symptoms is essential in the fight against diseases. Many attempts have been made to introduce the use of machine learning to the scientific process of hypothesis generation(HG), which refers to the discovery of meaningful implicit connections between biomedical terms. However, most existing methods fail to truly capture the temporal dynamics of scientific term relations and also assume unobserved connections to be irrelevant (i.e., in a positive-negative (PN) learning setting). To break these limits, we formulate this HG problem as future connectivity prediction task on a dynamic attributed graph via positive-unlabeled (PU) learning. Then, the key is to capture the temporal evolution of node pair (term pair) relations from just the positive and unlabeled data. We propose a variational inference model to estimate the positive prior, and incorporate it in the learning of node pair embeddings, which are then used for link prediction. Experiment results on real-world biomedical term relationship datasets and case study analyses on a COVID-19 dataset validate the effectiveness of the proposed model.

연구 동기 및 목표

  • 기존의 가설 생성 방법이 관측되지 않은 용어 관계를 음성으로 간주한다는 한계를 해결하여 과학적 발견의 개방세계 가정을 위반하지 않도록 한다.
  • 1945년부터 2020년까지의 시계열 그래프릿에서 구성된 동적 속성 부여된 그래프 구조를 사용하여 생물의학적 용어 관계의 시간적 진화를 모델링한다.
  • 무단일(PU) 학습 설정 하에서, 양성-무단일 관계의 혼합물로 간주되는 무단일 간선을 포함한 동적 그래프에서의 미래 연결 예측 작업으로서 가설 생성을 공식화한다.
  • 사전 지식이나 레이블이 부여된 음성 샘플에 의존하지 않고, 양성 및 무단일 데이터로부터 변분 추론 기반 방법을 사용하여 양성 사전 확률를 추정한다.
  • 시간적 동역학을 반영하고 새로운 생물의학적 가설을 정확하게 예측할 수 있도록 지원하는, 종단간 임베딩을 학습한다.

제안 방법

  • 생물의학적 용어 관계를 동적 속성 부여된 그래프 $G = \{G^1, G^2, ..., G^T\}$로 표현하며, 각 $G^t$는 노드 $V^t$, 간선 $E^t$, 노드 속성 $x_v^t$를 가진 시간적 그래프릿이다.
  • 가설 생성을 $t=1$에서 $T$까지의 $E^t$의 진화를 바탕으로 $V^T$ 내의 연결되지 않은 노드 간의 미래 연결 예측 문제로 정의한다.
  • 무단일(PU) 학습을 적용하여, 관측되지 않은 간선을 모두 음성으로 간주하는 것이 아니라, 양성 및 음성 샘플의 혼합물로 간주한다.
  • 양성 사전 확률 $\pi$ — 즉, 양성 샘플을 관측할 확률 — 를 음성 및 무단일 데이터로부터 추정하기 위해 변분 추론 모델을 도입한다.
  • 추정된 양성 사전 확률를 포함하는 노드 쌍 임베딩을 사용하여, PU 학습 설정에서 편향 없는 위험을 최소화하는 링크 예측 모델을 훈련한다.
  • 실제 생물의학적 용어 공출현 데이터(1945–2020)를 기반으로 종단간으로 훈련된 임베딩을 사용하여 링크 예측을 수행한다.

실험 결과

연구 질문

  • RQ1PU 학습 프레임워크는 동적 과학 문헌 내에서 생물의학적 용어 관계의 시간적 진화를 효과적으로 모델링할 수 있는가?
  • RQ2변분 추론 기반의 양성 사전 확률 추정은 고정된 또는 히우리스틱 기반의 사전 확률 가정보다 링크 예측 성능을 어떻게 향상시키는가?
  • RQ3학습 데이터에 존재하지 않지만 생물학적으로 타당한 관계(예: 담배와 코로나19 사이의 관계)를 포함한 새로운 관측되지 않은 관계를 모델이 얼마나 잘 탐지할 수 있는가?
  • RQ4제안된 시간적 PU 학습 접근법은 기존의 양성-음성(PN) 학습 및 정적 PU 학습보다 생물의학적 그래프에서의 미래 연결 예측 성능에서 뛰어나게 되는가?
  • RQ5학습된 노드 쌍 임베딩이 진정한 양성 샘플과 음성 샘플, 관측되지 않은 양성 샘플을 임베딩 공간에서 얼마나 잘 분리하는가?

주요 결과

  • TRP는 3만 개의 노드와 100만~200만 개의 간선을 가진 실제 생물의학적 용어 관계 데이터셋에서 최고 수준의 PU 학습 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 학습 데이터에 존재하지 않았지만 후속 문헌에서 지지되는, 담배와 코로나19 사이의 새로운 생물학적으로 타당한 관계를 성공적으로 예측하였다.
  • 학습된 임베딩의 시각화 결과에서 명확한 클러스터링이 관찰되었으며, 진정한 양성 샘플(파랑)과 예측된 음성 샘플(빨강)은 잘 분리되어 있었고, 관측되지 않은 양성 샘플(초록)은 진정한 양성 샘플에 가까이 위치하여 PU 가정의 타당성을 검증하였다.
  • 변분 추론 기반의 양성 사전 확률 추정은 고정된 사전 확률 가정에 비해 모델 일반화 능력 향상과 위험 추정의 편향 감소에 기여하였다.
  • 모델은 시간적 동역학을 효과적으로 포착하였으며, 용어 관계의 시간적 진화를 모델링함으로써 가설 생성 성능 향상이 가능하다는 것을 보여주었다.
  • 사례 연구를 통해 기존 과학 문헌에서 의미 있고 해석 가능하며 적시에 가설을 도출할 수 있는 능력을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.