[論文レビュー] Temporal Positive-unlabeled Learning for Biomedical Hypothesis Generation via Risk Estimation
本稿では、変分推論を用いて陽性事前確率を推定することで、動的となる用語関係をモデル化する、生物医学的仮説生成のための時系列的正例-未ラベル例(PU)学習フレームワークであるTRPを提案する。時間的変化する属性付きグラフレットの系列におけるノードペア埋め込みを学習することで、TobaccoとCOVID-19のような未観測の新しい関係を含む、将来の用語関係の予測において、最先端のPU手法を上回る性能を発揮する。
Understanding the relationships between biomedical terms like viruses, drugs, and symptoms is essential in the fight against diseases. Many attempts have been made to introduce the use of machine learning to the scientific process of hypothesis generation(HG), which refers to the discovery of meaningful implicit connections between biomedical terms. However, most existing methods fail to truly capture the temporal dynamics of scientific term relations and also assume unobserved connections to be irrelevant (i.e., in a positive-negative (PN) learning setting). To break these limits, we formulate this HG problem as future connectivity prediction task on a dynamic attributed graph via positive-unlabeled (PU) learning. Then, the key is to capture the temporal evolution of node pair (term pair) relations from just the positive and unlabeled data. We propose a variational inference model to estimate the positive prior, and incorporate it in the learning of node pair embeddings, which are then used for link prediction. Experiment results on real-world biomedical term relationship datasets and case study analyses on a COVID-19 dataset validate the effectiveness of the proposed model.
研究の動機と目的
- 仮説生成手法の限界に対処する。具体的には、未観測の用語関係をすべて負例と仮定する手法は、科学的発見におけるオープンワールド仮定に反する。
- 1945年から2020年までの期間にわたる、逐次的なグラフレットから構成される動的属性付きグラフ構造を用いて、生物医学的用語関係の時系列的進化をモデル化する。
- 陽性-未ラベル(PU)学習設定下で、動的グラフ上の将来の接続性予測タスクとして仮説生成を定式化する。ここで未ラベルエッジは、正例と負例の混合とみなす。
- 事前知識やラベル付き負例に依存せずに、陽性と未ラベルデータから陽性事前確率を推定する、変分推論に基づく手法を開発する。
- 時間的ダイナミクスを捉え、新しい生物医学的仮説の正確なリンク予測を支援する、エンドツーエンドのノードペア埋め込みの学習を可能にする。
提案手法
- 生物医学的用語関係を、各$G^t$がノード$V^t$、エッジ$E^t$、ノード属性$x_v^t$を有する時系列的グラフレットから成る動的属性付きグラフ$G = \{G^1, G^2, ..., G^T\}$として表現する。
- 仮説生成を、$t=1$から$T$まで$E^t$の進化に基づき、$V^T$内の非接続ノードペアの将来のリンクを予測するタスクとして定式化する。
- 未観測エッジをすべて負例と仮定するのではなく、正例と負例の混合とみなす、正例-未ラベル(PU)学習を適用する。
- 陽性事前確率$\pi$(正例を観測する確率)を、陽性および未ラベルデータから推定するための変分推論モデルを導入する。
- 推定された陽性事前確率を組み込んだノードペア埋め込みを用いて、PU学習設定下での不偏リスクを最小化するリンク予測モデルを訓練する。
- 1945年から2020年までの実世界の生物医学的用語共起データ上で、エンドツーエンドに訓練された埋め込みをリンク予測に使用する。
実験結果
リサーチクエスチョン
- RQ1PU学習フレームワークは、動的科学文献における生物医学的用語関係の時系列的進化を効果的にモデル化できるか?
- RQ2変分推論に基づく陽性事前確率推定は、固定またはヒューリスティックな事前確率仮定と比較して、リンク予測性能をどのように向上させるか?
- RQ3本モデルは、訓練データに存在しないが生物学的に妥当な用語関係(例:TobaccoとCOVID-19の関係)を、どの程度検出できるか?
- RQ4提案された時系列的PU学習アプローチは、従来の陽性-負例(PN)学習や静的PU学習に比べ、生物医学的グラフにおける将来の接続性予測で優れているか?
- RQ5学習されたノードペア埋め込みは、埋め込み空間内で真の正例と負例、および未観測の正例をどの程度良好に分離できるか?
主な発見
- TRPは、3万ノード、100万~200万エッジを有する実世界の生物医学的用語関係データセットにおいて、最先端のPU学習手法を著しく上回る性能を発揮した。
- 本モデルは、訓練データに存在しなかったが、後続の文献で裏付けられる生物学的に妥当な新しい関係(例:TobaccoとCOVID-19の関係)を正しく予測した。
- 学習済み埋め込みの可視化から、明確なクラスタリングが観察された。真の正例(青)と予測された負例(赤)は良好に分離されており、未観測の正例(緑)は真の正例に近接している。これはPU仮定の妥当性を裏付けている。
- 変分推論に基づく陽性事前確率推定は、固定事前確率仮定と比較して、モデルの汎化性能を向上させるとともに、リスク推定のバイアスを低減した。
- 本モデルは時間的ダイナミクスを効果的に捉えており、用語関係の時間的進化をモデル化することで、仮説生成の性能が向上することを示した。
- 事例研究により、本手法が歴史的科学的文献から意味的で解釈可能かつタイムリーな生物医学的仮説を生成できることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。