Skip to main content
QUICK REVIEW

[論文レビュー] Evolution Is All You Need: Phylogenetic Augmentation for Contrastive Learning

Amy X. Lu, Alex X. Lu|arXiv (Cornell University)|Dec 25, 2020
Genomics and Phylogenetic Studies参考文献 53被引用数 8
ひとこと要約

本稿では、生物学的配列における対照的自己教師付き表現学習において、分子進化を自然なデータ拡張戦略として用いることを提案する。進化経路をビューとみなすことにより、相同配列間の相互情報量を最大化し、高コストな実験的ラベルを一切必要としない、強固で機能的に関連する埋め込み表現を生成する。

ABSTRACT

Self-supervised representation learning of biological sequence embeddings alleviates computational resource constraints on downstream tasks while circumventing expensive experimental label acquisition. However, existing methods mostly borrow directly from large language models designed for NLP, rather than with bioinformatics philosophies in mind. Recently, contrastive mutual information maximization methods have achieved state-of-the-art representations for ImageNet. In this perspective piece, we discuss how viewing evolution as natural sequence augmentation and maximizing information across phylogenetic "noisy channels" is a biologically and theoretically desirable objective for pretraining encoders. We first provide a review of current contrastive learning literature, then provide an illustrative example where we show that contrastive learning using evolutionary augmentation can be used as a representation learning objective which maximizes the mutual information between biological sequences and their conserved function, and finally outline rationale for this approach.

研究の動機と目的

  • 生物学的配列における自己教師付き学習手法に存在するギャップに取り組むこと。現行の手法は主に自然言語処理(NLP)の手法を借用しているが、生物学的情報学の原則に即したものではない。
  • 分子進化が対照的学習のための生物学的に意味のある、理論的にも妥当なデータ拡張戦略として機能しうるかを検討すること。
  • 進化的拡張が、配列とその保存された機能との間の相互情報量を最大化する対照的学習を可能にすることを実証すること。
  • 進化を自然な「ノイズの混入チャンネル」として用いることの理論的・生物学的根拠を提示すること。
  • 進化的拡張を、多様な下流生物学的タスクに適用可能な弱教師付きで普遍的な表現学習手法として位置づけること。

提案手法

  • 系統樹から抽出した進化経路 $t_1, t_2 \sim \mathcal{T}$ を用いて、分子進化を自然なデータ拡張プロセスとみなす。これにより、$v_1 = t_1(x)$ および $v_2 = t_2(x)$ の2つのビューが生成される。
  • 対照的学習に InfoNCE 損失を適用し、2つの進化的ビュー間の相互情報量を最大化する。損失関数は $\mathcal{L}_{\text{NCE}} = -\mathbb{E}_{v_1,v_2^+,v_2^-} \left[ \log \frac{\exp(f(g_1(v_1),g_2(v_2^+))}{\sum_{j=1}^N \exp(f(g_1(v_1),g_2(v_2^-_j)))} \right]$ で定義される。
  • 共通のエンコーダ $g$ を用いてビューを潜在表現 $z_1 = g(v_1)$, $z_2 = g(v_2)$ にマップし、正例ペアと $N-1$ 個の負例ペアを区別する対照的目的関数を導入する。
  • InfoMin 原理に従い、共有される相互情報量 $I(v_1;v_2)$ を最小化しつつ、タスク関連の情報を保持するビュー選択を行う。系統的距離を制御パrameterとして用いる。
  • 進化的保存を、下流タスクのラベルの代理として用いることで、明示的なラベルを必要としない暗黙の教師付き対照的学習を可能にする。
  • 正例ペアのスコアを評価するためのクリティック関数 $f$ を導入し、モデルが不要な変動に対して不変で、保存された機能的特徴に対して敏感な表現を学習できるようにする。

実験結果

リサーチクエスチョン

  • RQ1分子進化は、生物学的配列における対照的自己教師付き学習の文脈で、効果的なデータ拡張戦略として機能するか?
  • RQ2進化的拡張は、配列とその保存された生物学的機能との間の相互情報量を保持する表現を生成するか?
  • RQ3標準的なNLP由来の拡張と比較して、理論的根拠および生物学的妥当性において、進化的拡張は優れているか?
  • RQ4実験的アノテーションが存在しない状況でも、進化的ビューは下流タスクのラベルの弱教師付き代理として機能するか?
  • RQ5系統的距離をビュー間の制御変数として用いることで、InfoMin 原理に従い、対照的学習目的関数が最適化される程度はどの程度か?

主な発見

  • 進化的拡張は、ゲノタイプからフェノタイプへの情報伝達プロセスと整合する生物学的に根拠のある、理論的にも妥当なビュー生成手法を提供する。
  • 本手法は、相互情報量 $I(v_1;v_2)$ の下界を達成し、相同配列に由来する保存された機能的要素を持つビュー同士でその値が最大に達する。
  • ビュー間の系統的距離を制御することで、共有される相互情報量を最小化しつつ、機能的に関連する特徴を保持することができ、InfoMin 原理を満たす。
  • 進化的保存は、下流タスクのラベルの意味的代理として機能し、明示的なラベルを必要としない弱教師付き対照的学習を可能にする。
  • 本手法は、構造予測、機能アノテーション、リモート相同性検出といった多様な下流タスクに適用可能な普遍的な表現を自然にサポートする。
  • 理論的分析により、共有情報量を最小化し、タスク関連情報量を保持する条件下で、進化的ビューは InfoMin フレームワークにおいて最適であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。