[論文レビュー] Unsupervised Representation Learning of DNA Sequences
本稿では、長く可変長のDNA配列の固定長の潜在表現を学習するために、双方向および単方向LSTMを用いた非教師ありsequence-to-sequenceオートエンコーダーを提案する。この手法はスプライスサイト分類において最先端の性能を達成し、事前学習済み重みを用いることで99.07%の正確度を達成しており、モデルの帰属分析により、GTおよびAGスプライスシグナルといった既知の生物学的モチーフが学習された表現に捉えられていることが確認された。
Recently several deep learning models have been used for DNA sequence based classification tasks. Often such tasks require long and variable length DNA sequences in the input. In this work, we use a sequence-to-sequence autoencoder model to learn a latent representation of a fixed dimension for long and variable length DNA sequences in an unsupervised manner. We evaluate both quantitatively and qualitatively the learned latent representation for a supervised task of splice site classification. The quantitative evaluation is done under two different settings. Our experiments show that these representations can be used as features or priors in closely related tasks such as splice site classification. Further, in our qualitative analysis, we use a model attribution technique Integrated Gradients to infer significant sequence signatures influencing the classification accuracy. We show the identified splice signatures resemble well with the existing knowledge.
研究の動機と目的
- 長く可変長のDNA配列を、非教師ありの方法で固定長の汎用的表現に学習すること。
- これらの学習された表現が、スプライスサイト分類のような下流のゲノム的タスクにおける有効な特徴量または事前知識として機能するかどうかを評価すること。
- モデル帰属技術を用いて、学習された表現の生物学的妥当性を検証すること。
- 非教師あり事前学習が、教師あり分類タスクにおける収束性および性能を向上させることを示すこと。
提案手法
- 可変長のDNA配列を固定256次元の潜在埋め込みにマッピングするために、双方向LSTMエンコーダーと単方向LSTMデコーダーを備えたsequence-to-sequenceオートエンコーダーを用いる。
- モデルは、潜在埋め込みから元の入力配列を再構築するように訓練され、これにより表現が重要な配列モチーフおよび依存関係を捉えるように強制される。
- 事前学習済みエンコーダー重みを分類器の初期化に用い、学習された潜在埋め込みをSVM、ANN、および通常のRNN分類器の入力特徴量として使用する。
- 統合勾配法を用いて、予測スコアを入力ヌクレオチドに帰属させ、スプライスサイト分類に影響を与える領域およびモチーフを同定する。
- 統合勾配法の基準としてゼロ埋め込みを用い、基準から入力への経路に沿って200ステップにわたり勾配を蓄積する。
- 帰属スコアから配列ロゴを生成し、GT(ドナー)およびAG(アクセプター)シグナルのような保存されたモチーフを可視化する。
実験結果
リサーチクエスチョン
- RQ1非教師ありオートエンコーダーは、長く可変長のDNA配列に対して意味のある固定長の表現を学習できるか?
- RQ2学習された潜在表現は、スプライスサイト分類のような下流の教師ありタスクにおける性能を向上させるか?
- RQ3表現は生物学的に解釈可能であり、GT-AGシグナルのような既知のスプライシングモチーフを捉えているか?
- RQ4統合勾配法のようなモデル帰属技術は、学習された表現に基づいて、DNA配列内の機能的に関連する領域を同定できるか?
主な発見
- 事前学習済みエンコーダー重みを分類器の初期化に用いることで、スプライスサイト分類タスクにおいて99.07%のテスト正確度を達成した。
- 学習された256次元の潜在埋め込みを入力として使用した単純なSVMは98.63%の正確度を達成し、埋め込みの表現品質が裏付けられた。
- 統合勾配法による帰属分析により、スプライスサイト付近(特にドナーにおけるGTおよびアクセプターにおけるAG)のヌクレオチドが予測に最も大きな影響を与えていたことが判明し、既知の生物学的メカニズムと整合した。
- 帰属スコアから生成された配列ロゴは、顕著なGTおよびAGモチーフを明確に強調しており、モデルが既知の生物学的シグナルを学習できていることを確認した。
- 事前学習済み重みの使用により、複数の分類器アーキテクチャ(SVM、ANN、RNN)において収束が速まり、正確度が向上した。
- 定性的な分析から、モデルは生物学的に関連する領域を正しく同定しており、ドナー部位におけるヌクレオチドGが非常に影響力が高く、既存の知見と一致した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。