QUICK REVIEW
[論文レビュー] Convolutional Kitchen Sinks for Transcription Factor Binding Site Prediction
Alyssa Morrow, Vaishaal Shankar|arXiv (Cornell University)|May 31, 2017
Genomics and Chromatin Dynamics参考文献 9被引用数 14
ひとこと要約
この論文では、i.i.d. ガウス分布から抽出された重みを有する1層の畳み込みニューラルネットワークから得られるランダム特徴マップを用い、その後に線形分類を適用することで、転写因子結合部位を高速かつ高精度に予測する手法である畳み込みキッチンシンクス(CKS)を提案する。CKSは6つのENCODEデータセットのうち5つで最先端のディープラーニングモデルを上回り、学習時間を1/8未満にまで短縮した。
ABSTRACT
We present a simple and efficient method for prediction of transcription factor binding sites from DNA sequence. Our method computes a random approximation of a convolutional kernel feature map from DNA sequence and then learns a linear model from the approximated feature map. Our method outperforms state-of-the-art deep learning methods on five out of six test datasets from the ENCODE consortium, while training in less than one eighth the time.
研究の動機と目的
- DNA配列から転写因子結合部位を計算的に効率的かつ高精度に予測する手法の開発。
- データセットサイズに比例してO(n²)のスケーリングを示す従来の文字列カーネル手法の高い計算コストと学習の複雑さを克服すること。
- DeepBindなどのディープラーニングモデルを改善し、学習時間を短縮しながら予測性能を維持または向上させること。
- 膨大なハイパーパrameterチューニングを必要とせず、複雑なCNNアーキテクチャの代替として簡潔でスケーラブルな手法を提供すること。
- ランダム特徴射影から得られる強固な配列表現を学習することで、さまざまな細胞内環境に一般化可能であることを実現すること。
提案手法
- DNA配列から特徴マップを生成するために、N(0, γIₙ)から抽出されたi.i.d. ガウス分布の重みを有する1層のランダム畳み込みニューラルネットワークを用いる。
- 各フィルタが入力配列と畳みこまれ、出力はU(0, 2π)から抽出されたランダムな位相シフトを伴うコサイン活性化関数を通過する。
- 最終的な特徴表現は、すべてのフィルタのコサイン変換出力を平均化し、√(2/M)でスケーリングすることで得られる。ここでMはフィルタ数である。
- 二値分類タスク(結合・非結合TF部位の区別)を解くために、L2正則化を施した線形分類器を、得られたランダム特徴マップ上で学習する。
- カーネル近似は、ガウス重み付きハミング距離を用いて部分文字列間の類似度を測る畳み込みn-gramカーネルに基づいている。
- この手法は、Rahimi & Recht(2009)のランダムキッチンシンクスにインspiredされ、ここでは配列データにおける畳み込み構造に適応されている。
実験結果
リサーチクエスチョン
- RQ1固定されたランダム重みを有するランダム化された1層畳み込みネットワークが、ディープラーニングモデルと比較して、TF結合部位予測において競争力のある性能を達成できるか?
- RQ2提案手法が大規模ゲノムデータセットにおいて、予測精度を維持または向上させつつ、学習時間を顕著に短縮できるか?
- RQ3さまざまな転写因子と細胞タイプの組み合わせにおいて、CKSの性能はDeepBindのような最先端のディープラーニングモデルと比べてどの程度か?
- RQ4再トレーニングなしで、さまざまな細胞内環境にどの程度一般化できるか?
- RQ5畳み込み構造におけるランダム特徴射影が、正確なTF結合予測に必要な空間不変性と配列特異性を保持できるか?
主な発見
- CKSはENCODEコンsortiumの6つのテストデータセットのうち5つでDeepBindをAUC面で上回り、全データセットで同等または優れた性能を示した。
- K562細胞で学習したEGR1データセットにおいて、CKSはAUC 0.96を達成したのに対し、DeepBindは0.91であった。学習時間はCKSが712秒、DeepBindが6497秒であった。
- CKSはDeepBindの1/8未満の時間で学習が完了し、最大のデータセット(72,996配列)では約8.5倍の学習スピードアップを達成した。
- 小規模テストセット(1000配列)および大規模ENCODEテストセット(100,000配列)の両方で、CKSはDeepBindと同等または優れたAUCを達成した。
- CKSは細胞タイプ間での一般化性が強く、H1-hESCおよびHepG2でのATF3ではAUC 0.94~0.95を達成し、HeLa-S3およびK562でのCEBPBではAUC 0.99を記録した。
- n(畳み込みサイズ)およびM(フィルタ数)のハイパーパrameterチューニングを一切行わず、固定されたアーキテクチャを用いても、多様なTFおよび細胞線で一貫した性能を発揮した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。