[論文レビュー] Neural Architecture Search for Joint Optimization of Predictive Power and Biological Knowledge
BioNAS は、ゲノム分野の深層学習モデルにおける予測性能と生物学的知識の一貫性を共同で最適化するニューラルアーキテクチャ探索フレームワークである。知識の不一致関数を統合することで、BioNAS は予測可能な畳み込みニューラルネットワークアーキテクチャを発見し、既存の in vitro データを超えて、U2AF2 3′-スプライシングサイトパターンといった新しいレギュラトリーモチーフを明らかにする。これにより、機能ゲノム学におけるモデルの解釈可能性と生物学的洞察が向上する。
We report a neural architecture search framework, BioNAS, that is tailored for biomedical researchers to easily build, evaluate, and uncover novel knowledge from interpretable deep learning models. The introduction of knowledge dissimilarity functions in BioNAS enables the joint optimization of predictive power and biological knowledge through searching architectures in a model space. By optimizing the consistency with existing knowledge, we demonstrate that BioNAS optimal models reveal novel knowledge in both simulated data and in real data of functional genomics. BioNAS provides a useful tool for domain experts to inject their prior belief into automated machine learning and therefore making deep learning easily accessible to practitioners. BioNAS is available at https://github.com/zj-zhang/BioNAS-pub.
研究の動機と目的
- 深層学習のブラックボックス性に取り組むために、モデル探索に生物学的知識を統合する。
- ライフサイエンス分野の研究者が深層学習を採用する際の計算的・技術的障壁を低減する。
- 既存の実験的知識とモデルの一貫性を最適化することで、新しい生物学的知見の発見を可能にする。
- ゲノム配列解析のための畳み込みニューラルネットワークアーキテクチャにおいて、予測精度と解釈可能性のバランスを取る。
- 学習済みフィルタに既知および新しいモチーフをアノテーションすることで、下流の生物学的解釈を促進する。
提案手法
- モデルが学習したフィルタと既存の生物学的知識との一貫性を測定する汎用的な知識の不一致関数の族を導入する。
- 検証損失と知識の不一致の両方を最適化する、コントローラーに基づくニューラルアーキテクチャ探索(NAS)フレームワークを構築する。
- 畳み込みニューラルネットワークの入力として、ワンホットエンコードされたゲノム配列を用い、シーケンス特性のエンドツーエンド学習を実現する。
- 既知のRBP結合パターンとのモチーフマッチングを用いて、訓練済みの畳み込みフィルタを生物学的に解釈可能なモチーフに変換する。
- eCLIP(in vivo 結合)とRNAcompete(in vitro モチーフ)の直交データセットを活用し、既存知識の検証および拡張を行う。
- 9層にわたる1,166,400のアーキテクチャをカバーする探索空間を用いて、高い解釈可能性と性能を兼ね備えた多様なモデル構成を探索する。
実験結果
リサーチクエスチョン
- RQ1生物学的知識によって効果的に誘導されたニューラルアーキテクチャ探索は、予測性能を損なわせることなく、モデルの解釈性を向上させることができるか?
- RQ2既存の実験的知識(例:RNAcompete からのもの)を、ゲノム分野の深層学習モデル探索に体系的に統合する方法は何か?
- RQ3eCLIP などの in vivo データを活用することで、BioNAS は、従来の in vitro 実験に存在しなかった新しい生物学的モチーフを同定できるか?
- RQ4知識を意識したアーキテクチャ探索は、最初の畳み込み層のフィルタの生物学的解釈性をどの程度向上させるか?
- RQ5標準的な学習アプローチでは見逃されがちな、スプライシングシグナルのような生物学的に意味のある配列パターンを、このフレームワークは同定できるか?
主な発見
- BioNAS は、in vitro の RNAcompete データに存在しないがスプライシングの正確性に不可欠な、eCLIP データから U2AF2 3′-スプライシングサイトパターン AG を効果的に同定した。
- U2AF2、QKI、RBFOX2、RBM5 のモデル学習モチーフは、既知の RNAcompete モチーフと高い類似性を示した一方で、新たなフラッギング配列の好みも明らかにした。
- 知識の不一致と検証損失の両方がトレーニングの反復回数に伴い減少したため、予測力と知識の一貫性の有効な共同最適化が行われたことが示された。
- BioNAS が最適化したモデルは高い予測性能を達成するとともに、生物学的機能にアノテーション可能な解釈可能なフィルタを生成した。
- このフレームワークは、in vivo データと従来の in vitro 知識を組み合わせることで、スプライシングシグナルのような生物学的に関連性のあるパターンを同定した。
- 知識に配慮したアーキテクチャ探索を統合することで、従来の方法では検出されない新しいレギュラトリーモチーフを、BioNAS が同定できる能力を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。