[論文レビュー] A mechanistically interpretable neural network for regulatory genomics
この論文では、学習可能な重みと活性化にモチーフとその句法学的関係を直接符号化する、レギュラトリージェノミクス向けの機械的解釈可能な深層ニューラルネットワーク、ARGMINNを紹介する。フィルターレギュライゼーションを組み合わせて重複のないモチーフ学習を促進し、即時のモチーフインスタンス検出を可能にする修正されたアテンションメカニズムを用いることで、ARGMINNは完全に解釈可能なモチーフ発見、配列変異に対するロバストネス、および新たな機能的配列の生成を実現する。同時に、複雑なレギュラトリィ構文を完全に表現できる能力を維持する。
Deep neural networks excel in mapping genomic DNA sequences to associated readouts (e.g., protein-DNA binding). Beyond prediction, the goal of these networks is to reveal to scientists the underlying motifs (and their syntax) which drive genome regulation. Traditional methods that extract motifs from convolutional filters suffer from the uninterpretable dispersion of information across filters and layers. Other methods which rely on importance scores can be unstable and unreliable. Instead, we designed a novel mechanistically interpretable architecture for regulatory genomics, where motifs and their syntax are directly encoded and readable from the learned weights and activations. We provide theoretical and empirical evidence of our architecture's full expressivity, while still being highly interpretable. Through several experiments, we show that our architecture excels in de novo motif discovery and motif instance calling, is robust to variable sequence contexts, and enables fully interpretable generation of novel functional sequences.
研究の動機と目的
- 既存の深層学習モデルが、フィルタを横断して分散情報が存在し、信頼性の低い重要度スコアを示すという制限を克服すること。
- 生物学的に意味のあるモチーフとその句法学的構成を、解釈可能で読み取り可能な重みと活性化に直接符号化するニューラルネットワークアーキテクチャの開発。
- 後処理パイプラインなしで、複雑なレギュラトリィ構文を完全に表現できる能力を維持しながら、機械的解釈可能性を実現すること。
- 自然および悪意ある配列変異に対しても、モチーフ発見とインスタンス同定がロバストであることを保証すること。
- 学習したモチーフパターンに基づいて、解釈可能で生物学的に妥当な新しい機能的DNA配列を生成するという、新規な能力の実証。
提案手法
- 最初の畳み込み層のフィルタに、重複のないモチーフ学習を促進するフィルターレギュライゼーションを組み込んだ、新規なアーキテクチャ、ARGMINNを提案。
- 1回の順伝播でモチーフインスタンスとその句法学的関係(例:間隔、配置)を直接明らかにする、修正された自己アテンションメカニズムを導入。
- フィルターオーバーラップ正則化とL1スパarsityを組み合わせた損失関数を用い、明確で生物学的に関連のあるモチーフ表現を促進。
- TOMTOMを用いて、発見されたモチーフを既知の位置加重行列(PWMs)とアラインメントし、モチーフの解釈可能性の定量的評価を可能にする。
- 生成された配列の機能性をインシリコで検証するために、ARGMINN自体、Borzoi、および微調整されたEnformerを含む複数のオラクルを用いる。
- 厳密な構文的ルール(例:10 bp間隔の左-右モチーフ順序)を有するシミュレーテッドRESTデータセットを用い、モデルが複雑なレギュラトリィ構文を学習・表現できる能力をテスト。

実験結果
リサーチクエスチョン
- RQ1フィルタの重みと活性化から直接読み取れるように、モチーフとその句法学的関係を符号化できる深層ニューラルネットワークアーキテクチャを設計できるか?
- RQ2提案されたアーキテクチャは、非自明な間隔や配置依存性を含む、複雑なレギュラトリィモチーフと構文ルールを完全に表現できるか?
- RQ3自然および悪意ある配列変異に対して、モデルのモチーフ発見とインスタンス同定はどの程度ロバストか?
- RQ4学習したモチーフパターンに基づいて、解釈可能で生物学的に妥当な新しい機能的DNA配列を生成できるか?
- RQ5安定性、正確性、生物学的妥当性という観点から、既存の手法と比較して、モデルの解釈性はどの程度優れているか?
主な発見
- ARGMINNは、既存の手法に比べて優れたモチーフ発見とモチーフインスタンス/構文解析を達成し、真のモチーフとその構成の正確な同定が可能である。
- モデルは、二ヌクレオチドシャッフルや悪意ある編集を含む配列の摂動に対してもロバストであり、正確なモチーフ検出を維持している。
- ARGMINNは完全に解釈可能な配列生成を可能にした:1つのモチーフパターンあたり100の新しい配列が生成され、すべての独立したオラクル(ARGMINN、Borzoi、微調整されたEnformer)によって機能的であると予測された。
- シミュレーテッドRESTデータセットにおいて、ARGMINNは正確な結合構文(10 bp間隔の左-右モチーフ順序)を学習し、構文的正確性においてベースラインモデルを上回った。
- フィルターレギュライゼーションとアテンションメカニズムが共同で、重複のないモチーフと直接解釈可能なモチーフを保証し、複雑な後処理パイプラインの必要がない。
- 100回のトレーニングランで異なる正則化重みを用いて、損失重みのロバストネスを検証した結果、すべての設定で一貫したモチーフ発見性能が得られた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。