[论文解读] A mechanistically interpretable neural network for regulatory genomics
本文提出ARGMINN,一种用于调控基因组学的机制可解释深度神经网络,其通过可学习的权重和激活直接编码基序及其句法关系。通过结合滤波器正则化以强制实现非冗余的基序学习,以及改进的注意力机制以实现基序实例的即时检测,ARGMINN实现了完全可解释的基序发现、对序列变异的鲁棒性,以及新颖功能序列的生成——同时保持对复杂调控句法的完整表达能力。
Deep neural networks excel in mapping genomic DNA sequences to associated readouts (e.g., protein-DNA binding). Beyond prediction, the goal of these networks is to reveal to scientists the underlying motifs (and their syntax) which drive genome regulation. Traditional methods that extract motifs from convolutional filters suffer from the uninterpretable dispersion of information across filters and layers. Other methods which rely on importance scores can be unstable and unreliable. Instead, we designed a novel mechanistically interpretable architecture for regulatory genomics, where motifs and their syntax are directly encoded and readable from the learned weights and activations. We provide theoretical and empirical evidence of our architecture's full expressivity, while still being highly interpretable. Through several experiments, we show that our architecture excels in de novo motif discovery and motif instance calling, is robust to variable sequence contexts, and enables fully interpretable generation of novel functional sequences.
研究动机与目标
- 为解决现有深度学习模型在调控基因组学中的局限性,即基序发现因信息在滤波器间分散以及重要性评分不可靠而受阻。
- 开发一种神经网络架构,直接在可解释、可读的权重和激活中编码具有生物意义的基序及其句法构型。
- 确保模型在实现机制可解释性的同时,不依赖事后分析流程,仍保持对复杂调控句法的完整表达能力。
- 实现在包括对抗性扰动在内的各种序列上下文中的鲁棒基序发现与实例识别。
- 展示基于学习到的基序模式生成功能有效且可解释的DNA序列的新型能力。
提出的方法
- 提出一种新颖架构ARGMINN,整合滤波器正则化,以在第一层卷积滤波器中强制实现非冗余的基序学习。
- 引入一种改进的自注意力机制,可在单次前向传播中直接揭示基序实例及其句法关系(如间距、方向)。
- 采用结合滤波器重叠正则化与L1稀疏性的损失函数,以促进独特且具有生物学意义的基序表征。
- 使用TOMTOM将发现的基序与已知的位置权重矩阵(PWMs)对齐,以实现对基序可解释性的定量评估。
- 利用多个独立验证器——包括ARGMINN自身、Borzoi以及微调后的Enformer——在计算机中验证生成序列的功能性。
- 采用具有严格句法规则(如10 bp间距的左右基序顺序)的模拟REST数据集,以测试模型学习和表示复杂调控句法的能力。

实验结果
研究问题
- RQ1是否可以设计一种深度神经网络架构,使得基序及其句法关系可直接从学习到的权重和激活中读取,而无需依赖事后解释方法?
- RQ2所提出的架构是否保持对复杂调控基序和句法规则(包括非平凡的间距和方向依赖)的完整表达能力?
- RQ3模型在面对自然变异和对抗性序列变异时,其基序发现与实例识别能力有多鲁棒?
- RQ4模型是否能够基于学习到的基序模式,生成新颖、功能有效且可解释的DNA序列?
- RQ5与现有方法相比,该模型的可解释性在稳定性、准确性和生物学相关性方面表现如何?
主要发现
- ARGMINN在基序发现及基序实例/句法分析方面优于现有方法,在识别真实基序及其构型方面表现出高精度。
- 该模型对序列扰动(包括二核苷酸随机重排和对抗性编辑)表现出鲁棒性,维持了准确的基序检测能力。
- ARGMINN实现了完全可解释的序列生成:每种基序模式生成100条新序列,所有序列均被多个独立验证器(ARGMINN、Borzoi和微调后的Enformer)预测为功能有效。
- 在模拟REST数据集中,ARGMINN成功学习到精确的结合句法(左-右基序顺序,间距10 bp),在句法保真度方面优于基线模型。
- 滤波器正则化与注意力机制协同作用,确保基序非冗余且可直接解释,无需复杂的事后分析流程。
- ARGMINN的损失权重鲁棒性在100次不同正则化权重的训练运行中得到验证,所有设置下均保持一致的基序发现性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。