[论文解读] Break It Down: Evidence for Structural Compositionality in Neural Networks
本文引入了神经网络的结构组合性(structural compositionality)这一属性,通过模型剪枝证明了众多视觉与语言模型通过模块化、可移除的子网络实现子程序。关键发现是,模型通常将复杂任务分解为离散的功能组件,表明其在无符号机制的情况下隐含地实现了组合性。
Though modern neural networks have achieved impressive performance in both vision and language tasks, we know little about the functions that they implement. One possibility is that neural networks implicitly break down complex tasks into subroutines, implement modular solutions to these subroutines, and compose them into an overall solution to a task - a property we term structural compositionality. Another possibility is that they may simply learn to match new inputs to learned templates, eliding task decomposition entirely. Here, we leverage model pruning techniques to investigate this question in both vision and language across a variety of architectures, tasks, and pretraining regimens. Our results demonstrate that models often implement solutions to subroutines via modular subnetworks, which can be ablated while maintaining the functionality of other subnetworks. This suggests that neural networks may be able to learn compositionality, obviating the need for specialized symbolic mechanisms.
研究动机与目标
- 探究现代神经网络是否通过模块化子网络而非模板匹配隐式实现组合性解决方案。
- 确定结构组合性是否在预训练模型中出现,以及预训练如何影响其形成。
- 开发并应用一种基于剪枝的方法,以检测和分析支持特定子程序的模块化子网络。
- 评估不同子程序的子网络是否可独立移除,同时保持其他子程序的功能稳定,以表明其模块性。
提出的方法
- 作者使用连续稀疏化与迭代剪枝,识别在特定子程序上保持性能的稀疏子网络。
- 将结构组合性定义为:子网络在某一子程序上表现高准确率,而在另一子程序上表现低准确率,表明其具有功能模块性。
- 通过掩码权重并评估在需要特定子程序(如视觉任务中的“inside”与“contact”)的样本上的表现,来发现子网络。
- 通过测量在每种子程序所需样本上的准确率差异来衡量性能差异,正向差异表示组合性结构。
- 使用交并比(IoU)在各层上量化子网络重叠,以评估一致性和模块性。
- 该分析应用于视觉模型(ResNet50 在 Number-Contact 上)与语言模型,并在不同预训练范式之间进行比较。

实验结果
研究问题
- RQ1神经网络是否通过模块化、可重用的子网络实现复杂任务,且这些子网络对应于不同的子程序?
- RQ2是否可以独立移除子网络,使得某一子程序的性能下降,而另一子程序的性能保持稳定?
- RQ3无监督预训练在多大程度上增强了微调模型的结构组合性?
- RQ4针对同一子程序,多次运行中发现的子网络在多大程度上保持一致?不同子程序之间的子网络又如何比较?
- RQ5不同子程序的子网络是否表现出低重叠,表明其功能上的分离?
主要发现
- 剪枝结果表明,许多模型通过模块化子网络实现子程序,且子程序间的性能差异表明其具有功能专一性。
- 在视觉任务的“Inside”子程序中,子网络在不同层上表现出高 IoU(如 backbone.layer4.0.conv1 处达 0.974),表明其具有稳定且模块化的结构。
- 在“Number”子程序中,子网络的 IoU 较低(如 backbone.layer4.0.conv1 处为 0.370),表明其发现过程更嘈杂或不一致,但仍明显区别于“Inside”任务。
- 跨任务的子网络重叠始终较低(如 backbone.layer4.0.conv1 处为 0.122),证实不同子程序的子网络在功能上是分离的。
- 剪枝后的模型保留了与完整模型相似的结构组合性模式,验证了该方法的鲁棒性。
- 无监督预训练使语言模型形成更一致的组合性结构,表明预训练有助于模块化学习。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。