[论文解读] Convolutional Neural Generative Coding: Scaling Predictive Coding to Natural Images
该论文提出Conv-NGC,一种受大脑启发的无监督图像处理模型,其在预测编码框架中使用卷积和反卷积层,通过迭代方式优化内部表征。该模型在图像重建和去噪任务中表现优异,尤其在分布外数据上优于反向传播训练的自编码器,且采用局部、生物上合理的学习规则,而非反向传播。
In this work, we develop convolutional neural generative coding (Conv-NGC), a generalization of predictive coding to the case of convolution/deconvolution-based computation. Specifically, we concretely implement a flexible neurobiologically-motivated algorithm that progressively refines latent state feature maps in order to dynamically form a more accurate internal representation/reconstruction model of natural images. The performance of the resulting sensory processing system is evaluated on complex datasets such as Color-MNIST, CIFAR-10, and Street House View Numbers (SVHN). We study the effectiveness of our brain-inspired model on the tasks of reconstruction and image denoising and find that it is competitive with convolutional auto-encoding systems trained by backpropagation of errors and outperforms them with respect to out-of-distribution reconstruction (including the full 90k CINIC-10 test set).
研究动机与目标
- 开发一种生物上合理、无监督的图像处理系统,避免反向传播的生物学不现实性及其计算瓶颈。
- 通过将卷积和反卷积操作直接整合到框架中,将预测编码扩展至自然图像。
- 利用局部误差信号和残差模块结构,实现潜在特征图的动态、迭代优化。
- 在CIFAR-10和SVHN等复杂数据集上评估性能,尤其关注分布外泛化能力。
- 在仅使用局部、非反向传播误差信号的前提下,实现与反向传播训练自编码器相当的性能。
提出的方法
- Conv-NGC采用分层预测编码架构,包含自顶向下的生成路径和自底向上的误差信号,利用卷积和反卷积层建模图像表征。
- 通过预测与校正步骤,模型迭代优化潜在状态特征图,状态更新由调制因子β和通过γ的漏斗积分控制。
- 误差信号通过多步、非学习路径(见公式11)传输,实现在无反向传播情况下的快速、局部误差传播。
- 采用残差模块结构以建模复杂变换,误差信号通过中间层以扰动向量形式传播(见公式8–11)。
- 提出一种新型学习规则(公式12),使用递归LRA更新权重和误差滤波器,其中ΔW和ΔE通过空洞转置卷积与低层误差信号计算。
- 模型采用局部、非反向传播的信用分配机制进行训练,适用于神经形态硬件并支持高效并行化。
实验结果
研究问题
- RQ1能否通过卷积和反卷积层有效将预测编码扩展至自然图像?
- RQ2在重建与去噪任务中,局部学习的、生物上合理的信用分配机制是否优于反向传播?
- RQ3与标准自编码器相比,该模型在分布外数据上的泛化能力如何?
- RQ4在非反向传播框架中,结合多步误差传输的残差模块是否能提升表征学习能力?
- RQ5是否可能在不使用全局误差反馈或反向传播的情况下实现图像重建的竞争力表现?
主要发现
- Conv-NGC在CIFAR-10和SVHN数据集上实现了具有竞争力的重建性能,其表现与参数相似的反向传播训练自编码器相当或更优。
- 在完整的90k CINIC-10测试集上,Conv-NGC在分布外重建任务中优于基于反向传播的模型,展现出更强的泛化能力。
- 该模型表现出优异的去噪性能,仅使用局部误差信号即可有效从噪声输入中恢复出清晰图像。
- 使用递归LRA进行权重更新,实现了无需反向传播的稳定高效训练,其性能在训练方式与反向传播一致时可与ResNet相媲美。
- 多步误差传输路径(公式11)成功将误差流与前向计算解耦,实现了高效灵活的学习。
- 将反卷积层整合进预测编码框架,显著增强了视觉任务的表征能力,这是文献中首次实现此类整合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。