[论文解读] Unsupervised deep learning identifies semantic disentanglement in single inferotemporal neurons
本研究将一种深度无监督生成模型 $\beta$-VAE 应用于猕猴腹侧颞上沟皮层(IT)在观看人脸时的神经反应,揭示单个 IT 神经元编码了语义可解释的、解耦的因子,如性别和发型长度。该模型仅通过少数几个神经元即可成功重建新的人脸,表明 IT 神经元支持一种低维、可解释的编码方式,与解耦的潜在因子一致。
Deep supervised neural networks trained to classify objects have emerged as popular models of computation in the primate ventral stream. These models represent information with a high-dimensional distributed population code, implying that inferotemporal (IT) responses are also too complex to interpret at the single-neuron level. We challenge this view by modelling neural responses to faces in the macaque IT with a deep unsupervised generative model, beta-VAE. Unlike deep classifiers, beta-VAE "disentangles" sensory data into interpretable latent factors, such as gender or hair length. We found a remarkable correspondence between the generative factors discovered by the model and those coded by single IT neurons. Moreover, we were able to reconstruct face images using the signals from just a handful of cells. This suggests that the ventral visual stream may be optimising the disentangling objective, producing a neural code that is low-dimensional and semantically interpretable at the single-unit level.
研究动机与目标
- 检验单个颞上沟(IT)神经元是否编码人脸图像中语义可解释的、解耦的变异因子。
- 通过研究单个神经元是否与生成模型中的解耦潜在单元对齐,挑战当前认为仅 IT 皮层的群体编码才可解释的观点。
- 评估通过 $\beta$-VAE 实现的无监督表征学习是否比有监督或传统模型更好地解释单个神经元的调谐特性。
- 评估仅使用少量记录的 IT 神经元信号,通过解耦生成模型重建新的人脸图像的可行性。
提出的方法
- 在 2,100 幅自然人脸图像的镜像翻转版本上训练 $\beta$-VAE,以学习解耦的潜在表征。
- 使用线性回归从 $\beta$-VAE 的单个潜在单元中解码单个 IT 神经元的反应,实现神经元与潜在单元之间的对齐。
- 将 $\beta$-VAE 的性能与多种基线模型进行比较:自编码器(AE)、变分自编码器(VAE)、VGG(使用主成分分析或原始特征)、主成分分析(PCA)、独立成分分析(ICA)和主动外观模型(AAM)。
- 使用皮尔逊相关系数比和单元占比得分来衡量对齐质量,以评估每个神经元与单一潜在单元的相关性程度以及单元分配的多样性。
- 利用从单个神经元解码的潜在单元重建新的人脸图像,并通过真实与重建潜在响应之间的余弦距离评估重建保真度。
- 采用 Welsch 的 t 检验评估不同模型在对齐和重建性能差异上的统计显著性。
实验结果
研究问题
- RQ1猕猴腹侧颞上沟皮层的单个 IT 神经元是否编码了性别或发型长度等语义有意义的、解耦的因子?
- RQ2与有监督或传统模型相比,无监督生成模型(如 $\beta$-VAE)的单个潜在单元是否能更好地解释单个 IT 神经元的反应?
- RQ3当通过解耦的生成模型解码时,是否可以仅使用少量单个 IT 神经元的反应来重建新的人脸图像?
- RQ4$\beta$-VAE 在解释单个神经元反应方面的性能,与深度分类器、自编码器以及手工设计模型(如 AAM)相比如何?
主要发现
- $\beta$-VAE 的平均相关系数比显著高于所有基线模型,表明每个 IT 神经元的反应与单一解耦潜在单元具有强烈相关性。
- $\beta$-VAE 的平均单元占比得分显著高于所有基线模型,表明不同神经元由不同的潜在单元解码,支持了模型的解耦性。
- 仅使用 12 个单个 IT 神经元,$\beta$-VAE 即可实现优于基线模型的新人脸重建效果,后者需 27–30 个神经元,且真实与解码潜在响应之间的余弦距离显著更低。
- $\beta$-VAE 模型的潜在单元与已知的语义因子(如性别和发型长度)表现出显著对应关系,经人工标注属性验证。
- 尽管 AAM 模型作为“金标准”是手工设计用于人脸结构的,但其在对齐和重建性能上仍被 $\beta$-VAE 超越。
- 统计检验证实,$\beta$-VAE 在所有基线模型中均表现出显著更优的性能(p < 0.01),支持了研究结果的稳健性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。