[论文解读] Deep driven fMRI decoding of visual categories
该论文提出了一种混合fMRI解码框架,通过核典型相关分析(KCCA)将功能性磁共振成像(fMRI)数据与深度神经网络特征关联起来,通过将fMRI数据投影到与高层深度特征(fc7层)对齐的子空间中,实现了对视觉类别(特别是‘人脸’与‘全身’人体图像)的改进分类。该方法在10个典型分量时达到最高55%的准确率和80%的F1值,显著优于仅使用fMRI数据的解码方法,且在不同受试者间表现出稳健的泛化能力。
Deep neural networks have been developed drawing inspiration from the brain visual pathway, implementing an end-to-end approach: from image data to video object classes. However building an fMRI decoder with the typical structure of Convolutional Neural Network (CNN), i.e. learning multiple level of representations, seems impractical due to lack of brain data. As a possible solution, this work presents the first hybrid fMRI and deep features decoding approach: collected fMRI and deep learnt representations of video object classes are linked together by means of Kernel Canonical Correlation Analysis. In decoding, this allows exploiting the discriminatory power of CNN by relating the fMRI representation to the last layer of CNN (fc7). We show the effectiveness of embedding fMRI data onto a subspace related to deep features in distinguishing semantic visual categories based solely on brain imaging data.
研究动机与目标
- 通过利用预训练的深度特征,解决训练深度CNN类fMRI解码器时脑数据有限的挑战。
- 通过将脑活动与高层深度神经网络表征对齐,利用fMRI数据改进细粒度视觉类别分类。
- 开发一种可泛化的方法,将fMRI数据投影到与判别性深度特征相关的子空间中,以提升解码性能。
- 在真实世界视频数据集上验证该方法,聚焦于人体图像感知的语义视觉类别。
提出的方法
- 使用核典型相关分析(KCCA)学习fMRI体素活动模式(VTCs)与预训练CNN的fc7层深度特征之间的线性映射。
- 在测试阶段,使用KCCA变换矩阵的Moore-Penrose伪逆,从观测到的fMRI数据重建类似fc7的特征。
- 在重建的深度特征上训练线性SVM分类器,仅基于fMRI数据执行视觉类别(如人脸与全身)的二分类。
- 通过准确率和F1值在受试者间评估性能,每位受试者包含35个训练时间点和9个测试时间点。
- 使用更快的R-CNN从视频帧中提取目标检测特征,其中fc7特征作为语义分类的高层表征。
- 在一部电影(《苏菲的选择》)上训练KCCA模型,并在不同受试者及其他电影(《招魂2》、《继母》、《X档案》、《复仇》)上进行测试,以评估泛化能力。
实验结果
研究问题
- RQ1fMRI数据能否被有效投影到与深度神经网络特征对齐的子空间中,从而提升视觉类别解码性能?
- RQ2所提出的基于KCCA的特征重建方法在不同受试者及具有不同视觉风格的电影之间,泛化能力如何?
- RQ3与仅使用fMRI数据相比,利用从fMRI数据重建的fc7特征在分类准确率方面提升程度如何?
- RQ4在重建特征空间中,为平衡判别能力与分类性能,最优的典型分量数量(numCC)是多少?
主要发现
- 所提方法在仅使用fMRI数据的情况下,对‘人脸’与‘全身’人体图像的分类准确率最高达55%,F1值达80%,显著优于仅使用fMRI数据的解码方法。
- 在10个典型分量时获得最佳性能,该设置在fc7特征的判别能力与分类鲁棒性之间实现了良好平衡。
- 分类性能在不同受试者间波动极小,表明该方法在个体间具有强大的泛化能力。
- 在受试者和电影之间观察到fMRI特征与深度特征之间高度相关(r ≈ 0.7),尤其在《招魂2》、《继母》和《X档案》中表现明显,表明特征对齐可靠。
- 《复仇》这部电影的相关性较低,可能由于其在镜头尺度、光照和运动等方面的风格差异,凸显了视觉可变性对特征对齐的影响。
- 从fMRI数据重建的fc7特征实现了有效的解码,证明fMRI数据可以被有意义地嵌入与深度学习表征对齐的语义特征空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。