[论文解读] Decoding natural image stimuli from fMRI data with a surface-based convolutional network
该论文提出Cortex2Image,一种新颖的基于表面的卷积神经网络,通过利用皮层拓扑结构和一种实例条件生成对抗网络(Instance-Conditioned GAN)的变分训练方法,从fMRI数据中解码自然图像刺激。该方法通过建模整个皮层上脑活动的空间关系,在语义保真度和细粒度细节重建方面均优于先前方法,在定性和定量指标上均达到最先进水平。
Due to the low signal-to-noise ratio and limited resolution of functional MRI data, and the high complexity of natural images, reconstructing a visual stimulus from human brain fMRI measurements is a challenging task. In this work, we propose a novel approach for this task, which we call Cortex2Image, to decode visual stimuli with high semantic fidelity and rich fine-grained detail. In particular, we train a surface-based convolutional network model that maps from brain response to semantic image features first (Cortex2Semantic). We then combine this model with a high-quality image generator (Instance-Conditioned GAN) to train another mapping from brain response to fine-grained image features using a variational approach (Cortex2Detail). Image reconstructions obtained by our proposed method achieve state-of-the-art semantic fidelity, while yielding good fine-grained similarity with the ground-truth stimulus. Our code is available at: https://github.com/zijin-gu/meshconv-decoding.git.
研究动机与目标
- 解决先前基于fMRI的图像解码方法依赖于感兴趣区域(ROI)选择和向量化体素响应的局限性,这些方法忽略了皮层空间拓扑结构并引入了主观性。
- 通过使用基于表面的卷积操作建模皮层表面活动的二维空间结构,提升图像重建质量。
- 通过采用变分方法,端到端联合训练Cortex2Detail模型与预训练的图像生成器(IC-GAN),提升计算效率和重建保真度。
- 实现从全皮层fMRI响应中重建具有高语义保真度和丰富细粒度细节的图像,超越现有最先进方法。
- 证明个体特异性模型在个体间泛化能力差,凸显了个体化但共享架构框架的必要性。
提出的方法
- 该方法采用基于表面的卷积神经网络(Cortex2Semantic),将全皮层fMRI响应映射为语义图像特征,通过标准化皮层网格表示保留空间拓扑结构。
- 第二个模型Cortex2Detail与预训练的实例条件生成对抗网络(IC-GAN)端到端联合训练,采用变分推理框架,从脑响应生成高保真度图像细节。
- IC-GAN在训练过程中被冻结,通过类似变分自编码器的优化方法推断细节向量,减少了先前工作中迭代优化噪声向量的需求。
- 该框架使用自然场景数据集(NSD),包含8名受试者在7T扫描仪下观看9,000至10,000张自然图像,用于模型的训练与评估。
- 脑响应通过标准化皮层表面网格进行处理,避免了依赖ROI的预处理步骤,实现了受试者间的共享架构。
- 通过在特征层级引入监督信号,并在图像层级应用对抗训练,联合优化语义和细节重建。
实验结果
研究问题
- RQ1基于表面的卷积神经网络是否能通过尊重皮层表面的二维拓扑结构,在fMRI图像重建中实现优于向量化体素方法的语义和细粒度图像重建?
- RQ2与迭代优化噪声向量的方法相比,使用预训练GAN进行端到端训练是否能降低计算成本并提升重建质量?
- RQ3与受限ROI相比,建模全皮层活动在多大程度上能提升解码性能并增强跨受试者的泛化能力?
- RQ4在语义准确性和与真实刺激的感知相似性方面,所提出的模型与最先进方法相比表现如何?
- RQ5为何个体特异性模型无法泛化?这如何影响神经解码任务中跨个体解码的可行性?
主要发现
- Cortex2Image模型在图像重建中实现了最先进水平的语义保真度,能在解码质量高的样本中正确识别斑马、火车和飞机等物体类别。
- 该模型保留了细粒度细节,如斑马条纹、食物颜色、物体朝向以及空间布局(例如轨道上的火车、天空中的飞机),而这些细节在先前方法中常被丢失。
- 与RidgeImage基线相比,Cortex2Image在除SSIM外的所有评估指标上表现更优,FID、LPIPS和CLIP得分显著提升,表明其在感知质量和语义保真度方面更优。
- 仅Cortex2Semantic模型可捕捉物体类别,但无法重建细节;而完整版Cortex2Image模型显著提升了细节保真度,证明了联合语义与细节学习的价值。
- 尽管RidgeImage基线在语义准确性方面表现尚可,但其视觉质量较差,凸显了使用手工特征和非空间建模的岭回归方法的局限性。
- 个体特异性模型在个体间泛化能力差,性能差异显著,可能由于受试者间信噪比和神经响应特性不同所致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。