Skip to main content
QUICK REVIEW

[论文解读] Seeing Beyond the Brain: Conditional Diffusion Model with Sparse Masked Modeling for Vision Decoding

Zijiao Chen, Jiaxin Qing|arXiv (Cornell University)|Nov 13, 2022
Functional Brain Connectivity Studies被引用 8
一句话总结

MinD-Vis 提出了一种两阶段框架,用于基于 fMRI 的视觉解码,采用稀疏掩码脑建模(SC-MBM)和双条件潜在扩散模型(DC-LDM)。通过在大规模未标注 fMRI 数据上进行掩码建模预训练,学习生物上合理的表征,并随后使用少量成对的 fMRI-图像标注进行微调,该方法实现了最先进性能,相较于先前方法,FID 降低 41%,100 类语义分类准确率提升 66%。

ABSTRACT

Decoding visual stimuli from brain recordings aims to deepen our understanding of the human visual system and build a solid foundation for bridging human and computer vision through the Brain-Computer Interface. However, reconstructing high-quality images with correct semantics from brain recordings is a challenging problem due to the complex underlying representations of brain signals and the scarcity of data annotations. In this work, we present MinD-Vis: Sparse Masked Brain Modeling with Double-Conditioned Latent Diffusion Model for Human Vision Decoding. Firstly, we learn an effective self-supervised representation of fMRI data using mask modeling in a large latent space inspired by the sparse coding of information in the primary visual cortex. Then by augmenting a latent diffusion model with double-conditioning, we show that MinD-Vis can reconstruct highly plausible images with semantically matching details from brain recordings using very few paired annotations. We benchmarked our model qualitatively and quantitatively; the experimental results indicate that our method outperformed state-of-the-art in both semantic mapping (100-way semantic classification) and generation quality (FID) by 66% and 41% respectively. An exhaustive ablation study was also conducted to analyze our framework.

研究动机与目标

  • 解决在成对标注数据有限的情况下,从 fMRI 脑记录中重建高质量、语义有意义图像的挑战。
  • 通过在大潜在空间中利用自监督掩码建模,学习可泛化的、生物上合理的 fMRI 表征。
  • 通过在潜在扩散模型中引入双条件机制,提升脑解码中图像生成的保真度和语义一致性。
  • 即使在 fMRI 协议存在个体差异和领域偏移的情况下,也能实现跨多样化受试者和数据集的稳健解码。
  • 探索解码图像是否不仅能捕捉刺激内容,还能捕捉想象或额外感知细节。

提出的方法

  • SC-MBM 使用大规模未标注 fMRI 数据集上的掩码建模对 fMRI 表征进行预训练,模拟初级视觉皮层中的稀疏编码。
  • 该方法采用较大的表征到数据空间比例,以增强信息容量和表征质量。
  • 采用双条件潜在扩散模型(DC-LDM)生成图像,其条件同时基于 fMRI 编码特征和语义标签,实现在相同语义下的一致但可变的生成。
  • 该框架将预训练与生成过程解耦:SC-MBM 首先学习通用脑表征,随后在少量成对 fMRI-图像数据上微调扩散模型。
  • 预训练的 fMRI 编码器在目标数据集(如 BOLD5000)上进行微调,采用环绕填充以处理 ROI 尺寸差异。
  • 通过定量指标(FID、top-1 准确率)和对生成图像语义及低级特征的定性分析对模型进行评估。

实验结果

研究问题

  • RQ1在大规模未标注 fMRI 数据上进行自监督掩码建模,能否学习到在不同受试者和数据集间具有泛化能力的生物上合理的表征?
  • RQ2在潜在扩散模型中引入双条件机制,是否能提升 fMRI 基础图像重建中的语义一致性和生成质量?
  • RQ3该框架是否不仅能重建主要视觉内容,还能还原细微的感知细节,包括原始刺激中不存在的想象特征?
  • RQ4在低样本成对数据设置下,该模型表现如何?其在语义和感知质量方面是否优于现有最先进方法?
  • RQ5所学习的表征在不同 fMRI 扫描协议和预处理流程之间,其泛化能力达到何种程度?

主要发现

  • 在 GOD 数据集上,MinD-Vis 相较于最先进方法,100 类语义分类准确率提升了 66%。
  • 在相同基准上,该模型将 Fréchet Inception Distance(FID)降低了 41%,表明图像生成质量更优。
  • 在 BOLD5000 数据集上,模型在 50 类、1000 次试验的语义识别任务中达到 34% 的 top-1 准确率,表明其在跨数据集场景下具有强大泛化能力。
  • 生成的图像保留了关键低级特征,如纹理、形状和颜色,并准确重建了包括动物、建筑和景观在内的复杂场景。
  • 该模型成功解码出原始刺激中不存在的额外感知细节,如河流和蓝色天空,表明其能捕捉想象或内部生成的视觉内容。
  • 通过 SC-MBM 进行预训练,使模型在 BOLD5000 上实现了强大的迁移性能,即使在扫描协议和预处理存在领域偏移的情况下,也证实了所学习表征的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。