[论文解读] BrainCLIP: Bridging Brain and Visual-Linguistic Representation Via CLIP for Generic Natural Visual Stimulus Decoding
BrainCLIP 提出了一种与任务无关的 fMRI 解码框架,利用 CLIP 的跨模态对齐机制,将大脑活动映射到图像和文本嵌入空间,实现了零样本视觉类别解码、fMRI-图像/文本匹配以及高保真 fMRI 到图像的生成。通过联合优化视觉和文本监督,该方法在语义重建和检索任务中实现了最先进性能,优于先前的 BraVL 等方法,在零样本分类和 fMRI 到图像生成任务中表现更优。
Due to the lack of paired samples and the low signal-to-noise ratio of functional MRI (fMRI) signals, reconstructing perceived natural images or decoding their semantic contents from fMRI data are challenging tasks. In this work, we propose, for the first time, a task-agnostic fMRI-based brain decoding model, BrainCLIP, which leverages CLIP's cross-modal generalization ability to bridge the modality gap between brain activity, image, and text. Our experiments demonstrate that CLIP can act as a pivot for generic brain decoding tasks, including zero-shot visual categories decoding, fMRI-image/text matching, and fMRI-to-image generation. Specifically, BrainCLIP aims to train a mapping network that transforms fMRI patterns into a well-aligned CLIP embedding space by combining visual and textual supervision. Our experiments show that this combination can boost the decoding model's performance on certain tasks like fMRI-text matching and fMRI-to-image generation. On the zero-shot visual category decoding task, BrainCLIP achieves significantly better performance than BraVL, a recently proposed multi-modal method specifically designed for this task. BrainCLIP can also reconstruct visual stimuli with high semantic fidelity and establishes a new state-of-the-art for fMRI-based natural image reconstruction in terms of high-level semantic features.
研究动机与目标
- 为了解决从 fMRI 数据中解码通用自然视觉刺激的挑战,该挑战受限于信噪比较低和缺乏配对数据。
- 开发一种统一的、与任务无关的大脑解码框架,无需针对特定任务重新训练即可泛化于多种基于 fMRI 的任务。
- 通过利用 CLIP 预训练的、高度对齐的视觉-语言嵌入空间作为大脑活动映射的枢纽,提升语义层面的解码性能。
- 证明在训练过程中结合视觉和文本监督可提升 fMRI 到图像生成和 fMRI 文本匹配任务的解码性能。
提出的方法
- 训练一个映射网络,利用图像和文本数据的对比学习,将 fMRI 模式投影到 CLIP 的共享嵌入空间中。
- 该框架使用在 4 亿张图像-文本对上预训练的 CLIP 视觉和文本编码器,提供类大脑的、语义丰富的表征空间。
- 探索了两种架构:线性映射头和基于 VAE 的映射网络,以建模从 fMRI 到 CLIP 嵌入的转换过程。
- 在推理阶段,模型支持通过提示工程实现零样本视觉类别分类、fMRI-图像/文本匹配以及基于扩散模型的图像生成。
- 训练目标结合了 fMRI-图像对比损失和 fMRI-文本对比损失,以联合对齐大脑活动与两种模态。
- 模型在 NSD 和 GOD fMRI 数据集上进行评估,定量指标包括基于 CLIP 和 Inception V3 的相似性分数。

实验结果
研究问题
- RQ1CLIP 的跨模态表征空间能否作为通用枢纽,连接 fMRI 大脑活动与视觉和语言数据?
- RQ2与单模态监督相比,同时使用图像和文本监督是否能提升 fMRI 解码性能?
- RQ3一个统一的、与任务无关的模型能否在多个 fMRI 解码任务(包括零样本分类、检索和图像生成)中实现最先进性能?
- RQ4不同的映射网络架构(线性与 VAE)在 fMRI 到图像生成和检索任务中的表现有何差异?
主要发现
- BrainCLIP-VAE 在同时使用视觉和文本监督的情况下,fMRI-文本检索准确率达到 90.8%,优于仅使用单一模态的设置。
- 在 fMRI 到图像生成任务中,BrainCLIP-VAE 使用噪声图像作为输入,实现了基于 CLIP 的 2 方向识别分数 89.4%,表明具有高语义保真度。
- 在 fMRI-文本检索任务中,模型在双模态监督下达到 86.7% 的准确率,证明了多模态对齐的优势。
- BrainCLIP 在零样本视觉类别解码任务中优于 BraVL,fMRI-文本检索任务准确率达到 86.7%。
- fMRI-图像与 fMRI-文本对齐的联合优化显著提升了所有任务的性能,证实了多模态监督的价值。
- BrainCLIP-VAE 在 fMRI 到图像生成和 fMRI-文本检索任务中表现更优,而 BrainCLIP-Linear 在 fMRI-图像检索任务中表现更佳。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。