[论文解读] MindEye2: Shared-Subject Models Enable fMRI-To-Image With 1 Hour of Data
MindEye2 在跨多个主体上对单一模型进行预训练,并在仅对未包含在训练中的被试的 fMRI 数据的 1 小时进行微调,以实现最先进的 fMRI-to-image 重构和检索,使用共享主体潜在空间和经过微调的 unCLIP/SDXL 流程。
Reconstructions of visual perception from brain activity have improved tremendously, but the practical utility of such methods has been limited. This is because such models are trained independently per subject where each subject requires dozens of hours of expensive fMRI training data to attain high-quality results. The present work showcases high-quality reconstructions using only 1 hour of fMRI training data. We pretrain our model across 7 subjects and then fine-tune on minimal data from a new subject. Our novel functional alignment procedure linearly maps all brain data to a shared-subject latent space, followed by a shared non-linear mapping to CLIP image space. We then map from CLIP space to pixel space by fine-tuning Stable Diffusion XL to accept CLIP latents as inputs instead of text. This approach improves out-of-subject generalization with limited training data and also attains state-of-the-art image retrieval and reconstruction metrics compared to single-subject approaches. MindEye2 demonstrates how accurate reconstructions of perception are possible from a single visit to the MRI facility. All code is available on GitHub.
研究动机与目标
- 推动在最少的被试特定数据下实现实用的 fMRI-to-image 重构。
- 开发一个共享主体功能对齐,将多样化的大脑映射到一个共同的潜在空间。
- 整合一个将 fMRI 映射到 CLIP 空间并通过微调的 unCLIP/SDXL 模型重构图像的统一管线。
- 在实现高保真重构的同时,展示出强大的检索与字幕生成功能。
提出的方法
- 在来自 7 个被试的 fMRI 数据上对单一模型进行预训练,然后在第 8 个被试的未包含数据上进行微调。
- 使用线性脊回映射将体素反应映射到 4096-d 的共享主体潜在空间,随后通过残差 MLP 主干映射到 OpenCLIP ViT-bigG/14 的嵌入。
- 训练扩散先验将 fMRI 潜在量映射到 OpenCLIP 图像空间,且通过对比学习训练检索子模块。
- 引入一个低阶子模块以保留细粒度结构并帮助 SDXL 的重构。
- 微调 Stable Diffusion XL 的 unCLIP,使其接受图像嵌入而非文本,并使用带字幕引导的基础 SDXL 精炼输出。

实验结果
研究问题
- RQ1共享主体潜在空间是否能够在新被试极少数据的条件下实现高质量的 fMRI-to-image 重构?
- RQ2与从头训练的单个被试模型相比,多被试预训练是否能提升对未包含被试的泛化能力?
- RQ3对齐、扩散先验和子模块如何共同作用于重构与检索性能?
- RQ4将图像字幕作为辅助引导是否对重构产生影响?
- RQ5在客观指标与人类偏好上, refined 重构相较未经 refined 的结果有何不同?
主要发现
- 在 7 个被试上进行预训练,并在新的被试数据的 1 小时上进行微调,获得最先进的重构与检索指标。
- 将共享主体线性对齐到 4096-d 潜在空间并采用统一管线,提升在有限数据条件下的泛化能力。
- 将 SDXL 的 unCLIP 微调为接受 CLIP 图像嵌入,使重构达到与地真实图像高度一致的高保真度。
- 预测图像字幕在最终 Refinement 过程中提供有用的条件引导,并提高语义保真度。
- 经过 refinement 的重构更受人类评估者偏好,尽管某些指标偏向未 refined 的输出。
- MindEye2 在 1 小时数据条件下的性能在某些指标上与用约 40 倍数据训练的单被试模型相当。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。