Skip to main content
QUICK REVIEW

[论文解读] Reconstructing Perceived Images from Brain Activity by Visually-guided Cognitive Representation and Adversarial Learning

Ziqi Ren, Jie Li|arXiv (Cornell University)|Jun 27, 2019
Cell Image Analysis Techniques参考文献 38被引用 5
一句话总结

该论文提出D-Vae/GAN,一种新颖的框架,通过对抗性学习与知识蒸馏,学习视觉引导的认知潜在表征,从fMRI信号重建视觉刺激。通过结合双变分自编码器与基于GAN的跨模态知识蒸馏策略,以及三阶段训练方法,该方法在公开fMRI数据集上实现了最先进的图像重建质量,Pix-Com指标上相比先前方法最高提升11.7%,Hum-Com指标上提升9.7%。

ABSTRACT

Reconstructing visual stimulus (image) only from human brain activity measured with functional Magnetic Resonance Imaging (fMRI) is a significant and meaningful task in Human-AI collaboration. However, the inconsistent distribution and representation between fMRI signals and visual images cause the heterogeneity gap. Moreover, the fMRI data is often extremely high-dimensional and contains a lot of visually-irrelevant information. Existing methods generally suffer from these issues so that a satisfactory reconstruction is still challenging. In this paper, we show that it is possible to overcome these challenges by learning visually-guided cognitive latent representations from the fMRI signals, and inversely decoding them to the image stimuli. The resulting framework is called Dual-Variational Autoencoder/ Generative Adversarial Network (D-VAE/GAN), which combines the advantages of adversarial representation learning with knowledge distillation. In addition, we introduce a novel three-stage learning approach which enables the (cognitive) encoder to gradually distill useful knowledge from the paired (visual) encoder during the learning process. Extensive experimental results on both artificial and natural images have demonstrated that our method could achieve surprisingly good results and outperform all other alternatives.

研究动机与目标

  • 为解决从噪声大、高维的fMRI信号中重建高质量视觉刺激的挑战,此类信号存在模态差异与异质性问题。
  • 克服现有方法因表征学习不足与缺乏视觉引导而导致重建图像模糊、保真度低的局限性。
  • 通过利用配对视觉数据中的知识,无需额外标注,构建一种从fMRI数据中学习解耦、与视觉相关认知表征的框架。
  • 通过整合对抗性训练与三阶段学习策略,逐步对齐认知与视觉特征,提升重建保真度。
  • 在多个公开fMRI数据集上验证方法的有效性,并分析不同脑区如何编码结构与颜色信息。

提出的方法

  • 该框架采用基于双VAE的编码网络,从fMRI信号与视觉刺激中学习低维、解耦的潜在表征。
  • 引入基于GAN的跨模态知识蒸馏机制,通过强制认知编码器模仿视觉编码器,实现认知潜在特征与视觉特征的对齐。
  • 对抗性解码网络利用对抗性训练,从学习到的认知潜在特征中重建高保真度图像,以增强真实感与细节。
  • 提出一种新颖的三阶段训练策略,逐步将视觉知识蒸馏至认知编码器,提升训练稳定性和性能。
  • 结合VAE损失、对抗性损失与知识蒸馏损失,联合优化表征学习与图像重建。
  • 该框架在配对fMRI与图像数据上端到端训练,除配对数据外无需额外标注。

实验结果

研究问题

  • RQ1能否通过学习视觉引导的认知表征,使深度学习框架有效从fMRI信号中重建出高质量视觉刺激?
  • RQ2fMRI特征与视觉特征之间的跨模态知识蒸馏如何提升重建保真度并减小模态差异?
  • RQ3三阶段训练策略在稳定与提升重建模型性能方面有何贡献?
  • RQ4哪些脑区(ROI)最负责编码视觉刺激的结构信息与颜色信息,其重建效果如何?
  • RQ5所提出的D-Vae/GAN框架是否在定量指标与感知质量上均优于现有最先进方法?

主要发现

  • 所提出的D-Vae/GAN框架在Pix-Com指标上达到87.8%,Hum-Com指标上达到97.3%,相比先前方法在Pix-Com上提升9.7%,Hum-Com上提升1.6%。
  • 相比[25],在Pix-Com上提升11.7%,Hum-Com上提升0.3%,显著提升重建质量。
  • 消融实验证明,若移除双VAE编码器或替换为标准CNN,性能显著下降,证实其关键作用。
  • 通过知识蒸馏实现的视觉特征引导,使重建性能从78.9%(Pix-Com)提升至87.8%,证明无需额外标注即可有效利用视觉引导。
  • 早期视觉区(V1–V3)更擅长重建结构细节,而中层区域(V4)及高级视觉皮层(LOC、FFA、PPA)更准确捕捉颜色信息。
  • 全视觉皮层(VC)fMRI信号可实现最完整的重建,同时保留结构与颜色特征,验证了方法的鲁棒性与可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。