Skip to main content
QUICK REVIEW

[论文解读] DREAM: Visual Decoding from Reversing Human Visual System

Weihao Xia, Raoul de Charette|arXiv (Cornell University)|Oct 3, 2023
Visual Attention and Saliency Detection参考文献 52被引用 4
一句话总结

DREAM 提出了一种新颖的 fMRI 到图像的重建方法,通过逆向模拟人类视觉系统的分层并行通路,从脑活动解码语义、颜色和深度信息。通过引入用于语义解码的 Reverse-VAC 和用于联合颜色-深度预测的 Reverse-PKM,该方法在外观、结构和语义一致性方面优于当前最先进方法,在 NSD 数据集上实现了更高的重建保真度。

ABSTRACT

In this work we present DREAM, an fMRI-to-image method for reconstructing viewed images from brain activities, grounded on fundamental knowledge of the human visual system. We craft reverse pathways that emulate the hierarchical and parallel nature of how humans perceive the visual world. These tailored pathways are specialized to decipher semantics, color, and depth cues from fMRI data, mirroring the forward pathways from visual stimuli to fMRI recordings. To do so, two components mimic the inverse processes within the human visual system: the Reverse Visual Association Cortex (R-VAC) which reverses pathways of this brain region, extracting semantics from fMRI data; the Reverse Parallel PKM (R-PKM) component simultaneously predicting color and depth from fMRI signals. The experiments indicate that our method outperforms the current state-of-the-art models in terms of the consistency of appearance, structure, and semantics. Code will be made publicly available to facilitate further research in this field.

研究动机与目标

  • 为解决当前 fMRI 到图像解码方法的局限性,这些方法因依赖 CLIP 等视觉-语言模型而存在外观和结构一致性差的问题。
  • 将人类视觉系统(HVS)中生物上合理的机制,特别是针对颜色、深度和语义的机制,整合到视觉解码过程中。
  • 通过反向模拟前向 HVS 通路,减少 fMRI 到图像转换过程中的信息损失,使用专门的神经组件实现。
  • 通过直接从 fMRI 信号中提取颜色和深度线索,而非依赖间接监督,来提升图像重建质量。
  • 证明基于生物原理的反向通路相比现有基于扩散模型的方法,能生成更一致且更符合感知的重建结果。

提出的方法

  • DREAM 采用受人类视觉系统启发的反向通路,建模从前向 HVS 过程(从视觉刺激到 fMRI)的逆过程。
  • 反向视觉联合皮层(R-VAC)组件从 fMRI 信号中解码高层语义,生成类似 CLIP 的嵌入,以指导图像生成。
  • 反向并行 PKM(R-PKM)组件同时从 fMRI 数据中预测颜色(作为空间调色板)和深度(作为深度图),提供结构和色彩引导。
  • 解码出的线索——语义、颜色和深度——被输入到 Stable Diffusion 并结合 T2I-Adapter 以重建图像,其中使用 Color Adapter 和 Depth Adapter 实现空间控制。
  • 该方法在 NSD 数据集上进行个体特定训练,为每位参与者单独微调模型,以应对 fMRI 模式在个体间的差异性。
  • 对初始猜测图像采用 ×64 下采样策略,以提取鲁棒的颜色调色板,同时减轻低保真度初始重建带来的噪声影响。

实验结果

研究问题

  • RQ1逆向建模人类视觉系统的分层与并行通路,能否提升 fMRI 到图像的重建质量?
  • RQ2显式地从 fMRI 信号中解码颜色和深度线索,是否能带来比仅依赖 CLIP 对齐语义更一致的图像重建?
  • RQ3基于生物启发的反向通路能否优于依赖视觉-语言对齐的现有扩散模型方法?
  • RQ4个体特定的 fMRI 模式在多大程度上影响重建性能?是否能通过一致的错误识别数据集偏差?
  • RQ5从 fMRI 预测的颜色和深度与真实值相比如何?它们能否作为图像生成的有效引导?

主要发现

  • DREAM 在 NSD 数据集上达到最先进性能,个体特定的重建结果在外观、结构和语义上均表现出高度一致性。
  • 在四个受试者(sub01–sub07)上的定量指标显示,PixCorr 值在 0.265 到 0.288 之间,SSIM 在 92.7% 到 97.5% 之间,CLIP 分数在 93.7% 到 95.2% 之间。
  • 该方法在所有受试者中均表现出稳定性能,各项指标方差较低,表明对个体间 fMRI 差异具有鲁棒性。
  • 尽管分辨率有限,R-PKM 组件预测的颜色和深度图虽较粗糙,但仍能提供有意义的空间引导,提升重建保真度。
  • 共享的重建错误(如将花瓶-花朵图像误判为绘画,或将倾斜的餐盘误判为俯视图)表明数据集中存在持续存在的偏差。
  • 视觉结果表明,引入颜色和深度线索能显著减少先前方法(如 [31])中常见的外观不一致问题,这些方法虽保留了语义,但颜色常被扭曲。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。