[论文解读] A Penny for Your (visual) Thoughts: Self-Supervised Reconstruction of Natural Movies from Brain Activity
本文提出一种自监督框架,通过利用视频到fMRI的编码器与fMRI到视频的解码器之间的循环一致性训练,结合大量未配对的自然视频数据,实现从fMRI脑活动重建自然电影。该方法在重建质量上达到最先进水平,并能实现高达×8的帧率提升,超越fMRI采样率,显著提高了时间一致性与细节恢复能力,优于仅使用监督学习的基线方法。
Reconstructing natural videos from fMRI brain recordings is very challenging, for two main reasons: (i) As fMRI data acquisition is difficult, we only have a limited amount of supervised samples, which is not enough to cover the huge space of natural videos; and (ii) The temporal resolution of fMRI recordings is much lower than the frame rate of natural videos. In this paper, we propose a self-supervised approach for natural-movie reconstruction. By employing cycle-consistency over Encoding-Decoding natural videos, we can: (i) exploit the full framerate of the training videos, and not be limited only to clips that correspond to fMRI recordings; (ii) exploit massive amounts of external natural videos which the subjects never saw inside the fMRI machine. These enable increasing the applicable training data by several orders of magnitude, introducing natural video priors to the decoding network, as well as temporal coherence. Our approach significantly outperforms competing methods, since those train only on the limited supervised data. We further introduce a new and simple temporal prior of natural videos, which - when folded into our fMRI decoder further - allows us to reconstruct videos at a higher frame-rate (HFR) of up to x8 of the original fMRI sample rate.
研究动机与目标
- 为解决从fMRI重建自然电影的挑战,该挑战受限于稀疏的配对训练数据和低时间分辨率。
- 通过利用大规模未配对自然视频数据进行自监督预训练,克服配对fMRI-视频数据不足的问题。
- 通过引入建模自然视频动态的自监督时间先验,提升重建视频的时间一致性。
- 通过学习插值之外的时间动态,实现高达原始fMRI采样率8倍的高帧率(HFR)重建。
- 在重建视频的定量指标和感知质量方面,优于现有的仅使用监督学习的方法。
提出的方法
- 在未配对视频片段上训练一种循环一致的自监督框架:编码器将视频片段映射为类似fMRI的表征,解码器将这些表征还原为视频帧。
- 编码器-解码器循环(E-D)在来自同一视频数据集的内部未配对片段以及外部未配对自然视频上进行训练,极大扩展了训练数据量,远超配对fMRI-视频样本的范围。
- 通过循环一致性应用自监督:从其fMRI表征重建视频片段并重新映射回原始视频,此阶段无需fMRI标签。
- 引入一种新颖的自监督时间先验,通过建模自然视频动态,强制实现连续重建帧之间的平滑、一致过渡。
- 解码器被训练为在高于原始fMRI采样率(0.5Hz)的帧率下重建视频(最高达×8),从而实现对精细时间细节的恢复。
- 该方法结合在有限配对fMRI-视频数据上的监督微调与在未配对数据上的广泛自监督预训练,以提升泛化能力与重建保真度。
实验结果
研究问题
- RQ1在未配对自然视频上进行自监督学习,是否能显著提升fMRI驱动的视频重建质量,超越仅使用监督学习的方法?
- RQ2当fMRI采样稀疏且帧率低时,如何增强重建视频的时间一致性?
- RQ3自监督时间先验在原始fMRI采样率未包含的高帧率动态中,能恢复到何种程度?
- RQ4与仅在配对数据上训练相比,在外部未配对视频数据上进行预训练是否能提升泛化能力与重建质量?
- RQ5所提出的方法是否能在保持感知与结构保真度的前提下,实现高达fMRI采样率8倍的帧率重建?
主要发现
- 在0.5Hz重建任务中,该方法的排名得分为6.84,显著优于仅使用监督学习的训练方法(排名14.99),Wilcoxon符号秩检验的p值 < 1e-41。
- 与仅使用监督学习的方法相比,该方法在SSIM上提升8.8%,MSE降低7.1%,表明图像相似性有显著提升。
- 在内部和外部未配对数据上同时应用自监督,性能最佳,相比仅使用监督学习的训练,排名得分提升12.7%。
- 高帧率重建(最高达4Hz)显著优于简单的时序插值,排名得分比较的p值为1.42e-81。
- 该方法在定量指标(SSIM、MSE、排名)和视觉质量方面均达到最先进水平,经定性比较与感知相似性度量验证。
- 消融实验证实,内部和外部未配对数据均对性能有显著贡献,两者结合效果最佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。