Skip to main content
QUICK REVIEW

[论文解读] Reverse the auditory processing pathway: Coarse-to-fine audio reconstruction from fMRI

Che Liu, Changde Du|arXiv (Cornell University)|May 29, 2024
Hearing Loss and Rehabilitation被引用 4
一句话总结

本文提出了一种从fMRI进行粗粒度到细粒度的音频重建框架,其机制与人类听觉系统的分层处理方式相一致:首先将fMRI解码为低维CLAP语义空间,再将其细化为AudioMAE潜在空间以获取细粒度的声学特征,进而通过潜在扩散模型(LDM)生成高质量音频。该方法在三个数据集(Brain2Sound、Brain2Music、Brain2Speech)上实现了SOTA性能,FD、FAD和KL指标均表现优异,且在语义解码不佳时,通过语义提示进一步提升了重建质量。

ABSTRACT

Drawing inspiration from the hierarchical processing of the human auditory system, which transforms sound from low-level acoustic features to high-level semantic understanding, we introduce a novel coarse-to-fine audio reconstruction method. Leveraging non-invasive functional Magnetic Resonance Imaging (fMRI) data, our approach mimics the inverse pathway of auditory processing. Initially, we utilize CLAP to decode fMRI data coarsely into a low-dimensional semantic space, followed by a fine-grained decoding into the high-dimensional AudioMAE latent space guided by semantic features. These fine-grained neural features serve as conditions for audio reconstruction through a Latent Diffusion Model (LDM). Validation on three public fMRI datasets-Brain2Sound, Brain2Music, and Brain2Speech-underscores the superiority of our coarse-to-fine decoding method over stand-alone fine-grained approaches, showcasing state-of-the-art performance in metrics like FD, FAD, and KL. Moreover, by employing semantic prompts during decoding, we enhance the quality of reconstructed audio when semantic features are suboptimal. The demonstrated versatility of our model across diverse stimuli highlights its potential as a universal brain-to-audio framework. This research contributes to the comprehension of the human auditory system, pushing boundaries in neural decoding and audio reconstruction methodologies.

研究动机与目标

  • 为解决从非侵入性fMRI中重建高保真、语义准确音频的挑战,通过模仿大脑分层听觉处理通路实现。
  • 通过解耦语义与声学解码,避免直接进行高维fMRI到音频的映射,从而提升脑-音频重建性能。
  • 在语义特征微弱或噪声较大时,通过在解码过程中引入条件提示,提升重建质量。
  • 建立一个适用于多种音频模态(语音、音乐、环境声音)的通用脑-音频框架。

提出的方法

  • 该方法首先将fMRI数据解码为低维CLAP嵌入空间,以提取粗粒度语义特征。
  • 这些语义特征引导后续将fMRI解码为高维AudioMAE潜在空间,以捕捉细粒度声学表征。
  • 解码得到的AudioMAE特征被用作潜在扩散模型(LDM)的条件输入,用于生成梅尔频谱图。
  • 生成的梅尔频谱图随后通过声码器转换为波形,得到最终音频输出。
  • 通过文本或音频提示实现条件重建,其中超参数 $P_{gt}$ 控制训练过程中真实语义特征的影响程度。
  • 该框架在三个公开fMRI数据集(Brain2Sound、Brain2Music、Brain2Speech)上进行了验证,采用FD、FAD、KL和PCC等指标进行评估。

实验结果

研究问题

  • RQ1与直接细粒度解码相比,粗粒度到细粒度的解码流程是否能提升fMRI的音频重建质量?
  • RQ2利用CLAP提取的语义特征在多大程度上提升了重建音频的保真度与语义准确性?
  • RQ3当解码得到的语义特征表现不佳时,语义提示能在多大程度上提升重建质量?
  • RQ4所提出的方法是否能在包括语音、音乐和环境声音在内的多种音频类型上实现泛化?

主要发现

  • 该粗粒度到细粒度方法在所有三个数据集上均达到SOTA性能,FD分数分别为6.102(Brain2Music)、11.636(Brain2Speech)和6.587(Brain2Sound),FAD分数分别为1.504、4.866和1.341。
  • 与仅使用细粒度解码相比,该方法在感知质量和语义准确性方面均有提升,表现为KL和KL-S值更低,PCC分数更高。
  • 当 $P_{gt} = 0.25$ 时,条件重建达到最高PCC(Brain2Music为0.454,Brain2Speech为0.393),表明该设置在引导与泛化之间实现了最佳平衡。
  • 在Brain2Speech数据集中,由于语义解码能力较弱,使用音频提示将PCC从0.379提升至0.315,FAD从4.866降至4.148,证明了在低信噪比环境下提示机制的有效性。
  • 在Brain2Music数据集中,文本提示导致性能下降,原因在于同类型音乐片段间个体性丧失,表明提示设计必须与语义多样性相匹配。
  • 当语义特征表现不佳时,语义提示的引入显著提升了重建质量,验证了该方法的鲁棒性与适应性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。