[论文解读] Self-supervised models of audio effectively explain human cortical responses to speech
本研究证明,自监督语音表征模型(如 wav2vec 2.0、HuBERT)在预测听觉皮层中人类 fMRI 响应方面,显著优于传统声学特征和有监督模型。通过分析分层表征,作者表明,较低层 SSL 模型编码频时特征,对应初级听觉区域;而深层则捕捉音素和语义信息,与人类大脑中语音的分层处理过程相吻合。
Self-supervised language models are very effective at predicting high-level cortical responses during language comprehension. However, the best current models of lower-level auditory processing in the human brain rely on either hand-constructed acoustic filters or representations from supervised audio neural networks. In this work, we capitalize on the progress of self-supervised speech representation learning (SSL) to create new state-of-the-art models of the human auditory system. Compared against acoustic baselines, phonemic features, and supervised models, representations from the middle layers of self-supervised models (APC, wav2vec, wav2vec 2.0, and HuBERT) consistently yield the best prediction performance for fMRI recordings within the auditory cortex (AC). Brain areas involved in low-level auditory processing exhibit a preference for earlier SSL model layers, whereas higher-level semantic areas prefer later layers. We show that these trends are due to the models' ability to encode information at multiple linguistic levels (acoustic, phonetic, and lexical) along their representation depth. Overall, these results show that self-supervised models effectively capture the hierarchy of information relevant to different stages of speech processing in human cortex.
研究动机与目标
- 评估自监督语音表征是否能比现有声学或语义模型更准确地预测人类对自然语音的皮层响应。
- 探究自监督模型的不同层级如何对应人类听觉皮层中的不同功能区域。
- 确定不同深度的自监督模型编码了哪些语言层级(声学、音素、词汇)的信息。
- 评估 SSL 模型中的表征层次是否与人类语音处理的潜在阶段相一致。
提出的方法
- 从四种 SSL 模型(APC、wav2vec、wav2vec 2.0、HuBERT)的中间层和深层提取隐藏表征,这些模型在有声书数据上进行训练。
- 使用体素级编码模型结合岭回归,以 SSL 特征作为输入,预测语音刺激引起的 fMRI BOLD 响应。
- 将模型性能与声学基线(梅尔倒谱系数、时频特征)、音素特征和语义词嵌入进行比较。
- 通过方差划分分析,量化 SSL 特征与人工设计特征对大脑响应预测的共享与独特贡献。
- 通过线性探测评估每个 SSL 层编码了何种语言信息(FBANK、时频特征、音素、词汇)。
- 使用强制对齐技术,从叙事音频和转录文本中获取精确的词和音素时间信息,以实现特征对齐。
实验结果
研究问题
- RQ1自监督语音表征是否比传统声学或语义特征更准确地预测人类对自然语音的皮层响应?
- RQ2SSL 模型中的哪些层级最能预测听觉皮层特定区域的活动?
- RQ3不同深度的 SSL 模型编码了哪些类型的语言信息(频谱、音素、语义)?
- RQ4SSL 模型中的表征层次在多大程度上与人类大脑中语音处理的分层过程相吻合?
主要发现
- wav2vec 2.0 和 HuBERT 的中间层和中上层在预测整个听觉皮层的 fMRI 响应方面达到最高准确度,优于所有声学基线和有监督模型。
- 较低的 SSL 层最能预测初级听觉皮层的响应,而更深层则能预测与音素和语义处理相关的高级语言区域的活动。
- 方差划分分析显示,表现最佳的 SSL 层同时捕捉了时频、音素和部分语义信息,解释了比任何单一基线特征空间更多的大脑响应独特方差。
- 线性探测表明,最低层 SSL 模型编码了 FBANK 和时频特征,中间层编码了时频和音素特征,上层编码了词汇身份,表明语言表征存在分层演进过程。
- 音素身份在 wav2vec 2.0 和 HuBERT 的最顶层被最佳预测,表明即使没有显式的语言监督,也存在上下文依赖的音素感知。
- SSL 模型的整体表征深度与人类大脑中语音处理的潜在阶段高度吻合,表明人工与生物语音处理系统之间存在结构同构性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。