Skip to main content
QUICK REVIEW

[论文解读] EEG2Mel: Reconstructing Sound from Brain Responses to Music

Adolfo G. Ramirez-Aristizabal, Chris Kello|arXiv (Cornell University)|Jul 28, 2022
EEG and Brain-Computer Interfaces被引用 4
一句话总结

本文提出 EEG2Mel,一种深度学习框架,通过使用时间对齐的一秒 EEG 信号与频谱图配对,从 EEG 信号重建可感知的音乐。通过将 EEG 功率谱和梅尔频谱图视为二维图像,卷积神经网络回归器在两选一行匹配样本任务中实现了 85% 的听者识别准确率,证明了无需大量预处理即可从脑活动实现高保真度听觉重建。

ABSTRACT

Information retrieval from brain responses to auditory and visual stimuli has shown success through classification of song names and image classes presented to participants while recording EEG signals. Information retrieval in the form of reconstructing auditory stimuli has also shown some success, but here we improve on previous methods by reconstructing music stimuli well enough to be perceived and identified independently. Furthermore, deep learning models were trained on time-aligned music stimuli spectrum for each corresponding one-second window of EEG recording, which greatly reduces feature extraction steps needed when compared to prior studies. The NMED-Tempo and NMED-Hindi datasets of participants passively listening to full length songs were used to train and validate Convolutional Neural Network (CNN) regressors. The efficacy of raw voltage versus power spectrum inputs and linear versus mel spectrogram outputs were tested, and all inputs and outputs were converted into 2D images. The quality of reconstructed spectrograms was assessed by training classifiers which showed 81% accuracy for mel-spectrograms and 72% for linear spectrograms (10% chance accuracy). Lastly, reconstructions of auditory music stimuli were discriminated by listeners at an 85% success rate (50% chance) in a two-alternative match-to-sample task.

研究动机与目标

  • 开发一种从被动聆听过程中 EEG 反应中重建自然、完整时长音乐刺激的方法。
  • 在先前工作的基础上进行改进,实现可感知且可识别的音乐重建,而非仅分类或低保真度信号恢复。
  • 通过直接使用 EEG 功率谱作为深度学习模型的输入,消除对复杂特征提取的依赖。
  • 通过人类参与者参与的行为听觉任务,验证重建音乐的感知质量。
  • 证明将计算机视觉技术应用于时间序列神经与音频数据,实现跨领域信号重建的可行性。

提出的方法

  • 将 63 个通道的 EEG 信号转换为每个一秒窗口的二维功率谱图像,并与对应的音乐频谱图对齐。
  • 使用 NMED-Tempo 和 NMED-Hindi 数据集,训练深层 CNN 回归器,将 EEG 功率谱图像映射到梅尔频谱图图像。
  • 模型架构包含多个 2D 卷积层,附带批量归一化、最大池化层,以及全连接层,随后通过重塑操作重建频谱图。
  • 在去归一化后,使用 Griffin-Lim 算法将频谱图反演为波形,通过使用歌曲特定的参考分贝值减少感知伪影。
  • 输入数据通过最小-最大归一化处理,输出频谱图通过歌曲特定的参考分贝值进行去归一化,以提升音频质量。
  • 通过 16 名参与者参与的两选一行听觉任务评估重建质量,评估其与原始音乐的感知相似性。

实验结果

研究问题

  • RQ1是否可以仅依靠 EEG 信号,在不依赖重复刺激平均或短时脉冲的情况下,重建完整时长且可感知识别的音乐刺激?
  • RQ2在 EEG 功率谱上进行训练的深度学习模型,能在多大程度上重建出足够高质量的梅尔频谱图,以生成可听且可识别的音乐?
  • RQ3将 EEG 和频谱图数据表示为二维图像,是否能带来比传统时间序列建模更优的性能和更简单的训练过程?
  • RQ4输入(原始电压 vs. 功率谱)和输出(线性频谱图 vs. 梅尔频谱图)的选择如何影响重建质量?
  • RQ5听者是否能在感知辨别任务中可靠地识别出重建音乐与原始刺激匹配?

主要发现

  • 下游分类器对重建梅尔频谱图的分类准确率达到 81%,显著高于 10% 的随机基线水平。
  • 线性频谱图重建的分类准确率为 72%,同样高于随机水平,表明实现了部分但较弱的信号恢复。
  • 在两选一行匹配样本任务中,听者在 85% 的试验中正确识别出原始音乐,远超 50% 的随机水平。
  • 使用梅尔频谱图输出可提升感知质量,支持在听觉重建中采用梅尔尺度。
  • 在去归一化过程中使用歌曲特定的参考分贝值,可改善重建质量,减少感知伪影。
  • 该方法成功保留了完整音乐时长内的时序动态和频谱内容,实现了连贯且可识别的音频输出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。