[论文解读] Towards Ultrasound Tongue Image prediction from EEG during speech production
本研究提出一种深度学习方法,通过非侵入性脑电信号(EEG)预测言语产生过程中的超声舌像(UTI),采用全连接深度神经网络。结果显示,EEG与UTI之间存在微弱但可察觉的关系,模型能够区分言语中的发音状态与中性舌位,证明了未来基于发音反馈的言语脑机接口的可行性。
Previous initial research has already been carried out to propose speech-based BCI using brain signals (e.g. non-invasive EEG and invasive sEEG / ECoG), but there is a lack of combined methods that investigate non-invasive brain, articulation, and speech signals together and analyze the cognitive processes in the brain, the kinematics of the articulatory movement and the resulting speech signal. In this paper, we describe our multimodal (electroencephalography, ultrasound tongue imaging, and speech) analysis and synthesis experiments, as a feasibility study. We extend the analysis of brain signals recorded during speech production with ultrasound-based articulation data. From the brain signal measured with EEG, we predict ultrasound images of the tongue with a fully connected deep neural network. The results show that there is a weak but noticeable relationship between EEG and ultrasound tongue images, i.e. the network can differentiate articulated speech and neutral tongue position.
研究动机与目标
- 探究在言语产生过程中,从非侵入性EEG信号预测超声舌像(UTI)的可行性。
- 将多模态数据——EEG、言语和实时超声舌像成像——整合到统一的分析框架中。
- 探讨是否可通过直接测量的超声舌动学数据,提升基于EEG的言语解码性能,相较于间接估计方法。
- 为未来基于非侵入性EEG和实时发音反馈的言语神经假体研究奠定基础。
提出的方法
- 通过硬件同步采集EEG、言语和超声舌像成像的同步数据,确保时间对齐。
- 使用全连接深度神经网络(FC-DNN)将80维EEG特征映射到2D超声舌像。
- 对EEG数据进行预处理并降维至80维特征,作为FC-DNN的输入。
- 使用同步的EEG-UTI配对数据,通过均方误差(MSE)损失函数端到端训练网络。
- 通过在训练集、验证集和测试集上的MSE评估模型性能,并对预测的UTI序列进行定性视觉检查。
- 提供公开的Keras实现版本,以支持可复现性与进一步开发。

实验结果
研究问题
- RQ1在言语产生过程中,EEG信号与超声舌像之间是否存在可检测的关系?
- RQ2深度神经网络能否从非侵入性EEG输入中学习预测UTI序列?
- RQ3该模型在多大程度上能区分言语中的发音状态与中性舌位?
- RQ4与间接发音估计方法相比,引入实时超声数据是否能提升基于EEG的言语解码的可解释性或性能?
- RQ5直接发音反馈在未来非侵入性言语脑机接口中的潜力如何?
主要发现
- FC-DNN在测试集上达到0.0055的均方误差(MSE),表明预测精度可测量但有限。
- 视觉检查显示,模型能够区分发音状态与中性舌位,类似于语音活动检测。
- 尽管MSE值较低,预测的UTI序列与原始图像在视觉上相似度有限,表明EEG-UTI关系微弱但非随机。
- 结果表明EEG与超声舌像之间存在微弱但可察觉的关系,支持EEG到UTI预测的可行性。
- 本研究证实,即使使用非侵入性记录,基于直接超声的发音数据也可用于增强基于EEG的言语解码。
- 作者发布了模型的公开Keras实现,以支持未来在EEG到UTI合成方面的研究。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。