[论文解读] SSLIDE: Sound Source Localization for Indoors based on Deep Learning
SSLIDE 提出了一种基于深度学习的声源定位方法,采用编码器-解码器架构,并配备两个并行解码器,以联合估计混响室内环境中的声源位置并抑制多径干扰。该方法在模拟数据和真实世界数据上均实现了最先进性能,优于 MUSIC、SRP-PHAT、SBL 和 CNN,平均绝对误差更低,且在混响时间、麦克风间距以及未见语音信号方面表现出强大的泛化能力。
This paper presents SSLIDE, Sound Source Localization for Indoors using DEep learning, which applies deep neural networks (DNNs) with encoder-decoder structure to localize sound sources with random positions in a continuous space. The spatial features of sound signals received by each microphone are extracted and represented as likelihood surfaces for the sound source locations in each point. Our DNN consists of an encoder network followed by two decoders. The encoder obtains a compressed representation of the input likelihoods. One decoder resolves the multipath caused by reverberation, and the other decoder estimates the source location. Experiments based on both the simulated and experimental data show that our method can not only outperform multiple signal classification (MUSIC), steered response power with phase transform (SRP-PHAT), sparse Bayesian learning (SBL), and a competing convolutional neural network (CNN) approach in the reverberant environment but also achieve a good generalization performance.
研究动机与目标
- 开发一种鲁棒的声源定位(SSL)方法,适用于传统方法因多径效应而失效的混响室内环境。
- 实现在无需预设候选 DOA 网格的连续空间定位,提升实际应用价值。
- 提升在不同混响时间、麦克风配置以及未见语音信号下的泛化能力。
- 通过一个具有两个并行解码器的单一深度神经网络,联合估计声源位置并抑制多径干扰。
提出的方法
- 该方法使用一个深度神经网络,其编码器将来自时频域波束成形的输入似然图进行压缩。
- 采用两个并行解码器:一个用于估计声源位置,另一个用于抑制由房间混响引起的多径干扰。
- 输入特征为通过短时傅里叶变换(STFT)和导向矢量投影计算出的似然图 $ P_{ns}( heta,d) $,对应角度 $ \theta $ 和距离 $ d $。
- 似然图在角度和距离的 $ U \times V $ 二维网格上表示,形成输入深度神经网络的张量。
- 网络通过监督学习进行端到端训练,目标为真实声源位置和具备多径感知能力的标签。
- 多径抑制解码器被特别设计为学习抑制似然表示中由混响引起的失真。

实验结果
研究问题
- RQ1具有双解码器架构的深度学习模型是否能在高度混响的室内环境中优于传统 SSL 方法(如 MUSIC 和 SRP-PHAT)?
- RQ2所提出的方法是否在不同混响时间、麦克风间距以及未见语音信号下具有良好泛化能力?
- RQ3多径抑制解码器是否对性能至关重要?若将其移除,定位精度是否会下降?
- RQ4该模型能否在无需事先知道候选 DOA 方向的前提下实现精确定位,而无需依赖大多数基线方法所依赖的先验信息?
主要发现
- 在混响时间为 0.6 秒的模拟数据中,SSLIDE 的平均绝对误差(MAE)为 6.7 米,优于 SRP-PHAT(25 米)、MUSIC(27 米)、SBL(17 米)和 CNN(16 米)。
- 在 MIRD 数据集中,SSLIDE 的 DOA 估计 MAE 为 8.1°,显著低于 SRP-PHAT(19°)、MUSIC(18°)、SBL(18°)和 CNN(9.8°)。
- 消融研究显示,移除多径抑制解码器后,模拟数据中 MAE 增加 0.2–0.3 米,MIRD 数据中 MAE 增加 0.06–0.12°,证实其关键作用。
- SSLIDE 在扰动条件下表现出良好泛化能力:当测试混响时间从 0.6 秒增至 0.7 秒时,MAE 仅从 0.77 米增至 0.93 米,优于 CNN(1.1 米增至 1.7 米)。
- 在 3 个新的未见语音录音上测试时,SSLIDE 的 MAE 保持在 0.45 米,而 CNN 的 MAE 高达 12.0 米,表明其对语音变化具有更强鲁棒性。
- 该模型在无需依赖预设 DOA 候选网格的情况下实现优异性能,而 SRP-PHAT、MUSIC、SBL 和 CNN 均需此类先验信息。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。