Skip to main content
QUICK REVIEW

[论文解读] Deep Learning Based Stage-wise Two-dimensional Speaker Localization with Large Ad-hoc Microphone Arrays

Shupei Liu, Feng, Linfeng|arXiv (Cornell University)|Oct 19, 2022
Speech and Audio Processing被引用 7
一句话总结

本文提出一种基于深度学习的二维(2D)说话人定位方法,采用大规模即兴麦克风阵列,其中卷积神经网络(CNN)在每个节点估计波达方向(DOA),随后通过三角测量与聚类算法估计2D说话人位置。该方法在模拟与真实数据上均显著降低了平均绝对误差(MAE),采用基于Softmax的节点选择策略进一步提升了精度。

ABSTRACT

While deep-learning-based speaker localization has shown advantages in challenging acoustic environments, it often yields only direction-of-arrival (DOA) cues rather than precise two-dimensional (2D) coordinates. To address this, we propose a novel deep-learning-based 2D speaker localization method leveraging ad-hoc microphone arrays, where an ad-hoc microphone array is composed of randomly distributed microphone nodes, each of which is equipped with a traditional array. Specifically, we first employ convolutional neural networks at each node to estimate speaker directions. Then, we integrate these DOA estimates using triangulation and clustering techniques to get 2D speaker locations. To further boost the estimation accuracy, we introduce a node selection algorithm that strategically filters the most reliable nodes. Extensive experiments on both simulated and real-world data demonstrate that our approach significantly outperforms conventional methods. The proposed node selection further refines performance. The real-world dataset in the experiment, named Libri-adhoc-node10 which is a newly recorded data described for the first time in this paper, is online available at https://github.com/Liu-sp/Libri-adhoc-nodes10.

研究动机与目标

  • 解决传统说话人定位方法仅能估计波达方向(DOA)而无法获得完整2D坐标的局限性。
  • 在混响与噪声环境中,利用大规模、随机部署的即兴麦克风阵列实现高精度2D说话人定位。
  • 克服先前深度学习方法对固定节点位置或空间模式的依赖,确保在真实场景部署中的灵活性。
  • 通过新颖的基于Softmax的节点选择算法,提升估计精度并降低计算复杂度。
  • 证明在模拟数据上训练的模型能有效泛化至真实世界环境,且领域偏移极小。

提出的方法

  • 在每个即兴麦克风节点应用卷积神经网络(CNN),从多通道音频信号中估计语音源的波达方向(DOA)。
  • 通过选定节点对之间的三角测量,生成基于DOA线相交的多个粗略说话人位置估计。
  • 对粗略位置估计集合应用聚类算法,以识别并优化最终的精确说话人位置。
  • 实现一种基于Softmax的节点选择算法,优先选择高精度DOA估计,从而降低计算负载并提升定位精度。
  • 使用混合源与双源训练数据联合训练CNN-based DOA估计器,以增强鲁棒性与泛化能力。
  • 在CNN输入中集成相位频谱图与广义互相关等空间特征,以提升DOA估计性能。

实验结果

研究问题

  • RQ1能否有效结合基于深度学习的单个即兴节点DOA估计与三角测量、聚类方法,实现高精度2D说话人定位?
  • RQ2在模拟与真实混响环境中,所提方法与传统DOA估计方法(如MUSIC、SRP-PHAT)相比性能如何?
  • RQ3节点选择——尤其是学习型Softmax-based选择——在多大程度上提升了定位精度并降低了计算成本?
  • RQ4在未知声学条件与节点配置的真实世界测试场景中,基于模拟数据训练的模型能否实现有效泛化?
  • RQ5所选节点数量及训练策略(混合源 vs. 双源)对最终定位精度有何影响?

主要发现

  • 当使用双源数据进行训练时,该方法在30 dB信噪比(SNR)的模拟环境中,单说话人定位的平均绝对误差(MAE)达到0.0821 m,显著优于基线方法。
  • 在Libri-adhoc-nodes10数据集的真实世界测试中,该方法在单说话人场景下的MAE为0.3931 m,优于MUSIC(1.5999 m)与SRP-PHAT(1.5239 m)。
  • 基于Softmax的节点选择策略相比使用所有节点进一步降低了MAE:在30 dB SNR的双说话人场景中,18个最佳节点的MAE为0.4702 m,而所有节点的MAE为0.4654 m,表明存在微小但一致的性能提升。
  • 在模拟数据上训练的模型在真实世界环境中表现出良好泛化能力,MAE仅适度增加(例如,从0.0821 m增至0.3931 m),表明模型对域偏移具有较强鲁棒性。
  • 三说话人场景下的性能下降主要源于鬼影说话人估计数量呈指数级增长,凸显了多源定位中的关键挑战。
  • 在六组测试场景中的三组,K-best节点选择方法优于全节点方法,验证了选择性估计在降噪与提升精度方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。