Skip to main content
QUICK REVIEW

[论文解读] Localization and Tracking of an Acoustic Source using a Diagonal Unloading Beamforming and a Kalman Filter

Daniele Salvati, Carlo Drioli|arXiv (Cornell University)|Dec 4, 2018
Speech and Audio Processing参考文献 6被引用 4
一句话总结

本论文提出了一种低复杂度、高分辨率的声源定位与跟踪系统,采用对角卸载(DU)波束成形进行波达方向(DOA)估计,并结合卡尔曼滤波(KF)实现时间平滑。该框架在LOCATA挑战数据集的静态与动态场景下,针对线性、伪球形及球形配置等多种麦克风阵列,均实现了亚度级别的均方根误差(RMSE)性能。

ABSTRACT

We present the signal processing framework and some results for the IEEE AASP challenge on acoustic source localization and tracking (LOCATA). The system is designed for the direction of arrival (DOA) estimation in single-source scenarios. The proposed framework consists of four main building blocks: pre-processing, voice activity detection (VAD), localization, tracking. The signal pre-processing pipeline includes the short-time Fourier transform (STFT) of the multichannel input captured by the array and the cross power spectral density (CPSD) matrices estimation. The VAD is calculated with a trace-based threshold of the CPSD matrices. The localization is then computed using our recently proposed diagonal unloading (DU) beamforming, which has low-complexity and high resolution. The DOA estimation is finally smoothed with a Kalman filer (KF). Experimental results on the LOCATA development dataset are reported in terms of the root mean square error (RMSE) for a 7-microphone linear array, the 12-microphone pseudo-spherical array integrated in a prototype head for a humanoid robot, and the 32-microphone spherical array.

研究动机与目标

  • 解决在单源声学场景下,使用麦克风阵列进行精确且鲁棒的波达方向(DOA)估计的挑战。
  • 开发一种低复杂度、高分辨率的波束成形方法,适用于资源受限环境中的实时实现。
  • 集成卡尔曼滤波器,对DOA估计进行时间平滑,提升在噪声或动态条件下的跟踪稳定性。
  • 在LOCATA开发数据集上,针对不同麦克风阵列配置(线性、伪球形、球形)评估该系统。
  • 优化信号处理流水线,以实现人机交互、远程会议和音频监控等实际应用中的部署。

提出的方法

  • 对多通道音频信号应用短时傅里叶变换(STFT),使用汉汉窗函数,2048点FFT,512点帧移。
  • 通过平均25帧来估计互功率谱密度(CPSD)矩阵,以提高频谱相干性与抗噪能力。
  • 实施基于迹的语音活动检测(VAD),以识别语音活动段,各阵列类型采用经验调优的阈值。
  • 使用对角卸载(DU)波束成形进行DOA估计,通过从CPSD矩阵中减去迹缩放的单位矩阵来提升分辨率。
  • 通过80–8000 Hz频带内窄带DU响应的非相干频率融合,计算宽带波束成形响应功率(SRP)。
  • 应用扩展卡尔曼滤波器(EKF)对时间序列中的DOA进行跟踪,采用状态预测与校正步骤,并设置过程噪声与测量噪声参数。

实验结果

研究问题

  • RQ1与传统波束成形器相比,对角卸载波束成形在DOA估计分辨率与计算复杂度方面表现如何?
  • RQ2卡尔曼滤波在动态说话人场景下,对DOA估计的时间稳定性与准确性提升程度如何?
  • RQ3在不同声学条件下,系统在不同麦克风阵列几何结构(线性、伪球形、球形)下的表现如何?
  • RQ4VAD阈值选择对定位精度及背景噪声下鲁棒性的影响是什么?
  • RQ5所提出的框架是否能在真实世界、非混响环境中实现高精度DOA估计,尤其针对移动声源与移动阵列?

主要发现

  • 在静态说话人与静态阵列条件下(任务1,录音3),7麦克风线性阵列的方位RMSE达到0.972°。
  • 在移动说话人与静态阵列场景下(任务3),机器人头阵列在录音3中的方位RMSE为2.880°,仰角RMSE为2.807°。
  • 在最具挑战性的任务(任务5,移动说话人与移动阵列)中,eigenmike球形阵列在录音1中的方位RMSE为4.433°,仰角RMSE为3.100°。
  • 系统对阵列运动与说话人动态表现出鲁棒性,静态或低速运动场景下RMSE值最低。
  • VAD阈值根据阵列类型经验优化,分别为线性阵列200、机器人头阵列50、eigenmike阵列10,显著提升了检测可靠性。
  • 卡尔曼滤波有效降低了DOA估计抖动,尤其在高动态与高噪声条件下,如图3与图4所示轨迹更加平滑。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。