Skip to main content
QUICK REVIEW

[论文解读] Absolute Geometry Calibration of Distributed Microphone Arrays in an Audio-Visual Sensor Network

Florian Jacob, Reinhold Haeb‐Umbach|arXiv (Cornell University)|Apr 13, 2015
Speech and Audio Processing参考文献 18被引用 3
一句话总结

本文提出两种方法,利用音视频相关性对音视频传感器网络中的分布式麦克风阵列进行绝对几何校准——具体而言,通过两种模态的联合到达方向(DoA)测量。第一种方法通过轨迹对齐将声学传感器位置映射到视觉坐标系;第二种方法则通过非线性方程组联合求解声学传感器位置。联合校准方法在高度混响环境中仍能达到0.20 m的平均定位误差。

ABSTRACT

Joint audio-visual speaker tracking requires that the locations of microphones and cameras are known and that they are given in a common coordinate system. Sensor self-localization algorithms, however, are usually separately developed for either the acoustic or the visual modality and return their positions in a modality specific coordinate system, often with an unknown rotation, scaling and translation between the two. In this paper we propose two techniques to determine the positions of acoustic sensors in a common coordinate system, based on audio-visual correlates, i.e., events that are localized by both, microphones and cameras separately. The first approach maps the output of an acoustic self-calibration algorithm by estimating rotation, scale and translation to the visual coordinate system, while the second solves a joint system of equations with acoustic and visual directions of arrival as input. The evaluation of the two strategies reveals that joint calibration outperforms the mapping approach and achieves an overall calibration error of 0.20m even in reverberant environments.

研究动机与目标

  • 解决当已知视觉传感器位置但坐标系错位时,声学传感器网络校准中的尺度模糊问题。
  • 在无需时钟同步或人工校准信号的情况下,实现分布式麦克风阵列的绝对几何校准。
  • 通过利用音视频相关性(如双模态的说话人DoA估计)提升混响环境中校准的准确性。
  • 比较两种校准策略:声学轨迹的坐标映射与结合声学和视觉DoA测量的联合估计。
  • 在不同混响时间下评估性能,并通过真实世界DoA估计模型证明方法的鲁棒性。

提出的方法

  • 以声学和视觉传感器的到达方向(DoA)估计作为输入,避免对飞行时间或到达时间差同步的需求。
  • 采用坐标映射方法,通过对齐来自DoA数据的说话人轨迹,估计声学与视觉坐标系之间的旋转、平移和尺度。
  • 提出一种联合校准方法,将声学和视觉DoA测量整合为一组非线性方程,联合估计声学传感器位置。
  • 应用RANSAC算法剔除声学和视觉DoA估计中的异常值,提升对不良测量的鲁棒性。
  • 使用隐马尔可夫模型(HMM)模拟视觉DoA误差,基于AV16.3语料库的HOG和SVM分析设定检测、漏检和误检状态。
  • 采用带自适应滤波的波束成形器与滤波求和方法,随时间估计声学DoA,实现实时移动说话人跟踪。

实验结果

研究问题

  • RQ1音视频相关性能否有效解决声学传感器网络校准中的尺度模糊问题?
  • RQ2与坐标映射方法相比,结合声学和视觉DoA测量的联合校准在准确性和鲁棒性方面表现如何?
  • RQ3混响对音视频传感器网络中基于DoA的校准方法性能有何影响?
  • RQ4基于RANSAC的异常值剔除在存在噪声DoA估计时,对校准精度的提升程度如何?
  • RQ5少量分布良好的空间事件是否能达到与完整轨迹校准相当的性能?

主要发现

  • 联合校准方法在所有混响时间下均优于坐标映射方法,在高混响环境(RT60 = 500 ms)下实现0.20 m的平均定位误差(MPE)。
  • 坐标映射方法存在显著的尺度估计误差,该误差主导其性能,尤其在低混响时间下更为明显。
  • 在已知尺度因子的“理想”实验中,坐标映射方法在低混响下性能几乎与联合方法相当,证实尺度误差是其主要限制因素。
  • 两种方法在所有混响时间下传感器方向误差均低于2°,表明角度精度极高。
  • 仅使用15个空间分布良好的关键事件,联合校准即可达到与完整轨迹校准相当的性能,证明事件几何分布的重要性远超事件数量。
  • 联合校准方法在RT60 = 300 ms时保持0.14 m的稳定MPE,在RT60 = 500 ms时为0.23 m,显示出对混响的强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。