Skip to main content
QUICK REVIEW

[论文解读] Uncalibrated 3D Room Reconstruction from Sound

Marco Crocco, Andrea Trucco|arXiv (Cornell University)|Jun 20, 2016
Speech and Audio Processing参考文献 20被引用 5
一句话总结

本文提出了一种完全无需校准的基于声音的3D房间重建方法,通过在3D网格上进行贪心迭代搜索解耦墙面估计,从而绕过混响标签问题,随后采用全局非线性最小二乘优化。该方法在模拟和真实场景中均实现了高精度,即使在信噪比低和数据缺失条件下,声源和麦克风的平均重建误差分别仅为31mm和22mm。

ABSTRACT

This paper presents a method to reconstruct the 3D structure of generic convex rooms from sound signals. Differently from most of the previous approaches, the method is fully uncalibrated in the sense that no knowledge about the microphones and sources position is needed. Moreover, we demonstrate that it is possible to bypass the well known echo labeling problem, allowing to reconstruct the room shape in a reasonable computation time without the need of additional hypotheses on the echoes order of arrival. Finally, the method is intrinsically robust to outliers and missing data in the echoes detection, allowing to work also in low SNR conditions. The proposed pipeline formalises the problem in different steps such as time of arrival estimation, microphones and sources localization and walls estimation. After providing a solution to these different problems we present a global optimization approach that links together all the problems in a single optimization function. The accuracy and robustness of the method is assessed on a wide set of simulated setups and in a challenging real scenario. Moreover we make freely available for a challenging dataset for 3D room reconstruction with accurate ground truth in a real scenario.

研究动机与目标

  • 实现无需事先知晓麦克风或声源位置的基于声音的3D房间重建。
  • 通过将墙面估计与峰值到表面匹配解耦,绕过通常需要假设混响顺序的混响标签问题。
  • 开发一种鲁棒且计算可行的方法,适用于低信噪比和数据缺失条件。
  • 通过单一可微分代价函数整合麦克风、声源和墙面位置估计,实现全局优化。
  • 在包含精确真实值的新真实世界数据集上验证该方法,以供基准测试。

提出的方法

  • 使用匹配滤波提取信号峰值,估计直达路径和反射路径的飞行时间(TOF)。
  • 采用基于矩阵分解的迭代方法,从直达路径的TOF中估计初始麦克风和声源位置。
  • 通过在3D离散网格上贪心迭代搜索每个平面表面,实现墙面估计,使用鲁棒代价函数避免混响标签问题。
  • 初始阶段排除二阶反射,以减少依赖性,并通过剔除已匹配的峰值来简化后续搜索。
  • 在混响标签问题解决后,对所有变量(麦克风位置、声源位置、墙面平面和到达时间)应用全局非线性最小二乘优化。
  • 采用对缺失或虚假峰值具有容忍能力的鲁棒代价函数,提升低信噪比环境下的性能。

实验结果

研究问题

  • RQ1能否在不事先知晓麦克风或声源位置的情况下,从声音中重建3D房间几何结构?
  • RQ2是否可能在不假设混响到达顺序的前提下,绕过3D房间重建中的混响标签问题?
  • RQ3如何设计一个完全无需校准、鲁棒且高效的3D房间重建流程,以处理真实世界的声学信号?
  • RQ4在低信噪比和数据缺失条件下,该方法能达到的精度如何?
  • RQ5与初始网格搜索估计相比,全局优化解是否能提升重建精度?

主要发现

  • 在真实世界实验中,声源和麦克风的平均重建误差分别为31mm和22mm,表明即使在模型假设下仍具有高精度。
  • 天花板平面误差最大(首次估计距离误差为1824mm,优化后为1795mm),归因于房间的非平面穹顶结构。
  • 若不考虑天花板,估计值与真实值平面法向量之间的角度误差为0.43°至2.98°,优化解中的距离误差为1mm至62mm。
  • 全局优化步骤显著提升了精度,角度误差最多降低50%,距离误差平均降低50%。
  • 由于采用了鲁棒代价函数,该方法在低信噪比和数据缺失条件下仍保持鲁棒性,即使在峰值检测不完善时也能实现可靠性能。
  • 发布了一个包含精确真实值的新真实世界数据集,为未来无需校准的基于声音的3D房间重建研究提供了基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。