[论文解读] MeshRIR: A Dataset of Room Impulse Responses on Meshed Grid Points For Evaluating Sound Field Analysis and Synthesis Methods
MeshRIR 是一个新型的混响脉冲响应(RIR)数据集,在三维立方体区域和二维方形区域中以 0.05 米的精细网格点间距进行测量,支持声场分析与合成方法的高分辨率评估。该数据集适用于声场重建与控制等应用,在样本应用中实现了 -13.7 dB 的均方误差(MSE)和 3.85 dB 的信噪比(SDR)。
A new impulse response (IR) dataset called "MeshRIR" is introduced. Currently available datasets usually include IRs at an array of microphones from several source positions under various room conditions, which are basically designed for evaluating speech enhancement and distant speech recognition methods. On the other hand, methods of estimating or controlling spatial sound fields have been extensively investigated in recent years; however, the current IR datasets are not applicable to validating and comparing these methods because of the low spatial resolution of measurement points. MeshRIR consists of IRs measured at positions obtained by finely discretizing a spatial region. Two subdatasets are currently available: one consists of IRs in a three-dimensional cuboidal region from a single source, and the other consists of IRs in a two-dimensional square region from an array of 32 sources. Therefore, MeshRIR is suitable for evaluating sound field analysis and synthesis methods. This dataset is freely available at https://sh01k.github.io/MeshRIR/ with some codes of sample applications.
研究动机与目标
- 为解决缺乏公开可用、适合评估声场分析与合成方法的高空间分辨率 RIR 数据集的问题。
- 通过密集测量网格,实现对空间音频处理技术(如声场重建与控制)的真实验证。
- 提供一个免费获取的数据集,包含细粒度的脉冲响应,用于不同方法的基准测试与比较。
- 支持空间音频研究,包括声波场重建、插值和主动声场控制。
- 通过在三维和二维区域中分别提供包含 3969 个和 441 个测量点的子数据集,扩展现有数据集。
提出的方法
- 该数据集通过在 1.0×1.0×0.4 米的三维立方体区域(单个声源)和 1.0×1.0 米的二维方形区域(32 个声源位置)中以 0.05 米间距测量 RIR 而构建。
- 所有 RIR 均在真实房间(7.0×6.4×2.7 米)中以 48 kHz 采样率、32768 个样本长度录制,使用扫频正弦激励信号以确保高精度。
- 声场重建采用无限阶球谐分析,等价于使用零阶球贝塞尔函数的核插值方法。
- 声场控制通过压力匹配法实现,通过最小化合成场与目标场之间的误差,使用 16 个控制点。
- 数据集包含用于重建与控制应用的示例代码,包含时域滤波器设计及下采样信号(8 kHz),以提高计算效率。
- 测量区域被离散化为均匀网格,使得任意子集可作为输入,其余部分作为验证的真值。

实验结果
研究问题
- RQ1具有密集空间采样的高分辨率 RIR 数据集是否能提升声场重建方法的评估效果?
- RQ2使用球谐分解,从稀疏测量集合中能多准确地重建声场?
- RQ3在受控区域内,通过多个扬声器能多大程度上合成出目标声场(如平面波)?
- RQ4在使用密集 RIR 数据集时,声场控制的可实现信噪比(SDR)是多少?
- RQ5一个公开可用、无限制的细粒度 RIR 数据集是否能实现空间音频处理方法的标准化基准测试?
主要发现
- 在 2D 平面中使用 18 个麦克风估计声压分布的声场重建实验中,实现了 -13.7 dB 的均方误差(MSE)。
- 在 1.0×1.0 米的目标区域中合成平面波的声场控制实验中,实现了 3.85 dB 的信噪比(SDR)。
- 该数据集包含 3969 个 RIR(三维立方体区域)和 441 个 RIR(二维方形区域),空间分辨率为 0.05 米。
- 三维子数据集(S1-M3969)的混响时间(T60)为 0.38 秒,二维子数据集(S32-M441)的 T60 为 0.19 秒。
- 该数据集可在 https://sh01k.github.io/MeshRIR/ 免费获取,采用无限制许可,并提供声场重建与控制的示例代码。
- 该数据集支持需要密集空间采样的方法的验证,如声波场重建与主动声场控制,而这些方法在现有数据集中未能得到充分支持。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。