Skip to main content
QUICK REVIEW

[论文解读] Libri-adhoc40: A dataset collected from synchronized ad-hoc microphone arrays

Shanzheng Guan, Shupei Liu|arXiv (Cornell University)|Mar 28, 2021
Speech and Audio Processing参考文献 21被引用 8
一句话总结

本论文提出 Libri-adhoc40,一个在办公室环境中从40个分布式、时间同步的麦克风节点录制的同步真实语音语料库,通过扬声器重放 LibriSpeech 数据。该数据集可用于评估即兴麦克风阵列系统,表明增加通道数量并采用学习型通道选择(例如,Scaling Sparsemax)可显著降低 WER——在使用40个通道的真实训练数据时,相比最优方法(oracle methods)实现19.6%的相对 WER 降低。

ABSTRACT

Recently, there is a research trend on ad-hoc microphone arrays. However, most research was conducted on simulated data. Although some data sets were collected with a small number of distributed devices, they were not synchronized which hinders the fundamental theoretical research to ad-hoc microphone arrays. To address this issue, this paper presents a synchronized speech corpus, named Libri-adhoc40, which collects the replayed Librispeech data from loudspeakers by ad-hoc microphone arrays of 40 strongly synchronized distributed nodes in a real office environment. Besides, to provide the evaluation target for speech frontend processing and other applications, we also recorded the replayed speech in an anechoic chamber. We trained several multi-device speech recognition systems on both the Libri-adhoc40 dataset and a simulated dataset. Experimental results demonstrate the validness of the proposed corpus which can be used as a benchmark to reflect the trend and difference of the models with different ad-hoc microphone arrays. The dataset is online available at https://github.com/ISmallFish/Libri-adhoc40.

研究动机与目标

  • 为解决即兴麦克风阵列缺乏同步真实数据集的问题,该问题阻碍了分布式语音处理的基础研究。
  • 提供一个基准数据集,以反映不同麦克风阵列配置和空间配置下的真实性能差异。
  • 支持在真实、大规模即兴麦克风阵列设置下对语音前端处理、识别、增强和分离任务进行评估。
  • 通过提供同步与非同步的测试场景,支持同步技术的研究。

提出的方法

  • 使用40个同步分布式麦克风在真实办公室环境中录制,通过扬声器重放 LibriSpeech 的 'train-clean-100'、'dev-clean' 和 'test-clean' 子集。
  • 通过硬件和软件时间对齐实现同步,以保留信号传播延迟信息,避免帧丢失或时钟漂移补偿。
  • 另收集了一个独立的无回声室录音作为语音处理评估的干净参考目标。
  • 该数据集包含4,510小时数据,每个麦克风110小时,并包含多个扬声器位置,以模拟不同声源到麦克风的距离和方向。
  • 基于 conformer 的 ASR 模型在模拟数据和真实 Libri-adhoc40 数据上进行训练,并在不同通道配置下对测试集进行评估。
  • 评估了通道选择策略(如 Scaling Sparsemax),以衡量在动态环境中智能麦克风选择带来的性能提升。

实验结果

研究问题

  • RQ1在真实即兴阵列中,多设备 ASR 系统的性能如何随同步麦克风数量的增加而变化?
  • RQ2在真实即兴麦克风阵列场景中,学习型通道选择策略在多大程度上优于最优单选方法?
  • RQ3麦克风阵列几何结构和说话人方向如何影响远场、分布式麦克风设置下的语音识别性能?
  • RQ4来自 Libri-adhoc40 的真实同步数据能否作为评估语音处理算法(如去混响和分离)的可靠基准,而不仅限于 ASR?
  • RQ5与模拟数据相比,使用真实同步数据进行训练在泛化到真实世界测试条件方面表现如何?

主要发现

  • 在真实 Libri-adhoc40 数据上训练时,Scaling Sparsemax 模型在40个通道下相比最优方法实现了19.6%的相对 WER 降低,证明了智能通道选择的价值。
  • 在真实训练条件下,当通道数从10增加到40时,Scaling Sparsemax 模型的 WER 相对降低46.6%,凸显了大阵列带来的性能增益。
  • 在最近的麦克风位置(pos1)下,真实训练模型的平均 WER 为9%;而在较远或方向不佳的位置(pos2、pos3),WER 分别上升至25.3%和21.8%,显示出对几何结构和方向的强依赖性。
  • Scaling Sparsemax 模型减轻了不良说话人方向的影响:相比 pos1,最优方法在 pos2 和 pos3 的 WER 上升了66%,而 Scaling Sparsemax 的上升幅度仅为54%,表明其对阵列几何结构更具鲁棒性。
  • 在真实 Libri-adhoc40 数据上训练的模型始终优于在模拟数据上训练的模型,证实了真实世界数据对泛化能力的重要性。
  • 由于提供了干净的无回声录音和空间分布多样的扬声器信号,该数据集支持语音增强、去混响和分离任务的评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。