Skip to main content
QUICK REVIEW

[论文解读] SoundCam: A Dataset for Finding Humans Using Room Acoustics

Mason Wang, S.D. Clarke|arXiv (Cornell University)|Nov 6, 2023
Speech and Audio Processing被引用 4
一句话总结

SoundCam 引入了迄今为止最大的公开真实环境房间脉冲响应(RIR)数据集,涵盖5,000组10通道RIR和2,000段音乐录音,覆盖三个各具特色的房间,包含不同的人体位置与身份。该数据集使基于学习的方法能够利用多麦克风RIR实现30厘米以内的人员定位,但当麦克风数量减少或源信号未知时,性能会下降。

ABSTRACT

A room's acoustic properties are a product of the room's geometry, the objects within the room, and their specific positions. A room's acoustic properties can be characterized by its impulse response (RIR) between a source and listener location, or roughly inferred from recordings of natural signals present in the room. Variations in the positions of objects in a room can effect measurable changes in the room's acoustic properties, as characterized by the RIR. Existing datasets of RIRs either do not systematically vary positions of objects in an environment, or they consist of only simulated RIRs. We present SoundCam, the largest dataset of unique RIRs from in-the-wild rooms publicly released to date. It includes 5,000 10-channel real-world measurements of room impulse responses and 2,000 10-channel recordings of music in three different rooms, including a controlled acoustic lab, an in-the-wild living room, and a conference room, with different humans in positions throughout each room. We show that these measurements can be used for interesting tasks, such as detecting and identifying humans, and tracking their positions.

研究动机与目标

  • 为解决缺乏系统性地改变人体位置与身份并测量声学变化的真实世界、野外环境RIR数据集的问题。
  • 推动基于RIR作为环境状态代理的音频驱动人员检测、定位与识别研究。
  • 提供一个基准,用于评估音频方法在真实条件下的鲁棒性,包括遮挡和未知源信号的情况。
  • 通过提供一种替代视觉追踪的方案,支持隐私保护型室内传感,避免采集视觉数据。
  • 通过发布公开数据集与基准,促进防御技术的发展,降低恶意使用风险。

提出的方法

  • 在三个不同房间(受控声学实验室、真实客厅、会议室)中采集5,000组多通道(10麦克风)房间脉冲响应(RIR)。
  • 在每个房间中系统性地改变2至5名人体受试者的位置与身份,同时测量固定扬声器与麦克风对之间的RIR。
  • 在相同房间中,以相同受试者位置录制2,000段额外的10通道音乐信号,以支持使用自然非脉冲源信号的测试。
  • 为所有RIR和音频录制添加精确元数据,包括源信号、接收器及人体受试者的位置与身份信息。
  • 利用该数据集训练并评估基于深度学习的模型,以实现多麦克风与单麦克风配置下的人员定位与识别。
  • 在消融实验设置下评估模型性能,包括麦克风数量减少与未知源信号的情况,以评估真实世界泛化能力。

实验结果

研究问题

  • RQ1能否利用真实世界的RIR,在多麦克风配置下实现室内环境中人员定位误差小于30厘米?
  • RQ2当仅使用单个麦克风或未知源信号(如音乐)时,性能如何下降?
  • RQ3基于音频的模型在未见个体与房间布局下的泛化能力有多强?
  • RQ4能否利用自然声源(如音乐)的RIR高精度检测房间内人员的存在?
  • RQ5仅依靠声学特征,基于音频的方法在群体中识别个体的效率如何?

主要发现

  • 基于学习的模型在使用10麦克风RIR时,人员定位误差可控制在30厘米以内,表明在多麦克风受控条件下具有高精度。
  • 当仅使用单个麦克风时,性能显著下降,定位精度因空间多样性受限而降低。
  • 当使用未知音乐作为源信号且所有10个麦克风均启用时,最佳基线模型对人员存在的检测准确率为67%。
  • 在五名个体中进行人员识别,最佳模型在使用全部10个麦克风时达到82%的准确率,显示出身份识别的强潜力。
  • 将麦克风数量减少至4个、2个或1个时,定位与识别任务的性能均持续下降,凸显密集麦克风阵列的重要性。
  • 该数据集支持隐私保护型室内传感系统的发展,通过实现仅依赖音频的追踪,避免采集视觉数据及其相关的隐私风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。