Skip to main content
QUICK REVIEW

[论文解读] Structure from Silence: Learning Scene Structure from Ambient Sound

Ziyang Chen, Xixi Hu|arXiv (Cornell University)|Nov 10, 2021
Music and Audio Processing被引用 11
一句话总结

本文提出,安静室内场景中的环境声音蕴含丰富的三维场景结构信息,可实现仅基于音频的深度估计以及多模态自监督表征学习。基于新收集的‘Quiet Campus’配对音频与RGB-D数据集,作者证明了仅通过声音即可估计相对墙体距离,并利用自监督方法学习到有用的视觉-音频特征,其中低频分量(0–1000 Hz)对结构感知最为关键。

ABSTRACT

From whirling ceiling fans to ticking clocks, the sounds that we hear subtly vary as we move through a scene. We ask whether these ambient sounds convey information about 3D scene structure and, if so, whether they provide a useful learning signal for multimodal models. To study this, we collect a dataset of paired audio and RGB-D recordings from a variety of quiet indoor scenes. We then train models that estimate the distance to nearby walls, given only audio as input. We also use these recordings to learn multimodal representations through self-supervision, by training a network to associate images with their corresponding sounds. These results suggest that ambient sound conveys a surprising amount of information about scene structure, and that it is a useful signal for learning multimodal features.

研究动机与目标

  • 探究真实世界、安静室内场景中的环境声音是否蕴含关于三维场景几何结构的信息。
  • 开发仅使用音频的深度估计模型,通过被动、非混响的声音线索推断与墙体的距离。
  • 探索环境音频是否可作为自监督信号,用于学习多模态视觉-音频表征。
  • 评估仅使用音频信号在未见环境中实现机器人沿墙导航的可行性。

提出的方法

  • 在大学校园内多个安静室内场景中,收集了配对的音频与RGB-D记录的新野外数据集。
  • 训练仅使用音频的模型,以梅尔频谱图为输入,通过距离回归作为目标,预测相对于墙体的深度。
  • 设计自监督的预训练任务,使模型基于视觉上下文预测两个音频片段的相对深度顺序。
  • 使用对比学习训练音视频编码器,实现跨模态特征对齐,无需显式标注。
  • 通过零样本和微调协议,在下游深度估计与机器人导航任务上评估模型性能。
  • 通过遮蔽音频输入中的频带,开展消融实验,识别最具信息量的频谱分量。

实验结果

研究问题

  • RQ1安静室内环境中,环境声音是否能提供可靠线索,用于估计三维场景结构(如墙体距离)?
  • RQ2仅使用音频的模型在未见环境中的深度估计任务中,其泛化能力如何?
  • RQ3利用音视频对应关系进行自监督学习,是否能提升下游多模态表征学习性能?
  • RQ4环境声音中哪些频带对场景结构感知最具信息量?
  • RQ5基于音频的深度估计是否可用于引导机器人完成沿墙导航任务?

主要发现

  • 仅使用音频的模型在相对深度估计任务中表现优异,低频分量(0–1000 Hz)已足够实现准确预测。
  • 采用自监督音视频表征学习方法后,下游深度估计性能显著提升,微调后mAP提升4%(70.0% vs. 65.6%)。
  • 由音频深度模型引导的机器人在8米长带弯角的走廊中,18次试验中有近一半成功完成导航,优于随机策略与直线策略。
  • AV-Order自监督方法优于AV-Sync及其他基线方法,表明相对深度排序是强有力的监督信号。
  • 即使在遮蔽高频分量后,模型性能仍保持强劲,证实低频声场承载了最主要的结构信息。
  • 视觉模型在导航任务中表现优于音频模型,但音频仍可作为视觉退化条件下机器人感知的可靠、低成本备用信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。