Skip to main content
QUICK REVIEW

[论文解读] BatVision with GCC-PHAT Features for Better Sound to Vision Predictions

Jesper Haahr Christensen, Sascha Hornauer|arXiv (Cornell University)|Jun 14, 2020
Speech and Audio Processing参考文献 8被引用 5
一句话总结

该论文提出了一种增强版声学转视觉合成系统 BatVision,通过使用广义互相关相位变换(GCC-PHAT)特征作为输入,并结合残差嵌套残差密集块与谱归一化,提升了从双耳回声中重建深度图与灰度图像的质量。该方法在原始波形与频谱图的基础上,实现了更优的重建质量与训练稳定性,证明了仅依靠声学信号实现场景感知的可行性,显著减少了伪影并提升了感知保真度。

ABSTRACT

Inspired by sophisticated echolocation abilities found in nature, we train a generative adversarial network to predict plausible depth maps and grayscale layouts from sound. To achieve this, our sound-to-vision model processes binaural echo-returns from chirping sounds. We build upon previous work with BatVision that consists of a sound-to-vision model and a self-collected dataset using our mobile robot and low-cost hardware. We improve on the previous model by introducing several changes to the model, which leads to a better depth and grayscale estimation, and increased perceptual quality. Rather than using raw binaural waveforms as input, we generate generalized cross-correlation (GCC) features and use these as input instead. In addition, we change the model generator and base it on residual learning and use spectral normalization in the discriminator. We compare and present both quantitative and qualitative improvements over our previous BatVision model.

研究动机与目标

  • 开发一种仅基于双耳回声信号的机器学习系统,用于预测三维深度图与合理的灰度布局。
  • 探究 GCC-PHAT 特征是否在声学转视觉生成任务中优于原始波形与频谱图作为输入。
  • 通过残差嵌套残差密集块与谱归一化等架构创新,提升训练稳定性与重建质量。
  • 证明仅依靠声学信号实现场景感知的可行性,作为视觉的补充或替代模态,尤其在低光照条件下。

提出的方法

  • 系统使用安装在仿真人耳上的两个麦克风采集的双耳音频,训练期间与通过摄像头同步捕获的立体 RGB 图像及深度图数据对齐。
  • GCC-PHAT 特征通过在频域中对每只耳朵的信号与发射的啁啾信号进行互相关计算,随后经逆傅里叶变换得到时域互相关特征。
  • 将左右通道的 GCC-PHAT 特征拼接后输入时间卷积编码器,以提取潜在的音频表征。
  • 生成器采用残差嵌套残差密集块,以增强特征学习与特征复用,提升重建质量。
  • 判别器采用谱归一化而非批归一化,以稳定训练并改善 GAN 的收敛性。
  • 完整模型通过组合损失函数进行训练:最小二乘 GAN 损失、带权重因子 λ 的对抗损失,以及 L1 重建损失。

实验结果

研究问题

  • RQ1与原始波形或频谱图相比,GCC-PHAT 特征是否能显著提升从双耳回声中预测深度图与灰度图像的质量?
  • RQ2残差嵌套残差密集块的使用如何影响生成器重建精细场景结构的能力?
  • RQ3在该声学-视觉任务中,与批归一化相比,谱归一化是否能带来更稳定的训练过程?
  • RQ4系统在仅使用声音输入而无视觉信息的情况下,能在多大程度上重建出合理的三维场景布局?
  • RQ5与原始 BatVision 架构相比,所提模型在超参数变化与数据增强下的鲁棒性如何?

主要发现

  • 采用 GCC-PHAT 特征的模型在深度图预测中实现了最低的 L1 损失(0.0645),优于原始 BatVision 使用波形的配置(0.0880)。
  • 使用 GCC-PHAT 特征的模型在深度图准确率(δ<1.25³)上达到 0.556,超过原始 BatVision 使用波形(0.484)与频谱图(0.521)的性能。
  • 重建的深度图相比原始 BatVision 显著减少了噪声,空间布局更准确,能更清晰地区分近处与远处物体。
  • 判别器中使用谱归一化使训练过程更加稳定,对超参数变化的敏感性低于批归一化。
  • 定性结果表明,所提模型生成的灰度图像更具感知合理性,自由空间与障碍物布局更连贯,尽管仅凭声音无法实现精确外观重建。
  • 采用 GCC-PHAT 特征与新架构的模型在定量性能与视觉质量之间达到了最佳平衡,验证了所提组件的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。