[论文解读] BatVision: Learning to See 3D Spatial Layout with Two Ears
BatVision 是一种低成本、双耳的头相关传输函数(binaural)系统,仅通过神经网络对同步音频与立体摄像头数据进行训练,即可从声音回波中学习重建三维空间布局(如深度图和灰度图像)。该系统在预测深度方面表现出令人惊讶的准确性,并能生成合理的场景重建结果,甚至在某些情况下优于真实立体视觉的深度图。
Many species have evolved advanced non-visual perception while artificial systems fall behind. Radar and ultrasound complement camera-based vision but they are often too costly and complex to set up for very limited information gain. In nature, sound is used effectively by bats, dolphins, whales, and humans for navigation and communication. However, it is unclear how to best harness sound for machine perception. Inspired by bats' echolocation mechanism, we design a low-cost BatVision system that is capable of seeing the 3D spatial layout of space ahead by just listening with two ears. Our system emits short chirps from a speaker and records returning echoes through microphones in an artificial human pinnae pair. During training, we additionally use a stereo camera to capture color images for calculating scene depths. We train a model to predict depth maps and even grayscale images from the sound alone. During testing, our trained BatVision provides surprisingly good predictions of 2D visual scenes from two 1D audio signals. Such a sound to vision system would benefit robot navigation and machine vision, especially in low-light or no-light conditions. Our code and data are publicly available.
研究动机与目标
- 开发一种低成本、可移动的系统,通过双耳声音回波推断三维空间布局,受蝙蝠回声定位的启发。
- 训练深度神经网络,仅从原始音频信号预测视觉场景(深度图和灰度图像)。
- 实现在视觉传感器失效的低光照或无光环境下的机器感知。
- 证明仅通过两个简单麦克风搭配人工耳廓即可借助学习到的声学到视觉映射实现高质量的空间重建。
- 使系统可部署于嵌入式平台,适用于实际机器人应用。
提出的方法
- 系统使用扬声器发射短时频扫 chirp 信号,两个嵌入人工人耳廓的麦克风捕捉双耳回波。
- 训练期间,同步的立体摄像头数据提供真实深度图和灰度图像,用于监督学习。
- 神经网络架构结合音频编码器与基于 UNet 的生成器,将双耳波形或频谱图映射为视觉输出。
- 模型采用多尺度损失,结合 L1 正则化和局部感受野的 GAN 对抗训练,以提升感知质量。
- 音频编码器处理原始波形或频谱图,特征融合发生在早期、晚期或中间阶段。
- 最终目标函数结合对抗损失与 L1 重建损失:$\min_{G}\max_{D}\frac{1}{2}\mathcal{L}_{GAN}(D)+\mathcal{L}_{GAN}(G)+\lambda\mathcal{L}_{L_{1}}(G)$。
实验结果
研究问题
- RQ1机器学习系统能否仅从双耳声音信号中准确重建三维空间布局?
- RQ2在音频与立体视觉数据联合训练的神经网络,能否从声音中准确预测深度图与视觉场景?
- RQ3在低光照或复杂室内环境中,该系统相较于传统立体视觉的性能提升程度如何?
- RQ4在混响强烈或杂乱的空间中,基于声音的场景重建存在哪些局限性?
- RQ5仅通过简单的双麦克风配置搭配人工耳廓,能否实现与更复杂的生物声呐系统相当的性能?
主要发现
- 在 128×128 分辨率下,使用频谱图输入与早期特征融合的 UNet 生成器,BatVision 系统在深度图预测上的测试损失为 0.0773。
- 在 128×128 分辨率下,GAN 增强模型将深度图的 L1 损失降低至 0.0742,灰度图像的 L1 损失降低至 0.1841,显示出更优的细节与清晰度。
- 即使缺乏精细物体细节,模型仍能生成合理的地板布局与墙体位置,表明其有效捕捉了声音与场景结构之间的统计相关性。
- 在某些情况下,声学到深度的预测结果甚至优于真实立体视觉的深度图,尤其在纹理稀疏或视差估计困难的区域。
- 系统在近距离、多路径回波环境,以及混响强烈或家具密集的会议室等复杂空间中表现不佳。
- 对于近距离或结构复杂的物体,由于回波叠加与信号吸收,重建失败,如图 8 所示的失败案例所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。