[论文解读] Visual to Sound: Generating Natural Sound for Videos in the Wild
本文提出一种基于学习的方法,可在非受控的真实世界环境中,从视频帧生成自然且时间同步的音频波形。通过使用视频编码器和基于分层RNN的声音生成器,该模型实现了人类可信的结果,在用户研究中超过70%的生成声音被感知为真实,展示了从视觉输入生成音频时强大的泛化能力和真实感。
As two of the five traditional human senses (sight, hearing, taste, smell, and touch), vision and sound are basic sources through which humans understand the world. Often correlated during natural events, these two modalities combine to jointly affect human perception. In this paper, we pose the task of generating sound given visual input. Such capabilities could help enable applications in virtual reality (generating sound for virtual scenes automatically) or provide additional accessibility to images or videos for people with visual impairments. As a first step in this direction, we apply learning-based methods to generate raw waveform samples given input video frames. We evaluate our models on a dataset of videos containing a variety of sounds (such as ambient sounds and sounds from people/animals). Our experiments show that the generated sounds are fairly realistic and have good temporal synchronization with the visual inputs.
研究动机与目标
- 开发一种从非受控真实世界环境中视频帧生成自然原始音频波形的方法。
- 解决在包含环境噪声及人类/动物互动等多样化真实声音的视频中学习视觉-音频关联的挑战。
- 构建一个高质量、经清理的包含28,109个视频(55小时)的视频数据集,涵盖10种声音类别,以支持训练与评估。
- 通过定量指标和人类感知研究,评估生成音频的真实感与时间同步性。
- 探索并比较多种视觉编码架构(帧级、序列、光流)以实现最优的音频生成性能。
提出的方法
- 该模型使用视频编码器,随后通过分层循环神经网络(RNN)逐步生成原始音频波形样本。
- 探索了三种视觉编码变体:帧级编码、使用RNN对帧进行序列编码,以及基于光流的编码以捕捉运动动态。
- 音频生成网络基于SampleRNN,一种专为原始音频信号自回归生成而设计的分层RNN架构。
- 通过清理AudioSet的一个子集构建自定义数据集,确保视频与音频内容在2秒时间间隔内时间对齐且相关。
- 训练过程采用端到端学习,将视觉输入映射为原始音频,损失函数针对波形保真度和时间对齐进行优化。
- 评估包括数值指标和人类研究,参与者判断视频-音频配对是否为真实或生成。
实验结果
研究问题
- RQ1深度学习模型能否在非受控真实世界环境中,从原始视频帧生成逼真且时间同步的音频?
- RQ2不同的视觉编码策略(帧级、序列、光流)如何影响生成音频的质量与真实感?
- RQ3与真实音频或随机音频基线相比,生成音频在多大程度上能欺骗人类听者,使其误认为是真实的?
- RQ4该模型在多种声音类别上的泛化能力如何?多类别生成存在哪些局限性?
- RQ5与先前的视觉到音频生成工作相比,该模型在音频质量与同步性方面表现如何?
主要发现
- 所提出的模型在人类评估中对生成音频与真实音频的区分准确率达到73.36%,平均有73.36%的生成配对被判断为真实。
- 基于光流的视觉编码器优于帧级和序列方法,在水流声音上达到81.25%的真实感评分,在直升机声音上达到78.13%。
- 在狗叫和鼓声类别中,模型分别获得64.32%和70.83%的真实感评分,显著优于基线(54.69%和59.64%)以及文献[15]中的上限方法(40.16%和43.75%)。
- 多类别模型的人类感知准确率为46.29%,表明其在类别间具有泛化能力,尽管仍低于最佳单类别模型(73.63%)。
- 在Greatest Hits数据集上,模型表现具有竞争力,41.50%的生成声音被人类更偏好于真实音频,与[15]的40.01%结果相当。
- 真实音频基线平均被正确识别91.43%的时间,证实了任务的难度以及人类感知的稳健性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。