[论文解读] Foley Music: Learning to Generate Music from Videos
该论文提出Foley Music系统,通过建模人体关键点和MIDI事件作为中间表征,从无声的音乐家表演视频中生成富有表现力且同步的音乐。该模型采用图注意力网络框架,将人体动作映射为乐谱符号,其在听觉评估中优于基线模型,并通过可解释的MIDI输出实现灵活的音乐编辑。
In this paper, we introduce Foley Music, a system that can synthesize plausible music for a silent video clip about people playing musical instruments. We first identify two key intermediate representations for a successful video to music generator: body keypoints from videos and MIDI events from audio recordings. We then formulate music generation from videos as a motion-to-MIDI translation problem. We present a Graph$-$Transformer framework that can accurately predict MIDI event sequences in accordance with the body movements. The MIDI event can then be converted to realistic music using an off-the-shelf music synthesizer tool. We demonstrate the effectiveness of our models on videos containing a variety of music performances. Experimental results show that our model outperforms several existing systems in generating music that is pleasant to listen to. More importantly, the MIDI representations are fully interpretable and transparent, thus enabling us to perform music editing flexibly. We encourage the readers to watch the demo video with audio turned on to experience the results.
研究动机与目标
- 开发一种系统,能够从无声的音乐表演视频中生成合理且同步的音乐。
- 通过识别关键中间表征——人体关键点和MIDI事件,解决从视觉动作映射到富有表现力音频的挑战。
- 通过使用完全可解释的MIDI表征而非原始波形,实现灵活的音乐编辑。
- 证明通过图注意力网络模型实现的动作到MIDI的转换,能够生成质量更高、更自然的音乐,优于先前方法。
提出的方法
- 利用姿态估计从视频帧中检测2D人体和手部关键点,以时间序列形式表征人体动作。
- 将音乐生成问题形式化为动作到MIDI的转换任务,使用MIDI作为符号化、可解释的音频表征,编码音符触发/关闭、音高和力度信息。
- 使用图卷积网络(GCN)编码器处理关键点坐标的时间序列,以学习时空特征。
- 使用带有自注意力机制的Transformer解码器捕捉音乐生成过程中的长程依赖关系,预测MIDI事件序列。
- 将预测的MIDI序列通过标准合成器转换为真实音频,用于评估和播放。
- 模型在九种乐器的大规模音乐表演视频数据集上进行训练,包括钢琴、小提琴和手风琴。
实验结果
研究问题
- RQ1基于仅来自无声视频的视觉动作线索,视频到音乐生成系统能否准确预测富有表现力的音乐?
- RQ2将人体关键点和MIDI作为中间表征,是否比使用原始视觉或音频特征在跨模态音乐生成中更具有效性?
- RQ3MIDI的符号化特性是否能够实现基于波形模型难以实现的灵活、可解释的音乐编辑?
- RQ4图注意力网络架构是否在从动作序列捕捉长期音乐依赖关系方面优于循环或卷积模型?
主要发现
- 所提出的图注意力网络模型在听觉评估中显著优于强基线模型,其在准确性、同步性和整体偏好度方面得分更高。
- 在MIDI预测任务中,该模型在小提琴上的负对数似然(NLL)损失为1.558,在长笛上为1.995,优于RGB图像和光流基线模型。
- 消融实验证实,基于关键点的视觉表征在MIDI预测精度方面优于RGB或光流特征。
- 使用Transformer解码器相比GRU模型进一步降低了NLL损失,证明其在建模长程音乐依赖关系方面的优越性。
- 该系统生成的音乐NDB(20)低于所有基线模型,表明其具有更高的多样性与更好的泛化能力。
- MIDI表征支持直接编辑音乐的调性和风格,展示了在可控音乐生成中前所未有的灵活性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。