[论文解读] Beat Transformer: Demixed Beat and Downbeat Tracking with Dilated Self-Attention
Beat Transformer 提出了一种新型的 Transformer 编码器,结合扩张自注意力机制与乐器特异性注意力机制,利用分离的音频源实现联合节拍与强拍追踪。该模型在基于 TCN 的模型上实现了高达 4% 的强拍追踪准确率绝对提升,并学习到可解释的、分层的注意力模式,与音乐的节拍结构相吻合。
We propose Beat Transformer, a novel Transformer encoder architecture for joint beat and downbeat tracking. Different from previous models that track beats solely based on the spectrogram of an audio mixture, our model deals with demixed spectrograms with multiple instrument channels. This is inspired by the fact that humans perceive metrical structures from richer musical contexts, such as chord progression and instrumentation. To this end, we develop a Transformer model with both time-wise attention and instrument-wise attention to capture deep-buried metrical cues. Moreover, our model adopts a novel dilated self-attention mechanism, which achieves powerful hierarchical modelling with only linear complexity. Experiments demonstrate a significant improvement in demixed beat tracking over the non-demixed version. Also, Beat Transformer achieves up to 4% point improvement in downbeat tracking accuracy over the TCN architectures. We further discover an interpretable attention pattern that mirrors our understanding of hierarchical metrical structures.
研究动机与目标
- 解决现有节拍追踪模型仅依赖混合音频谱图所带来的局限,避免遗漏丰富的乐器与和声线索。
- 通过引入分离的音频源(如:鼓、贝斯、钢琴)提升节拍结构推理能力,以建模乐器间的协调与和声进行。
- 设计一种具备分层建模能力的 Transformer 架构,同时保持线性复杂度,克服标准自注意力机制的二次方复杂度问题。
- 实现可解释的注意力模式,反映节拍与强拍的相位转换等分层音乐结构。
- 在多个基准数据集上实现节拍与强拍追踪的最先进性能,尤其在强拍准确率方面表现突出。
提出的方法
- 使用 Spleeter 将输入音乐分解为多个乐器通道(如:鼓、贝斯、钢琴、人声),以获得分离的谱图输入。
- 设计双注意力机制:在每个通道内使用时间特异性自注意力,跨通道使用乐器特异性自注意力,以建模跨乐器间的协调。
- 引入扩张自注意力(DSA),采用指数增长的扩张率,以线性复杂度捕捉分层节拍结构。
- 将 Transformer 编码器设计为交替堆叠时间特异性与乐器特异性注意力层,以同时建模时间依赖与乐器依赖。
- 将注意力矩阵形式化为多步马尔可夫转移矩阵,以解释模型在节拍与强拍相位上的分层推理过程。
- 采用端到端训练方式,联合进行节拍、强拍与节拍速度估计,采用多任务学习设置,并利用动态贝叶斯网络进行相位精炼。
实验结果
研究问题
- RQ1与使用混合音频谱图相比,分离音频源是否能提升节拍与强拍追踪性能?
- RQ2在 Transformer 架构中,扩张自注意力是否能以线性计算复杂度实现对节拍结构的有效分层建模?
- RQ3所提出模型的注意力机制是否可解释为有限状态马尔可夫链,反映已知的音乐相位转换?
- RQ4在多种数据集上,该模型在节拍与强拍追踪方面的性能与最先进 TCN 及基于 Transformer 的模型相比如何?
- RQ5乐器特异性注意力在多大程度上捕捉了与时间能量包络正交的和声与节奏线索?
主要发现
- 在未见过的 GTZAN 数据集上,Beat Transformer 在强拍 F1 值上相比 Böck 等人 [13] 的基于 TCN 的模型提升了 4 个百分点。
- 与非分离版本相比,该模型性能显著更优,尤其在强拍追踪方面,证明了乐器上下文的价值。
- 在无数据增强的情况下(Ours w/o Aug.),仅使用 10.25M 参数即达到具有竞争力的性能,表明其具有强大的数据效率。
- 扩张自注意力机制在保持高性能的同时实现了线性复杂度,使模型即使在 24GB GPU 上也保持高效。
- 注意力矩阵的可视化显示,模型在节拍位置附近学会从弱拍向强拍阶段转移注意力,与人类感知时间一致。
- 模型学习到与节拍与强拍位置对齐的可解释分层注意力模式,证实其能够以音乐上有意义的方式建模节拍结构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。