Skip to main content
QUICK REVIEW

[论文解读] Reconstructing Human Expressiveness in Piano Performances with a Transformer Network

Jingjing Tang, Geraínt A. Wiggins|arXiv (Cornell University)|Jun 9, 2023
Music and Audio Processing被引用 4
一句话总结

该论文提出一种多层双向Transformer编码器,通过使用转录乐谱而非标准乐谱来重建钢琴演奏中的人类表现力。通过利用大规模转录演奏数据集并整合演奏者身份嵌入,该模型生成高度逼真、类人化的演奏,其在听觉测试中优于当前最先进系统,尤其在力度控制和长程表现力方面表现突出,尽管在完全一致地再现人类表现力方面仍具挑战。

ABSTRACT

Capturing intricate and subtle variations in human expressiveness in music performance using computational approaches is challenging. In this paper, we propose a novel approach for reconstructing human expressiveness in piano performance with a multi-layer bi-directional Transformer encoder. To address the needs for large amounts of accurately captured and score-aligned performance data in training neural networks, we use transcribed scores obtained from an existing transcription model to train our model. We integrate pianist identities to control the sampling process and explore the ability of our system to model variations in expressiveness for different pianists. The system is evaluated through statistical analysis of generated expressive performances and a listening test. Overall, the results suggest that our method achieves state-of-the-art in generating human-like piano performances from transcribed scores, while fully and consistently reconstructing human expressiveness poses further challenges.

研究动机与目标

  • 解决在不依赖标准乐谱的前提下生成类人化表现力钢琴演奏的挑战。
  • 通过利用近期转录模型提供的转录乐谱和演奏对齐信息,改进表现力演奏还原(EPR)性能。
  • 通过在生成过程中整合演奏者身份嵌入,建模个体演奏者的表现力特征。
  • 通过统计分析和与最先进系统的听觉测试,评估模型性能。
  • 探究转录乐谱是否可作为EPR的可行且富有表现力的输入,特别是对于具有即兴或未标注装饰音的乐曲。

提出的方法

  • 在 ATEPP 数据集的成对转录乐谱与对应的表现力演奏上训练多层双向Transformer编码器。
  • 模型以转录乐谱作为输入,利用位置编码和自注意力机制生成表现力的时间与力度变化。
  • 演奏者身份作为条件控制信号嵌入,以影响采样过程,实现对不同演奏者风格的建模。
  • 通过结合重建损失与对抗性训练对模型进行微调,以增强表现力与真实感。
  • 特征提取包括从乐谱中提取归一化的力度与时值偏差,并应用平滑与标准化处理以保证一致性。
  • 通过定量分析表现特征与听觉测试(将生成输出与标准乐谱、转录乐谱及人类演奏进行比较)对系统进行评估。

实验结果

研究问题

  • RQ1当在转录乐谱而非标准乐谱上进行训练时,基于Transformer的模型能否有效重建钢琴演奏中的人类表现力?
  • RQ2通过基于演奏者身份的条件控制,该模型在多大程度上能够捕捉并再现个体演奏者的表现风格?
  • RQ3在感知表现力与动态变化方面,该模型的性能与最先进EPR系统相比如何?
  • RQ4与直接渲染标准乐谱相比,从转录乐谱生成是否能产生更具表现力的结果?
  • RQ5该模型在重建长程表现结构及复杂技巧(如踏板使用)方面存在哪些局限性?

主要发现

  • 在听觉测试中,所提模型显著优于VirtuosoNet,整体偏好度的p值为0.01 < p < 0.05,表明听众偏好具有统计学显著性。
  • 由转录乐谱生成的演奏(G-TS)评分显著高于直接从转录乐谱渲染的音频(TS),多数曲目的p值 < 0.05,表明成功实现了表现力的重建。
  • 该模型在捕捉长期动态与力度变化方面表现更优,优于VirtuosoNet与标准乐谱渲染,尤其在复杂段落中表现突出。
  • 生成的演奏在感知上比任何基线模型更接近人类演奏,尽管尚未能持续达到人类演奏者的表现力水平。
  • 转录乐谱(TS)的表现力高于标准乐谱(S),而模型输出(G-TS)进一步提升了表现力,表明有效重建了细微的表现力细节。
  • 该模型展现出强大的泛化能力,即使在未见过的标准乐谱上也能生成富有表现力的演奏,且G-S在力度变化建模方面优于V。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。