Skip to main content
QUICK REVIEW

[论文解读] Generating Music with a Self-Correcting Non-Chronological Autoregressive Model

Wayne Chi, Prachi Kumar|arXiv (Cornell University)|Aug 18, 2020
Music and Audio Processing参考文献 28被引用 5
一句话总结

本文提出ES-Net,一种自纠正、非时序的自回归模型,通过建模音符添加与删除的序列而非固定顺序的序列来生成音乐。通过允许模型通过删除来纠正过去错误,该方法减少了错误累积,并实现了细粒度、交互式的音乐创作,在定量指标和人类评估中均优于无序NADE和Gibbs采样。

ABSTRACT

We describe a novel approach for generating music using a self-correcting, non-chronological, autoregressive model. We represent music as a sequence of edit events, each of which denotes either the addition or removal of a note---even a note previously generated by the model. During inference, we generate one edit event at a time using direct ancestral sampling. Our approach allows the model to fix previous mistakes such as incorrectly sampled notes and prevent accumulation of errors which autoregressive models are prone to have. Another benefit is a finer, note-by-note control during human and AI collaborative composition. We show through quantitative metrics and human survey evaluation that our approach generates better results than orderless NADE and Gibbs sampling approaches.

研究动机与目标

  • 通过允许模型通过删除音符实现自纠正,解决自回归音乐生成中的错误累积问题。
  • 通过实现非时序、交互式的音乐创作,实现人类与AI协作的细粒度、逐音符控制。
  • 通过建模编辑序列(添加/删除事件)而非直接生成钢琴卷帘,提升音乐生成质量。
  • 证明具有删除能力的直接祖先采样优于Gibbs采样和无序NADE,在音乐质量和用户偏好方面表现更优。
  • 将模型的应用范围扩展至旋律延伸以及速度、时值等表现性特征。

提出的方法

  • 将音乐表示为单热编码的编辑事件序列(添加或删除单个音符),而非固定的钢琴卷帘。
  • 使用二维卷积神经网络建模给定当前钢琴卷帘状态时每个编辑事件的条件概率。
  • 采用直接祖先采样生成编辑序列,使模型能够以任意顺序迭代地添加或删除音符。
  • 在每次编辑后重新输入更新后的钢琴卷帘,以条件化下一次预测,从而实现随时间推移的错误纠正。
  • 通过数据增强在训练过程中掩码并添加错误音符,以模拟并学习错误。
  • 通过累积更新函数将编辑序列映射回钢琴卷帘,按顺序应用所有编辑。

实验结果

研究问题

  • RQ1支持音符删除的非时序自回归模型是否能减少音乐生成中的错误累积?
  • RQ2具有编辑序列的直接祖先采样是否在音乐质量和用户偏好方面优于Gibbs采样和无序NADE?
  • RQ3删除音符的能力在多大程度上提升了生成音乐的表现力和正确性?
  • RQ4该模型如何支持人类与AI在音乐创作中进行交互式、逐音符协作?
  • RQ5该模型是否能超越巴赫众赞歌的范围,并可扩展以支持速度、时值等表现性特征?

主要发现

  • 所提出的编辑序列方法在人类评估中显著优于无序NADE和Gibbs采样,音乐质量评分差异具有统计学意义(p < 0.001)。
  • 人类参与者认为该模型生成的样本相较于基线模型在输入旋律基础上有更显著的改进,偏好度具有统计学意义(p < 0.001)。
  • 在用户排名中,该模型生成的音乐与巴赫风格作品的相似度更高,表明其风格匹配性更优。
  • Kruskal-Wallis H检验确认了所有三类模型在音乐质量评分上存在显著差异(χ² = 73.07,p < 0.001)。
  • Wilcoxon符号秩检验表明,该方法在所有评估维度上均显著优于两个基线模型(p < 0.001)。
  • 模型删除音符的能力在纠正采样错误和提升最终输出质量方面起到了关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。