Skip to main content
QUICK REVIEW

[论文解读] Deep Predictive Models in Interactive Music

Charles Martín, Kai Olav Ellefsen|arXiv (Cornell University)|Jan 31, 2018
Music Technology and Sound Studies参考文献 13被引用 3
一句话总结

本文研究了数字乐器(DMIs)中的深度预测模型如何扩展人类在音乐表演中的认知预测能力,实现音乐的实时延续、自适应控制以及合奏互动。通过将映射与建模视为预测任务,作者证明了循环神经网络(RNNs)及其他机器学习模型能够增强具有长期记忆和智能响应能力的表现性交互音乐系统。

ABSTRACT

Musical performance requires prediction to operate instruments, to perform in groups and to improvise. In this paper, we investigate how a number of digital musical instruments (DMIs), including two of our own, have applied predictive machine learning models that assist users by predicting unknown states of musical processes. We characterise these predictions as focussed within a musical instrument, at the level of individual performers, and between members of an ensemble. These models can connect to existing frameworks for DMI design and have parallels in the cognitive predictions of human musicians. We discuss how recent advances in deep learning highlight the role of prediction in DMIs, by allowing data-driven predictive models with a long memory of past states. The systems we review are used to motivate musical use-cases where prediction is a necessary component, and to highlight a number of challenges for DMI designers seeking to apply deep predictive models in interactive music systems of the future.

研究动机与目标

  • 研究预测性机器学习模型如何在数字乐器(DMIs)中支持音乐表演。
  • 识别并分类DMIs中用于乐器、表演者及合奏层级的预测模型。
  • 将交互音乐中的映射与建模重新定义为预测形式,将其与音乐家的认知过程相联系。
  • 突出在未来的DMIs设计中整合深度学习所面临的挑战与机遇。
  • 倡导将预测作为统一框架应用于交互音乐系统,特别是在从传感器输入到声音输出的端到端学习中。

提出的方法

  • 按预测层级对现有DMI系统进行分类:乐器层级(如手势到声音的映射)、表演者层级(如音乐乐句的延续)以及合奏层级(如群体互动的预测)。
  • 回顾文献中的18个DMI系统及两个内部开发的系统(GloveTalk II, PiaF),分析其机器学习模型、输入与输出。
  • 使用循环神经网络(RNNs)、支持向量机(SVMs)、隐马尔可夫模型(HMMs)及其他模型来建模音乐序列,并将传感器数据映射到声音参数。
  • 将音乐映射(控制到声音)与建模(音乐过程的表示)视为既独立又相关的预测形式。
  • 分析模型如何通过长期记忆与上下文感知处理来处理节奏、和声与旋律等时间结构。
  • 提出深度学习模型,特别是RNNs,可实现端到端的预测系统,使传感器数据直接驱动表现性且自适应的声音生成。

实验结果

研究问题

  • RQ1DMIs中的深度预测模型如何支持并扩展音乐表演中的认知预测?
  • RQ2交互音乐中的映射与建模在何种方式下可被重新诠释为预测任务?
  • RQ3在设计采用预测模型以实现实时、表现性音乐互动的DMIs时,面临的关键挑战是什么?
  • RQ4不同机器学习模型(如RNNs、HMMs、SVMs)如何在乐器、表演者与合奏层级支持预测?
  • RQ5为将预测智能整合到未来的交互音乐系统中,需要哪些设计原则与框架?

主要发现

  • DMIs中的预测模型,尤其是RNNs,能够实现对音乐状态的长期记忆,从而支持上下文感知的音乐延续与自适应。
  • AI Duet与RoboJam等系统利用RNNs实现实时音乐乐句延续,展示了在符号音乐输入下有效的表演者层级预测。
  • MalLo(预测打击乐击打)与Neural Touchscreen Ensemble(预测手势类别)等模型证明了在协作即兴演奏中实现合奏层级预测的可行性。
  • BRAAHMS中使用fNIRS与BCI表明,脑信号可作为预测和声伴奏的输入,拓展了传感器模态的范围。
  • 尽管潜力巨大,RNNs等深度学习模型在DMIs中尚未得到广泛应用,表明实际应用中仍存在差距。
  • 预测模型的整合增强了音乐的表现力,并在现场表演与即兴创作场景中开启了新的创作可能性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。