Skip to main content
QUICK REVIEW

[论文解读] NONOTO: A Model-agnostic Web Interface for Interactive Music Composition by Inpainting

Théis Bazin, Gaëtan Hadjeres|arXiv (Cornell University)|Jul 23, 2019
Music and Audio Processing参考文献 9被引用 9
一句话总结

NONOTO 是一种与模型无关的基于网络的交互式音乐创作界面,采用基于修复(inpainting)的生成模型,支持实时乐谱编辑、音频播放、MIDI 输出以及通过 Ableton Link 与 DAW 同步。研究人员可轻松接入自研模型,音乐人可实时协作创作音乐,显著提升人工智能辅助音乐制作中的创造力与可及性。

ABSTRACT

Inpainting-based generative modeling allows for stimulating human-machine interactions by letting users perform stylistically coherent local editions to an object using a statistical model. We present NONOTO, a new interface for interactive music generation based on inpainting models. It is aimed both at researchers, by offering a simple and flexible API allowing them to connect their own models with the interface, and at musicians by providing industry-standard features such as audio playback, real-time MIDI output and straightforward synchronization with DAWs using Ableton Link.

研究动机与目标

  • 通过支持交互式、人机协同的音乐创作,弥合人工智能音乐生成与现实音乐创作之间的鸿沟。
  • 为研究人员提供一个灵活、开源的框架,用于在实际音乐制作环境中测试和部署其音乐生成模型。
  • 赋能音乐人与非专业人士通过直观的实时符号乐谱编辑功能,与 AI 共同创作音乐。
  • 通过与 Ableton Live 等专业工具集成,支持 MIDI 输出与 Ableton Link 同步,推动现场演出与协作音乐制作。
  • 通过提供可访问、可修改的界面,推动从“机器人音乐”向人工智能辅助、协作式音乐创作的转变。

提出的方法

  • 界面使用 OpenSheetMusicDisplay 渲染 MusicXML 乐谱,通过矢量图形实现符号音乐的高保真视觉呈现。
  • Tone.js 提供实时音频播放,使用户在编辑过程中可即时听到生成的音乐,无中断体验。
  • 基于网络的客户端通过 HTTP 与远程音乐修复服务器通信,使用两个核心命令:/generate 用于初始化,/timerange-change 用于区域特定的重新生成。
  • 通过将前端与后端解耦,实现与模型无关的集成,研究人员可经由标准化 API 轻松接入任意修复模型。
  • 通过 Tone.js 实现实时音频渲染或使用 WebMidi.js 输出 MIDI,实现虚拟端口路由,并借助 Ableton Link 与 Ableton Live 同步。
  • 除乐谱外,还传递如和弦进行或延音标记等元数据,以指导上下文感知的生成,适配特定训练语料库。

实验结果

研究问题

  • RQ1基于网络的界面如何实现使用 AI 修复模型的实时交互式音乐创作?
  • RQ2与模型无关的框架在支持多样化音乐生成模型的同时,其集成开销在多大程度上保持较低?
  • RQ3实时音频播放与 MIDI 输出在多大程度上能提升音乐人与研究人员的创作工作流?
  • RQ4与 DAW 及 Ableton Link 等同步协议的集成如何支持现场演出与协作音乐制作?
  • RQ5与完整序列生成相比,基于修复的生成方式在多大程度上能促进更具协作性的人机作曲体验?

主要发现

  • NONOTO 在乐谱重新生成过程中支持实时不间断音频播放,确保响应迅速且沉浸感强的用户体验。
  • 界面成功通过 MIDI 与 Ableton Link 与专业 DAW 集成,实现无缝同步,适用于现场演出场景。
  • 与模型无关的架构使研究人员可极低开销地接入自研修复模型,显著提升部署与评估效率。
  • 对和弦进行、延音位置等元数据的支持,使生成过程具备上下文感知能力,生成结果更符合特定音乐语料库的风格。
  • 系统表明,基于修复的模型相比续写或全序列生成模型,更能支持更具交互性与协作性的作曲工作流。
  • 该框架开源且可修改,鼓励社区贡献,推动面向新型交互范式与音乐生成任务的适配与创新。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。