Skip to main content
QUICK REVIEW

[论文解读] Artificial Musical Intelligence: A Survey

Elad Liebman, Peter Stone|arXiv (Cornell University)|Jun 17, 2020
Music and Audio Processing参考文献 278被引用 6
一句话总结

本综述将人工音乐智能(AMI)定义为一个整合音乐感知、认知与生成的多维领域,提出了一套音乐智能组件的分类体系,并倡导开发统一的、端到端的AI系统,实现实时感知、推理与音乐创作。文章强调需要大规模标注的音频基准数据集以及以人类为中心的评估方法,以推动AI在具有文化意义的音乐交互中的发展。

ABSTRACT

Computers have been used to analyze and create music since they were first introduced in the 1950s and 1960s. Beginning in the late 1990s, the rise of the Internet and large scale platforms for music recommendation and retrieval have made music an increasingly prevalent domain of machine learning and artificial intelligence research. While still nascent, several different approaches have been employed to tackle what may broadly be referred to as "musical intelligence." This article provides a definition of musical intelligence, introduces a taxonomy of its constituent components, and surveys the wide range of AI methods that can be, and have been, brought to bear in its pursuit, with a particular emphasis on machine learning methods.

研究动机与目标

  • 为人工智能领域中的“音乐智能”概念进行定义与形式化,解决其复杂性与多维性问题。
  • 建立支撑音乐智能的组件的全面分类体系,包括感知、抽象、建模与生成等。
  • 综述现有AI与机器学习方法在音乐分析与创作中的应用,突出其在整合与可扩展性方面的不足。
  • 倡导开发大规模、丰富标注的音频基准数据集,作为研究进展的基础,类似于计算机视觉中的ImageNet。
  • 推动开发可交互的、实时的AI音乐系统,实现与人类音乐家在闭环协作中感知、推理与响应。

提出的方法

  • 提出音乐智能组件的结构化分类体系,包括节拍、音高、音色、和弦、音程、响度、速度与播放列表等作为基础构建模块。
  • 回顾历史与当代AI在音乐领域的应用方法,包括基于规则的作曲、马尔可夫链、随机建模、基于语法的系统以及进化算法。
  • 考察现代机器学习在音乐信息检索(MIR)中的应用,如流派分类、和声分析、旋律分段与演奏建模。
  • 引入端到端AI系统的概念,整合感知、推理与实时音乐生成,应用于人机协同的音乐创作场景。
  • 提出一种双重视角评估框架,结合专家小组与众包方式,以超越主观印象的方式评估AI生成的音乐。
  • 倡导将认知科学与音乐认知的研究成果融入AI设计,确保系统与人类感知及情感反应保持一致。

实验结果

研究问题

  • RQ1在人工智能中,‘音乐智能’的构成要素是什么?如何对其进行正式定义,并分解为可度量的组件?
  • RQ2现有AI与机器学习方法应如何系统性地分类并应用于音乐分析与生成?
  • RQ3构建能够与人类音乐家实现实时协作音乐创作的端到端AI系统面临哪些关键挑战?
  • RQ4如何开发大规模、丰富标注的音频数据集,使其可作为音乐AI研究的共享基准,类似于ImageNet?
  • RQ5需要哪些评估标准与框架,才能在艺术性、感知性与认知性维度上客观比较AI生成的音乐?

主要发现

  • 音乐智能是一个多维结构,整合了感知、认知与创造性生成,要求在多个AI子领域之间实现整合。
  • 尽管在音乐信息检索与算法作曲方面已取得显著进展,但大多数系统仍功能孤立,缺乏端到端的连贯性。
  • 缺乏大规模、音频级别且具有复杂标注的基准数据集——类似于ImageNet——仍是推进音乐AI发展的主要瓶颈。
  • 当前对AI生成音乐的评估严重依赖主观或集体印象,亟需更严谨、经专家验证且多模态的评估协议。
  • 将音乐AI与认知科学相融合,可实现更符合人类偏好的系统,并深化对人工与人类音乐认知的理解。
  • 实时、协作式音乐生成系统代表了一个统一的挑战,有望推动AI在感知、建模、预测与决策等领域的创新。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。