[论文解读] A Survey on Artificial Intelligence for Music Generation: Agents, Domains and Perspectives
本综述通过分析涉及的各类主体——数据集、模型、接口、用户及生成的音乐——对人工智能驱动的音乐生成进行了全面分析,同时对比了人类与AI的作曲过程。研究识别出长期音乐建模、评估与偏见方面的主要挑战,并提出未来研究方向,包括多模态学习、高效的音乐编码方式,以及用于音乐创作的通用型AI框架。
Music is one of the Gardner's intelligences in his theory of multiple intelligences. How humans perceive and understand music is still being studied and is crucial to develop artificial intelligence models that imitate such processes. Music generation with Artificial Intelligence is an emerging field that is gaining much attention in the recent years. In this paper, we describe how humans compose music and how new AI systems could imitate such process by comparing past and recent advances in the field with music composition techniques. To understand how AI models and algorithms generate music and the potential applications that might appear in the future, we explore, analyze and describe the agents that take part of the music generation process: the datasets, models, interfaces, the users and the generated music. We mention possible applications that might benefit from this field and we also propose new trends and future research directions that could be explored in the future.
研究动机与目标
- 通过识别并分析涉及的关键主体——数据集、模型、接口、用户及生成的音乐——来评估当前人工智能音乐生成的现状。
- 对比人类与AI音乐创作过程,突出在创造力、感知力与结构理解方面的异同。
- 识别人工智能音乐生成中的主要研究空白,尤其关注长期序列建模、评估框架与偏见分析方面。
- 提出未来研究方向,包括通用型AI模型的开发、用户界面的改进,以及高效音乐编码方式的探索。
- 倡导将音乐分析与生成整合进统一的、多模态的AI系统中,以支持灵活、用户引导的协同创作。
提出的方法
- 系统性回顾与分析深度学习和符号AI在音乐生成中的最新进展,重点关注RNN、Transformer和GNN等架构。
- 考察结合音频与符号表示的多模态深度学习方法,以提升音乐理解与生成能力。
- 调查现有音乐生成领域的数据集、模型与接口,重点分析其局限性与偏见。
- 整合音乐信息检索(MIR)相关领域的见解,如自动和弦识别与音频乐器分类,以优化生成模型的条件控制与调控。
- 提出一种受GATO等模型启发的通用型音乐AI框架,将符号规则与深度学习相结合,以实现更接近人类的作曲表现。
- 评估当前用于评估音乐质量的指标与方法,涵盖客观与主观评估方式,并识别可复现性方面的挑战。
实验结果
研究问题
- RQ1在结构、创造力与感知方面,人类音乐创作过程与基于AI的音乐生成过程有何异同?
- RQ2AI音乐生成流程中的关键主体有哪些?它们的偏见如何影响最终输出?
- RQ3为何音乐序列的长期建模仍具挑战?哪些架构或编码改进可解决该问题?
- RQ4如何通过改进用户界面与人机交互来增强AI协同创作音乐的能力?
- RQ5构建能够同时分析与生成音乐的通用型、多模态AI系统,未来最具前景的研究方向是什么?
主要发现
- 当前AI模型在生成高质量音乐动机方面仍存在困难,而音乐动机是构建更长、更连贯作品的基础,表明短序列生成方面存在关键缺口。
- 长期音乐建模仍是开放性挑战,原因在于音高与时间的双重依赖性,需更复杂的架构与编码方式。
- 缺乏标准化且可泛化的AI生成音乐评估框架,现有指标常无法捕捉音乐质量或连贯性。
- 现有数据集与模型存在显著偏见,尤其偏向西方与流行音乐类型,限制了AI音乐系统的多样性与泛化能力。
- 将符号AI规则(如和弦进行、声部进行)与深度学习模型结合,有望提升结构连贯性与音乐性。
- 未来的AI音乐系统应朝向多模态、通用型架构发展,统一音乐分析与生成能力,实现灵活、用户条件化与协同创作的音乐生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。