[论文解读] The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation
歌曲描述数据集(SDD)是一个众包语料库,包含706首公开许可音乐作品的1,106条高质量、自然语言描述,每首音乐时长两分钟,专为标准化评估音乐与语言模型而设计。该数据集支持音乐字幕生成、文本到音乐生成以及音乐-语言检索任务的跨数据集基准测试,凸显了域外评估的重要性,并减少了对私有或合成数据的依赖。
We introduce the Song Describer dataset (SDD), a new crowdsourced corpus of high-quality audio-caption pairs, designed for the evaluation of music-and-language models. The dataset consists of 1.1k human-written natural language descriptions of 706 music recordings, all publicly accessible and released under Creative Common licenses. To showcase the use of our dataset, we benchmark popular models on three key music-and-language tasks (music captioning, text-to-music generation and music-language retrieval). Our experiments highlight the importance of cross-dataset evaluation and offer insights into how researchers can use SDD to gain a broader understanding of model performance.
研究动机与目标
- 解决当前缺乏公开可访问、高质量的音频-字幕数据集以评估音乐与语言模型的问题。
- 减少对私有或合成数据的依赖,以避免在模型评估中引入偏差和数据泄露。
- 通过提供多样化、代表性强且持久存在的真实世界音乐与语言配对数据集,实现标准化的跨数据集评估。
- 通过域外评估支持开发更稳健、泛化能力更强的音乐与语言模型。
- 为未来的数据贡献和数据集扩展提供可持续、社区驱动的平台。
提出的方法
- 通过开源在线标注平台收集数据,目标对象为来自不同地理和语言背景的非专业志愿者。
- 参与者聆听来自MTG-Jamendo数据集的两分钟音乐作品,并撰写聚焦于音乐内容的单句自然语言描述,包括乐器、流派、情绪和风格等要素。
- 所有音频文件均以知识共享许可公开发布,并持久托管,确保数据可用性,降低数据漂移或丢失的风险。
- 数据集包含25%的音乐作品具有多个描述,支持使用BLEU、METEOR和CIDEr等自动字幕评估指标进行评估。
- 数据集以CC BY-SA 4.0许可发布,音频文件保留其原始许可,并托管于Zenodo,提供DOI以确保持久访问。
- 提供公开的网页界面以支持未来数据贡献,未来版本将经过验证,并可能整合到更新的发布版本中。
实验结果
研究问题
- RQ1当使用域外数据时,音乐与语言任务的模型性能在不同评估数据集之间如何变化?
- RQ2与私有或合成基准相比,歌曲描述数据集在多大程度上能提升音乐与语言模型评估的可靠性与泛化能力?
- RQ3当应用于具有每首音乐多个人工标注描述的多样化真实世界数据集时,自动字幕评估指标表现如何?
- RQ4数据持久性与许可方式对音乐与语言评估数据集的可重现性与长期可用性有何影响?
- RQ5社区驱动的众包数据收集能否生成高质量、具代表性的音频-字幕配对,以支持严格的模型评估?
主要发现
- 歌曲描述数据集包含706首音乐作品的1,106条人工撰写的描述,其中95%的音乐作品时长为两分钟,音频片段显著长于先前的数据集(如MusicCaps和YT8M-MusicTextClips)。
- 该数据集以CC BY-SA 4.0许可公开发布,所有音频文件也均以开放许可发布,并托管于Zenodo,确保长期数据持久性与可访问性。
- 25%的音乐作品包含来自不同标注者的多个描述,支持使用BLEU、METEOR和CIDEr等标准自动字幕评估指标进行稳健评估。
- 该数据集降低了以往依赖AudioSet或基于YouTube音频的基准中常见的数据泄露风险,因为SDD使用来自MTG-Jamendo数据集的音乐,且其许可证经验证为公开开放。
- 作者证明,使用SDD进行跨数据集评估可带来更可靠、更具泛化能力的模型性能评估,减少对特定训练数据分布的过拟合。
- 未来可通过公开网页界面支持数据贡献,未来版本将通过GitHub和Zenodo实现版本化更新,具备清晰的社区扩展路径。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。