[论文解读] Love Me, Love Me, Say (and Write!) that You Love Me: Enriching the WASABI Song Corpus with Lyrics Annotations
本文介绍了WASABI歌曲语料库,这是一个大规模、多语言的语料库,包含173万首歌曲歌词,并通过自动化技术标注了结构、情感、内容露骨程度、主题以及关键段落。利用自然语言处理与音频分析技术,作者从歌词中提取语义与情感特征,支持智能音乐发现、推荐与分析,同时持续改进模型,并公开发布数据与工具。
We present the WASABI Song Corpus, a large corpus of songs enriched with metadata extracted from music databases on the Web, and resulting from the processing of song lyrics and from audio analysis. More specifically, given that lyrics encode an important part of the semantics of a song, we focus here on the description of the methods we proposed to extract relevant information from the lyrics, such as their structure segmentation, their topics, the explicitness of the lyrics content, the salient passages of a song and the emotions conveyed. The creation of the resource is still ongoing: so far, the corpus contains 1.73M songs with lyrics (1.41M unique lyrics) annotated at different levels with the output of the above mentioned methods. Such corpus labels and the provided methods can be exploited by music search engines and music professionals (e.g. journalists, radio presenters) to better handle large collections of lyrics, allowing an intelligent browsing, categorization and segmentation recommendation of songs.
研究动机与目标
- 创建一个大规模、多语言的歌曲歌词语料库,并附加语义与情感元数据,以支持音乐信息检索与推荐。
- 解决从歌曲歌词中提取有意义、结构化信息的挑战,因为歌词编码了关键的语义与情感内容。
- 开发并应用自然语言处理方法,对歌词进行自动标注,包括结构、情感、露骨程度、主题与关键段落。
- 使音乐专业人士与搜索引擎能够利用丰富标注的歌词数据,实现智能浏览、分类与个性化推荐。
- 提供语料库、训练模型与工具的公开访问,以支持可复现性与进一步研究。
提出的方法
- 利用基于网络的音乐数据库(如LyricWiki、DBpedia、Last.fm)收集并合并210万首歌曲的元数据,其中173万首包含歌词。
- 应用分层分割模型,通过序列建模与对齐技术,将歌词分解为结构单元(如主歌、副歌等)。
- 采用混合方法,结合结构线索与基于嵌入的聚类,从关键句中生成简洁、具有代表性的歌曲摘要。
- 训练二分类器,利用基于BERT的嵌入并基于精选数据集微调,以检测歌词中的露骨内容。
- 基于效价与唤醒的二维情感模型,通过弱监督聚类方法在歌词嵌入上进行训练。
- 应用潜在狄利克雷分布(LDA)模型,设定60个主题,对完整语料库进行概率主题建模,以提取可解释的主题标签。
实验结果
研究问题
- RQ1如何利用自然语言处理技术,将歌曲歌词自动分割为如主歌、副歌与桥段等结构成分?
- RQ2在多大程度上可以使用连续的效价-唤醒维度对歌曲歌词中的情感进行建模?该模型与人类感知的契合度如何?
- RQ3主题建模能否有效从大规模歌曲歌词中提取可解释的主题?这些主题随时间如何演变?
- RQ4如露骨内容与关键段落等标注,与流派、情感及歌词结构之间存在何种关联?
- RQ5在流行音乐的数十年间,歌词主题、露骨程度与情感表达的历时性趋势如何?
主要发现
- WASABI歌曲语料库包含36种语言的173万首唯一歌曲歌词,其中105万首经60主题LDA模型标注。
- 采用效价-唤醒框架,成功为173万首歌曲预测了情感标注,其中1.6万首获得详细的情感向量。
- 对71.5万首歌曲进行了露骨内容标注,其中5.2万首被标记为露骨,表明存在相当比例的成熟内容。
- 通过结合结构与嵌入选择方法,为5万首歌曲生成了关键段落摘要,提升了摘要质量。
- 主题建模显示,如‘爱’与‘毒品’等主题表现出显著的时间趋势,某些年代中代表性增强。
- 相关性分析表明,情感强度较高的歌词更可能被结构化分割且主题更集中,支持多层标注的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。