Skip to main content
QUICK REVIEW

[论文解读] A Hybrid of Deep Audio Feature and i-vector for Artist Recognition

Jiyoung Park, Donghyun Kim|arXiv (Cornell University)|Jul 24, 2018
Music and Audio Processing参考文献 7被引用 4
一句话总结

本文提出一种晚期融合混合模型,结合深度卷积神经网络(DCNN)提取的音频特征与i-vector表征,用于音乐艺人识别。通过利用DCNN的判别能力与i-vector的生成鲁棒性,该方法在性能上达到当前最优水平,尤其在歌手识别任务中表现突出,并通过互补特征学习超越了单一模型的表现。

ABSTRACT

Artist recognition is a task of modeling the artist's musical style. This problem is challenging because there is no clear standard. We propose a hybrid method of the generative model i-vector and the discriminative model deep convolutional neural network. We show that this approach achieves state-of-the-art performance by complementing each other. In addition, we briefly explain the advantages and disadvantages of each approach.

研究动机与目标

  • 通过结合深度学习与传统说话人建模技术,提升音乐信息检索中的艺人识别性能。
  • 探究判别性深度音频特征与生成性i-vector表征在建模音乐艺人风格方面的互补优势。
  • 评估在结合DCNN与i-vector特征用于艺人与歌手识别时,早期融合与晚期融合策略的有效性。
  • 分析模型性能随训练艺人数量及音频内容性质(如以人声为主)的变化规律。
  • 探索该混合模型在未来推荐相似艺人等应用中的潜力。

提出的方法

  • 使用在3秒梅尔频谱图(128个频带)上预训练的5层卷积神经网络提取深度音频特征,将最后一层256维隐藏层作为特征表示。
  • 利用20维梅尔频率倒谱系数(MFCCs)与256分量高斯混合模型(GMM)生成i-vector,并通过概率线性判别分析(PLDA)进行打分。
  • 通过将256维DCNN特征与256维i-vector拼接,形成单一512维向量,实现早期融合。
  • 通过平均DCNN与i-vector模型的PLDA打分实现晚期融合,使两者独立贡献于最终决策。
  • 在百万首歌曲数据集上训练与评估模型,每名艺人筛选20首歌曲,使用500名未见艺人进行评估。
  • 通过15段注册音频的平均池化构建单一艺人模型,并使用等错误率(EER)评估验证性能,以分类准确率评估识别性能。

实验结果

研究问题

  • RQ1随着训练艺人数量的增加,i-vector与DCNN的性能特征有何差异?
  • RQ2i-vector与DCNN在建模音乐艺人身份方面,以何种方式实现互补?
  • RQ3在艺人与歌手识别任务中,DCNN与i-vector的早期融合或晚期融合哪种性能更优?
  • RQ4对人声内容的关注(如歌手识别)如何影响i-vector与DCNN的相对性能表现?
  • RQ5通过融合判别性与生成性模型的优势,该混合模型能否实现艺人识别的最先进性能?

主要发现

  • 晚期融合在所有任务中表现最佳,歌手识别的EER为3.241%,准确率为76.0%,显著优于单一模型。
  • DCNN性能随训练艺人数量增加而稳步提升,而i-vector性能早期即达平台期,表明其因无监督性质对训练数据规模不敏感。
  • i-vector在歌手识别(EER为8.257%)中表现优于艺人识别(EER为10.785%),表明其在建模语音特征方面具有优势。
  • 早期融合性能劣于两个独立模型,可能因在打分前将不同表征混合导致特征混淆。
  • 混淆矩阵显示,DCNN在训练样本较少的艺人上难以建立稳定模型,而i-vector虽早期即可建模,但随着训练规模增大,艺人间相似性增加。
  • 混合模型展现出强大互补性:DCNN捕捉更高阶音乐特征,而i-vector在基于人声的区分上表现更优,尤其在人声聚焦任务中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。