QUICK REVIEW
[论文解读] A Hybrid of Deep Audio Feature and i-vector for Artist Recognition
Jiyoung Park, Donghyun Kim|arXiv (Cornell University)|Jul 24, 2018
Music and Audio Processing参考文献 7被引用 4
一句话总结
本文提出一种晚期融合混合模型,结合深度卷积神经网络(DCNN)提取的音频特征与i-vector表征,用于音乐艺人识别。通过利用DCNN的判别能力与i-vector的生成鲁棒性,该方法在性能上达到当前最优水平,尤其在歌手识别任务中表现突出,并通过互补特征学习超越了单一模型的表现。
ABSTRACT
Artist recognition is a task of modeling the artist's musical style. This problem is challenging because there is no clear standard. We propose a hybrid method of the generative model i-vector and the discriminative model deep convolutional neural network. We show that this approach achieves state-of-the-art performance by complementing each other. In addition, we briefly explain the advantages and disadvantages of each approach.
研究动机与目标
- 通过结合深度学习与传统说话人建模技术,提升音乐信息检索中的艺人识别性能。
- 探究判别性深度音频特征与生成性i-vector表征在建模音乐艺人风格方面的互补优势。
- 评估在结合DCNN与i-vector特征用于艺人与歌手识别时,早期融合与晚期融合策略的有效性。
- 分析模型性能随训练艺人数量及音频内容性质(如以人声为主)的变化规律。
- 探索该混合模型在未来推荐相似艺人等应用中的潜力。
提出的方法
- 使用在3秒梅尔频谱图(128个频带)上预训练的5层卷积神经网络提取深度音频特征,将最后一层256维隐藏层作为特征表示。
- 利用20维梅尔频率倒谱系数(MFCCs)与256分量高斯混合模型(GMM)生成i-vector,并通过概率线性判别分析(PLDA)进行打分。
- 通过将256维DCNN特征与256维i-vector拼接,形成单一512维向量,实现早期融合。
- 通过平均DCNN与i-vector模型的PLDA打分实现晚期融合,使两者独立贡献于最终决策。
- 在百万首歌曲数据集上训练与评估模型,每名艺人筛选20首歌曲,使用500名未见艺人进行评估。
- 通过15段注册音频的平均池化构建单一艺人模型,并使用等错误率(EER)评估验证性能,以分类准确率评估识别性能。
实验结果
研究问题
- RQ1随着训练艺人数量的增加,i-vector与DCNN的性能特征有何差异?
- RQ2i-vector与DCNN在建模音乐艺人身份方面,以何种方式实现互补?
- RQ3在艺人与歌手识别任务中,DCNN与i-vector的早期融合或晚期融合哪种性能更优?
- RQ4对人声内容的关注(如歌手识别)如何影响i-vector与DCNN的相对性能表现?
- RQ5通过融合判别性与生成性模型的优势,该混合模型能否实现艺人识别的最先进性能?
主要发现
- 晚期融合在所有任务中表现最佳,歌手识别的EER为3.241%,准确率为76.0%,显著优于单一模型。
- DCNN性能随训练艺人数量增加而稳步提升,而i-vector性能早期即达平台期,表明其因无监督性质对训练数据规模不敏感。
- i-vector在歌手识别(EER为8.257%)中表现优于艺人识别(EER为10.785%),表明其在建模语音特征方面具有优势。
- 早期融合性能劣于两个独立模型,可能因在打分前将不同表征混合导致特征混淆。
- 混淆矩阵显示,DCNN在训练样本较少的艺人上难以建立稳定模型,而i-vector虽早期即可建模,但随着训练规模增大,艺人间相似性增加。
- 混合模型展现出强大互补性:DCNN捕捉更高阶音乐特征,而i-vector在基于人声的区分上表现更优,尤其在人声聚焦任务中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。