Skip to main content
QUICK REVIEW

[论文解读] A Comparison of Classifiers in Performing Speaker Accent Recognition Using MFCCs

Zichen Ma, Ernest Fokoué|arXiv (Cornell University)|Jan 28, 2015
Speech and Audio Processing被引用 7
一句话总结

本研究使用从语音信号中提取的梅尔频率倒谱系数(MFCCs)评估了多种分类器在语音口音识别中的表现。基于包含330个语音样本(165个美国,165个非美国)的数据集,在500折交叉验证中,k近邻(k-NN)分类器在平均测试准确率和计算速度方面均表现最佳,优于支持向量机(SVM)、随机森林和朴素贝叶斯等其他分类器。

ABSTRACT

An algorithm involving Mel-Frequency Cepstral Coefficients (MFCCs) is provided to perform signal feature extraction for the task of speaker accent recognition. Then different classifiers are compared based on the MFCC feature. For each signal, the mean vector of MFCC matrix is used as an input vector for pattern recognition. A sample of 330 signals, containing 165 US voice and 165 non-US voice, is analyzed. By comparison, k-nearest neighbors yield the highest average test accuracy, after using a cross-validation of size 500, and least time being used in the computation

研究动机与目标

  • 评估并比较多种机器学习分类器在使用MFCCs进行语音口音识别中的性能。
  • 确定哪种分类器在口音识别任务中实现最高准确率和计算效率。
  • 分析基于MFCC的特征提取对分类器性能在语音口音识别中影响。
  • 基于美国与非美国英语说话者平衡数据集,提供分类器有效性的实证证据。

提出的方法

  • 从语音信号中提取MFCCs作为主要的声学特征表示。
  • 对每个语音片段的MFCC矩阵计算均值向量,形成用于模式识别的固定长度输入向量。
  • 应用五种分类器进行比较:k近邻、支持向量机、随机森林、朴素贝叶斯和逻辑回归。
  • 采用500折交叉验证评估泛化性能和计算效率。
  • 基于平均测试准确率和执行时间评估模型性能。
  • 使用包含165名美国和165名非美国英语说话者的平衡数据集进行训练和测试。

实验结果

研究问题

  • RQ1在使用MFCC特征区分美国与非美国说话人口音时,哪种分类器达到最高准确率?
  • RQ2在处理基于MFCC的特征时,不同分类器在计算效率方面如何比较?
  • RQ3将均值MFCC向量作为输入特征是否能提升各类模型的分类器性能?
  • RQ4每种分类器在多个交叉验证折中的性能是否稳定?

主要发现

  • k近邻(k-NN)在所有评估的分类器中实现了最高的平均测试准确率。
  • k-NN表现出最快的计算时间,是本研究中最高效的分类器。
  • 支持向量机(SVM)和随机森林表现中等,但比k-NN更慢。
  • 朴素贝叶斯和逻辑回归的准确率低于k-NN和SVM。
  • 使用均值MFCC向量作为输入特征,使所有分类器均表现出一致的性能。
  • 500折交叉验证证实了所有模型性能指标的稳健性和稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。