[论文解读] JTubeSpeech: corpus of Japanese speech collected from YouTube for speech recognition and speaker verification
本文介绍了 JTubeSpeech,这是一个从 YouTube 视频自动构建的大规模日语语音语料库,用于端到端自动语音识别(ASR)和说话人验证(ASV)。通过使用基于 CTC 的 ASR 进行音频-字幕对齐以及基于说话人差异分析进行过滤,该方法仅需极少的语言特异性处理。该语料库为 ASR 提供了超过 1,300 小时的训练数据,为 ASV 提供了 900 小时的训练数据,使在初步 ASV 基准测试中实现了最先进性能,等错误率(EER)为 10.9%。
In this paper, we construct a new Japanese speech corpus called "JTubeSpeech." Although recent end-to-end learning requires large-size speech corpora, open-sourced such corpora for languages other than English have not yet been established. In this paper, we describe the construction of a corpus from YouTube videos and subtitles for speech recognition and speaker verification. Our method can automatically filter the videos and subtitles with almost no language-dependent processes. We consistently employ Connectionist Temporal Classification (CTC)-based techniques for automatic speech recognition (ASR) and a speaker variation-based method for automatic speaker verification (ASV). We build 1) a large-scale Japanese ASR benchmark with more than 1,300 hours of data and 2) 900 hours of data for Japanese ASV.
研究动机与目标
- 解决当前日语 ASR 和 ASV 领域缺乏大规模开源语音语料库的问题。
- 开发一种语言无关的自动化流程,用于从 YouTube 收集并过滤语音数据。
- 构建一个现代规模、高质量的语料库,适用于训练日语端到端模型。
- 通过构建日语 ASR 和 ASV 的基准测试,以可测量的性能表现证明该方法的有效性。
提出的方法
- 使用自动化搜索查询从 YouTube 爬取视频-音频和字幕数据。
- 应用基于 CTC 的 ASR 并结合 CTC 分段技术,将字幕与音频对齐,并计算置信度分数以用于过滤。
- 利用视频内说话人表征的差异,对单说话人、多说话人及 TTS 类内容进行分类与过滤。
- 使用语音活动检测(VAD)和预训练的 d-向量,计算视频内说话人差异以实现数据清洗。
- 从单说话人视频中选取唯一说话人,用于 ASV 设置中的注册与测试。
- 使用卷积神经网络(CNN)训练说话人嵌入模型,输入为 40 维对数梅尔倒谱系数,输出为 512 维嵌入向量,用于 ASV 评估。
实验结果
研究问题
- RQ1一种高度语言无关的方法能否有效从 YouTube 收集并过滤出高质量的日语语音数据用于 ASR 和 ASV?
- RQ2随着从 YouTube 自动收集的数据量增加,ASR 模型的性能如何变化?
- RQ3基于说话人差异的分析能否可靠地区分非结构化 YouTube 视频中的单说话人、多说话人或合成语音内容?
- RQ4在通过自动化过滤构建的大规模开源日语语料库上训练的说话人验证系统,其性能如何?
主要发现
- JTubeSpeech 语料库包含超过 1,300 小时的日语 ASR 训练数据,显著超过先前基准(如 CSJ,600 小时)的规模。
- 随着训练数据量的增加,ASR 性能持续提升,在使用最优置信度阈值时,1,376 小时数据下在 dev_easy 上达到 6.9% 的词错误率(WER)。
- 与直接使用原始 YouTube 时间戳相比,CTC 分段技术使 ASR 性能在 dev_easy 上提升了 2.3% 的绝对误差,在 dev_normal 上提升了 2.2%。
- 基于说话人差异的过滤方法在视频类型分类中表现出高准确率,95% 的标注为单说话人的视频被正确分类。
- ASV 系统在初步基准测试中实现了 10.9% 的等错误率(EER),性能强劲,与在 VoxCeleb1 上训练的模型相当。
- 语料库构建流程所需的语言特异性处理极少,具备高度可复现性,适用于其他语言。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。