[论文解读] Cross-lingual and Multilingual Spoken Term Detection for Low-Resource Indian Languages
本文提出了一种零样本跨语言语音词检测(STD)方法,针对十种低资源印度语言,利用高资源的印地语、泰米尔语和泰卢固语自动语音识别(ASR)系统作为黑箱转录器。通过利用音素相似性、宽松的音素匹配算法以及语言特定的语言模型,该方法在无需任何目标语言语音数据的情况下,实现了高达0.86的MTWV得分,表明音素相似的语言受益最多,而音素差异较大的语言也能通过稳健的音素匹配实现检测。
Spoken Term Detection (STD) is the task of searching for words or phrases within audio, given either text or spoken input as a query. In this work, we use state-of-the-art Hindi, Tamil and Telugu ASR systems cross-lingually for lexical Spoken Term Detection in ten low-resource Indian languages. Since no publicly available dataset exists for Spoken Term Detection in these languages, we create a new dataset using a publicly available TTS dataset. We report a standard metric for STD, Mean Term Weighted Value (MTWV) and show that ASR systems built in languages that are phonetically similar to the target languages have higher accuracy, however, it is also possible to get high MTWV scores for dissimilar languages by using a relaxed phone matching algorithm. We propose a technique to bootstrap the Grapheme-to-Phoneme (g2p) mapping between all the languages under consideration using publicly available resources. Gains are obtained when we combine the output of multiple ASR systems and when we use language-specific Language Models. We show that it is possible to perform STD cross-lingually in a zero-shot manner without the need for any language-specific speech data. We plan to make the STD dataset available for other researchers interested in cross-lingual STD.
研究动机与目标
- 在无需任何语言特定语音数据的情况下,实现对低资源印度语言的语音词检测(STD)。
- 评估高资源印度语言(印地语、泰卢固语、泰米尔语)的跨语言ASR系统在十种低资源语言中STD的有效性。
- 开发一种方法,利用公开资源在这些语言之间自举构建音素到音素(g2p)映射。
- 通过多语言ASR融合和语言特定语言模型提升STD性能。
- 基于TTS语料库创建并发布一个新的公开STD数据集,用于低资源印度语言的语音词检测研究。
提出的方法
- 将预训练的印地语、泰卢固语和泰米尔语ASR系统作为黑箱转录器,用于十种低资源印度语言的音频。
- 应用一种宽松的音素匹配算法,允许来自相同音素类别的音素相互匹配,从而提升对音素差异较大语言的鲁棒性。
- 利用共享音素集和Unicode字符映射,从公开资源中自举构建所有目标语言之间的g2p映射。
- 通过基于对齐得分的投票策略,融合所有三个ASR系统生成的假设,以提高检测准确率。
- 通过集成在目标语言文本数据上训练的语言特定语言模型(LMs),进一步提升性能。
- 使用标准的STD指标——平均词项加权值(MTWV),在所有语言上评估性能。
实验结果
研究问题
- RQ1高资源印度语言ASR系统能否在零样本设置下有效用于低资源印度语言的语音词检测?
- RQ2源语言与目标语言之间的音素相似性在跨语言设置下如何影响STD性能?
- RQ3宽松的音素匹配算法在多大程度上能提升对音素差异较大语言的STD准确率?
- RQ4结合多个ASR系统输出并使用语言特定语言模型是否能提升MTWV得分?
- RQ5能否利用公开资源在低资源印度语言之间有效自举构建g2p映射?
主要发现
- 多语言ASR融合方法在所有语言中均取得了最高的MTWV得分,显著优于单一ASR基线模型。
- 与印地语音素相似的语言(如古吉拉特语、马拉地语、拉贾斯坦语)取得了最高的MTWV得分——高达0.62,归因于ASR对齐效果更好。
- 尽管音素错误率(PER)较高,博多人(Bodo)仍取得了0.56的高MTWV得分,归因于宽松的音素匹配算法使相似音素类得以匹配。
- 添加语言特定语言模型显著提升了MTWV得分,例如孟加拉语从0.47提升至0.79,卡纳达语从0.41提升至0.86。
- 该方法在无现有ASR系统的语言中也表现出高精度,证明了零样本跨语言STD的可行性。
- 作者计划发布一个基于TTS语料库构建的新公共STD数据集,以支持未来在低资源印度语言语音词检测方面的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。