[论文解读] Prabhupadavani: A Code-mixed Speech Translation Data for 25 Languages
Prabhupadavani 是一个多语言、混合编码的语音翻译数据集,涵盖 25 种语言,总计 94 小时音频,经人工对齐与翻译,主要涉及英语、孟加拉语和梵语的混合使用。它是首个大规模、多领域、多语言混合编码的语音翻译数据集,支持鲁棒语音翻译系统、多语言训练以及跨多样化语言类型的一体化模型泛化研究。
Nowadays, the interest in code-mixing has become ubiquitous in Natural Language Processing (NLP); however, not much attention has been given to address this phenomenon for Speech Translation (ST) task. This can be solely attributed to the lack of code-mixed ST task labelled data. Thus, we introduce Prabhupadavani, which is a multilingual code-mixed ST dataset for 25 languages. It is multi-domain, covers ten language families, containing 94 hours of speech by 130+ speakers, manually aligned with corresponding text in the target language. The Prabhupadavani is about Vedic culture and heritage from Indic literature, where code-switching in the case of quotation from literature is important in the context of humanities teaching. To the best of our knowledge, Prabhupadvani is the first multi-lingual code-mixed ST dataset available in the ST literature. This data also can be used for a code-mixed machine translation task. All the dataset can be accessed at https://github.com/frozentoad9/CMST.
研究动机与目标
- 解决自然语言处理与语音翻译研究中缺乏大规模、多语言、混合编码语音翻译数据集的问题。
- 支持在多语言和多领域设置下对语音翻译中混合编码现象的鲁棒建模。
- 支持端到端和级联语音翻译系统的发展,使其能够泛化于多样化的语系和语言结构。
- 为混合编码语音翻译和混合编码机器翻译任务提供高质量、人工对齐的数据集。
- 促进多语言迁移学习和 25 种语言类型差异显著语言的统一建模研究。
提出的方法
- 该数据集源自 Bhaktivedanta Book Trust 和 Vanipedia 提供的关于吠陀文化与印度文学的讲座、辩论、访谈和对话的音频录音。
- 音频经人工转录并翻译为 25 种目标语言,语音与文本之间经过仔细对齐,以确保高质量的平行数据。
- 混合编码自然融入,主要通过引用梵文文献和用印地语或孟加拉语进行解释,真实反映人文学科教育中的语言行为。
- 数据集涵盖 10 个语系,包括印欧语系、乌拉尔语系、南岛语系和德拉维达语系,包含 SVO、SOV 以及灵活词序等多样的句法与形态结构。
- 采用分层数据划分策略,以支持所有 25 种语言的标准化训练、验证和测试,减少数据泄露并提升可复现性。
- 该数据集已公开发布于 GitHub,提供音频、文本和翻译的完整访问权限,支持语音翻译与自然语言处理研究的广泛应用。
实验结果
研究问题
- RQ1多语言训练是否能提升在多样化语系中混合编码语音翻译的性能?
- RQ2现有端到端与级联语音翻译系统在混合编码语音上的表现如何?该数据集能否缩小性能差距?
- RQ3在数据集的平行结构支持下,能否训练出一个统一模型以覆盖全部 25 种语言?
- RQ4语言差异(如词序、性标记和形态复杂性)在混合编码语音翻译中如何影响模型泛化?
- RQ5该数据集能否支持开发出能够将混合编码视为句法整合现象而非单纯词汇混合的鲁棒系统?
主要发现
- Prabhupadavani 是文献中首个多语言、混合编码语音翻译数据集,涵盖 25 种语言和 94 小时人工对齐的音频。
- 该数据集涵盖 10 个语系,包含屈折语、黏着语和孤立语,支持对混合编码效应的跨语言分析。
- 数据集总计包含 2,400 小时语音数据,当前发布版本提供 94 小时高质量、平行、混合编码语音翻译数据。
- 通过文学引文和解释方式引入混合编码,真实反映了教育与文化语境中的语言行为。
- 该数据集同时支持语音翻译与混合编码机器翻译任务,所有 25 种语言均提供平行翻译。
- 作者计划将数据集扩展至 108 种以上语言,表明其具备可扩展性与长期研究价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。