[论文解读] Pansori: ASR Corpus Generation from Open Online Video Contents
本文提出 Pansori,一个开源框架,利用基于云的语音识别API,半自动地从公开的在线视频内容生成高质量自动语音识别(ASR)语料库。通过处理带有社区转录字幕的韩语TEDx演讲,作者构建了Pansori-TEDxKR数据集——首个免费提供的、高质量的韩语ASR语料库,以宽松许可证发布,供研究和社区使用。
This paper introduces Pansori, a program used to create ASR (automatic speech recognition) corpora from online video contents. It utilizes a cloud-based speech API to easily create a corpus in different languages. Using this program, we semi-automatically generated the Pansori-TEDxKR dataset from Korean TED conference talks with community-transcribed subtitles. It is the first high-quality corpus for the Korean language freely available for independent research. Pansori is released as an open-source software and the generated corpus is released under a permissive public license for community use and participation.
研究动机与目标
- 解决像韩语这样的低资源语言缺乏高质量、公开可用ASR语料库的问题。
- 开发一种可扩展的自动化流水线,从带有字幕的公开视频内容生成ASR训练数据。
- 通过利用现有的社区转录字幕,减少创建转录语音数据集所需的手动工作量。
- 将Pansori软件框架和生成的Pansori-TEDxKR数据集作为开源且可自由使用的资源发布,供研究社区使用。
提出的方法
- Pansori框架从在线视频中提取音频,主要来源为韩语TEDx演讲。
- 它使用基于云的语音识别API将提取的音频转录为文本。
- 系统使用强制对齐技术将自动生成的转录文本与现有的社区转录字幕进行对齐。
- 它对转录质量配对进行验证和过滤,以确保高准确性和一致性。
- 最终数据集仅包含高置信度、良好对齐的音频-转录配对。
- 整个流水线作为开源软件实现,支持可复现性及社区贡献。
实验结果
研究问题
- RQ1半自动流水线能否在极少人工干预的情况下,从公开可用的视频内容生成高质量ASR语料库?
- RQ2将自动转录语音与社区提供的字幕对齐,在生成准确训练数据方面的有效性如何?
- RQ3在多大规模上可以利用基于云的ASR API创建多语言ASR数据集?
- RQ4使用社区转录字幕作为黄金标准,对提升自动生成ASR语料库质量的影响有多大?
- RQ5开源软件和数据共享如何加速低资源语音识别研究?
主要发现
- Pansori框架成功生成了Pansori-TEDxKR数据集,这是首个公开可用、高质量的韩语ASR语料库。
- 该数据集包含大量高准确度、对齐良好的音频-转录配对,源自带有社区字幕的TEDx演讲。
- 使用基于云的ASR API减少了对手动转录的需求,实现了大规模、快速的语料库构建。
- 生成的语料库以宽松的开源许可证发布,促进其重用和社区驱动的开发。
- Pansori软件的开源性质使研究人员能够将其适配并扩展至其他语言和视频源。
- 本研究展示了一种可行且可扩展的方法,可从现有在线内容低成本、高质量地创建ASR语料库。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。