Skip to main content
QUICK REVIEW

[论文解读] Subtitles to Segmentation: Improving Low-Resource Speech-to-Text Translation Pipelines

David Wan, Zhengping Jiang|arXiv (Cornell University)|Oct 19, 2020
Natural Language Processing Techniques参考文献 13被引用 4
一句话总结

本文提出使用电视和电影字幕作为代理数据集,以训练低资源语言(如立陶宛语和保加利亚语)的改进型自动语音识别(ASR)分段模型。通过整合来自未分段ASR输出的噪声性部分词性(POS)和依存句法分析特征,该方法提升了分段准确率,并在机器翻译和跨语言信息检索任务中带来显著的下游性能提升。

ABSTRACT

In this work, we focus on improving ASR output segmentation in the context of low-resource language speech-to-text translation. ASR output segmentation is crucial, as ASR systems segment the input audio using purely acoustic information and are not guaranteed to output sentence-like segments. Since most MT systems expect sentences as input, feeding in longer unsegmented passages can lead to sub-optimal performance. We explore the feasibility of using datasets of subtitles from TV shows and movies to train better ASR segmentation models. We further incorporate part-of-speech (POS) tag and dependency label information (derived from the unsegmented ASR outputs) into our segmentation model. We show that this noisy syntactic information can improve model accuracy. We evaluate our models intrinsically on segmentation quality and extrinsically on downstream MT performance, as well as downstream tasks including cross-lingual information retrieval (CLIR) tasks and human relevance assessments. Our model shows improved performance on downstream tasks for Lithuanian and Bulgarian.

研究动机与目标

  • 解决低资源语音转写翻译流程中ASR输出分段质量差的问题。
  • 在缺乏或仅有少量分段标注训练数据的情况下,提升分段质量。
  • 探索利用富含标点符号和说话人轮换提示的字幕作为训练分段模型代理数据的可行性。
  • 评估从噪声ASR输出中提取的句法特征(POS和依存句法分析)对分段准确率的影响。
  • 展示在机器翻译和跨语言信息检索(CLIR)任务中的下游性能提升。

提出的方法

  • 通过使用标点符号和说话人轮换标记从字幕中提取句子边界,构建代理分段数据集。
  • 训练神经序列标注模型,利用声学特征和来自未分段ASR输出的句法特征(POS和依存标签)预测句子边界。
  • 对原始ASR假设结果进行词性标注和依存句法分析,生成对分段任务有用但带有噪声的句法特征。
  • 通过F1分数和窗口差异(WD)在内在评估中衡量分段质量。
  • 在下游机器翻译(BLEU、AQWV)和跨语言信息检索(CLIR)任务中进行外在评估,涵盖文档级和段落级。
  • 通过Amazon Mechanical Turk进行人工评估,以衡量机器翻译质量及检索段落的查询相关性。

实验结果

研究问题

  • RQ1电视和电影字幕能否在低资源环境下有效用作训练ASR分段模型的代理数据集?
  • RQ2将来自未分段ASR输出的噪声句法特征(POS和依存句法分析)整合进来,是否能提升分段模型的性能?
  • RQ3分段质量的提升在多大程度上能带来机器翻译和CLIR任务中的可测量性能增益?
  • RQ4在人工评估中,所提出的分段模型与仅使用声学特征的分段模型相比,在机器翻译质量和相关性方面表现如何?
  • RQ5该模型在不同机器翻译系统和领域(如CS领域)中是否表现出一致的性能提升?

主要发现

  • 包含句法特征的Sub+S模型在立陶宛语上达到45.94的F1分数,在保加利亚语上达到56.40,显著优于基线模型。
  • 在CS领域,与基线相比,Sub+S模型使AQWV提升了0.106分,尤其在UMD-SMT/NB上最高达0.125分的绝对提升。
  • 人工评估显示,保加利亚语的查询相关性持续提升,尽管立陶宛语的BLEU分数未显著提高,但在UMD-SMT上相关性提升具有统计显著性。
  • 在人工相关性评估中,该模型优于仅使用声学特征的分段方法,尤其在CS领域,声学分段产生的是零散、非句子结构的片段。
  • 尽管立陶宛语的BLEU分数较低,该分段模型仍提升了文档级CLIR性能,表明其对翻译质量波动具有鲁棒性。
  • 使用字幕作为代理数据集在多种评估设置中均带来一致的性能提升,即使在数据有限的低资源环境下也表现良好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。