Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Word Segmentation from Speech with Attention

Pierre Godard, Marcely Zanon-Boito|arXiv (Cornell University)|Jun 18, 2018
Speech Recognition and Synthesis参考文献 37被引用 14
一句话总结

本文提出一种基于注意力机制的神经机器翻译方法,用于从低资源、无文字语言的原始语音中进行无监督词切分,利用双语语音翻译对齐。首先通过语音单元发现(AUD)将语音转换为伪音素,再在编码器-解码器模型中利用注意力机制将这些伪音素与翻译文本对齐,该方法在Mboshi语料库上实现了50.0%的词边界F-measure,显著优于单语基线模型,是该数据集目前的最佳结果。

ABSTRACT

We present a first attempt to perform attentional word segmentation directly from the speech signal, with the final goal to automatically identify lexical units in a low-resource, unwritten language (UL). Our methodology assumes a pairing between recordings in the UL with translations in a well-resourced language. It uses Acoustic Unit Discovery (AUD) to convert speech into a sequence of pseudo-phones that is segmented using neural soft-alignments produced by a neural machine translation model. Evaluation uses an actual Bantu UL, Mboshi; comparisons to monolingual and bilingual baselines illustrate the potential of attentional word segmentation for language documentation.

研究动机与目标

  • 解决在无文本或音素资源的低资源无文字语言(ULs)中进行无监督词切分的问题。
  • 探究双语句子级翻译是否可作为弱监督信号,提升从原始语音中进行词切分的性能。
  • 开发一种两阶段流程,结合语音单元发现(AUD)与基于注意力机制的神经机器翻译,实现词边界检测。
  • 在Mboshi语言语料库的实际语言记录场景中评估该方法。

提出的方法

  • 首先,使用贝叶斯模型(HMM、SVAE、MBN)进行语音单元发现(AUD),将原始语音转换为带时间标记的伪音素序列。
  • 使用神经机器翻译(NMT)编码器-解码器模型,将资源丰富的语言(WRL)句子翻译为无文字语言(UL)的伪音素序列。
  • 使用真实翻译作为监督信号训练NMT模型,通过解码器隐藏状态与注意力机制,计算WRL词语与UL伪音素之间的软对齐。
  • 通过识别连续伪音素之间注意力权重的显著变化,从注意力权重中提取词边界。
  • 对注意力矩阵进行后处理,检测相邻单元间注意力发生显著转移的位置,以识别边界。
  • 使用词边界检测的F-measure评估分割性能,比较不同AUD输出与基线模型。

实验结果

研究问题

  • RQ1在语音到翻译对齐的监督下,神经机器翻译模型中的注意力机制是否能有效识别无文字语言中的词边界?
  • RQ2语音单元发现(AUD)输出的质量如何影响下游词切分性能?
  • RQ3与单语方法相比,使用双语句子级翻译作为弱监督是否能提升从原始语音中进行词切分的性能?
  • RQ4从伪音素进行词切分的性能与从真实音素序列进行切分相比如何?
  • RQ5不同AUD架构(HMM、SVAE、MBN)对最终词切分准确率有何影响?

主要发现

  • 所提方法在使用MBN SVAE生成的伪音素进行语音切分时,词边界F-measure达到50.0%,显著优于单语基线模型。
  • 从真实音素符号进行切分可获得更高的F-measure(61.0%),表明AUD引入的噪声影响了性能。
  • MBN SVAE AUD方法生成的伪音素序列更短、更准确(平均每句23.4个),优于HMM(平均每句32.1个),有助于提升切分效果。
  • 当使用平均注意力矩阵时,基于注意力的方法相比基线模型性能提升约0.8%,表现出良好的鲁棒性。
  • 伪音素的词汇检索率显著低于真实音素(13.5% vs 34.3%),凸显了将语音片段聚类为正确词类的挑战。
  • 该方法在Mboshi5k语料库上实现了迄今为止无监督语音词切分的最佳报告性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。