Skip to main content
QUICK REVIEW

[论文解读] Are word boundaries useful for unsupervised language learning?

Tu Anh Nguyen, Maureen de Seyssel|arXiv (Cornell University)|Oct 6, 2022
Topic Modeling被引用 5
一句话总结

本文研究了词边界是否能增强从语音中进行无监督语言学习的效果,通过对比在字符、音素、词和BPE单元上训练的LSTM模型(有无黄金或自动推断的边界)来实现。研究发现,丢失词边界信息会使性能下降2%至28%,具体取决于任务;但即使无监督分词效果一般(F1值40%),也能在句法和语义基准上显著恢复性能。

ABSTRACT

Word or word-fragment based Language Models (LM) are typically preferred over character-based ones in many downstream applications. This may not be surprising as words seem more linguistically relevant units than characters. Words provide at least two kinds of relevant information: boundary information and meaningful units. However, word boundary information may be absent or unreliable in the case of speech input (word boundaries are not marked explicitly in the speech stream). Here, we systematically compare LSTMs as a function of the input unit (character, phoneme, word, word part), with or without gold boundary information. We probe linguistic knowledge in the networks at the lexical, syntactic and semantic levels using three speech-adapted black box NLP psycholinguistically-inpired benchmarks (pWUGGY, pBLIMP, pSIMI). We find that the absence of boundaries costs between 2\% and 28\% in relative performance depending on the task. We show that gold boundaries can be replaced by automatically found ones obtained with an unsupervised segmentation algorithm, and that even modest segmentation performance gives a gain in performance on two of the three tasks compared to basic character/phone based models without boundary information.

研究动机与目标

  • 评估词边界信息对从语音中进行无监督语言表征学习的影响。
  • 确定无边界字符或音素模型是否在性能上逊于基于词的模型。
  • 评估通过无监督分词算法自动推断的词边界在多大程度上可弥补缺乏黄金边界的问题。
  • 开发并应用与语音兼容、受心理语言学启发的基准(pWUGGY、pBLIMP、pSIMI),以评估模型中的语言知识。
  • 通过引入回退机制消除OOV问题,实现基于词、子词和字符/音素模型之间的公平比较。

提出的方法

  • 通过音素化处理并使用Librispeech训练集筛选词汇,将三个基于文本的NLP基准(pWUGGY(词汇)、pBLIMP(句法)、pSIMI(语义))适配为语音输入。
  • 在Librispeech上使用四种输入单元类型(字符、音素、词、BPE)训练三层LSTM,包括有无黄金词边界的设置。
  • 引入两种额外的模型变体:一种使用无监督分词算法(DP-Parse)自动检测词边界,另一种在OOV情况下使用字符/音素回退。
  • 使用三个黑箱基准评估模型,这些基准独立于输入单元粒度衡量语言知识。
  • 使用黄金边界定义词标记,并对词模型设定20k词汇量上限,回退模型为20k。
  • 在开发集上调优超参数后报告测试集结果,重点关注pSIMI任务中最佳的层与池化组合。

实验结果

研究问题

  • RQ1缺乏词边界对从语音训练的语言模型所捕获的语言知识有何影响?
  • RQ2无监督词分词在多大程度上可替代黄金词边界以提升语言模型性能?
  • RQ3在缺乏黄金边界的情况下,不同输入单元(字符、音素、词、BPE)在捕捉词汇、句法和语义知识方面的表现如何比较?
  • RQ4与语音兼容的心理语言学基准能否可靠地衡量基于原始音频输入训练的模型的语言能力?
  • RQ5从移除词边界导致的性能下降是否在不同语言学任务中保持一致?

主要发现

  • 缺乏词边界导致在词汇基准(pWUGGY)上性能相对下降2%,在句法基准(pBLIMP)上下降14%,在语义基准(pSIMI)上下降28%。
  • 使用黄金词边界的模型始终优于无边界的模型,其中基于词的模型在pBLIMP和pSIMI上取得最高分。
  • 即使词分词的F1值仅为40%,自动推断的边界仍使pBLIMP和pSIMI上的性能优于完全无边界信息的模型。
  • 无边界的基于字符的模型在pWUGGY上表现最佳,表明词汇可接受性检测受益于更细粒度的单元。
  • 采用字符子词的BPE模型(BPE word[char])在pSIMI上取得第二高分(20.42),表明带有边界的子词单元可在一定程度上恢复语言知识。
  • 表现最佳的基于BERT的模型(RoBERTa-large)在pBLIMP上得分为96.03,凸显了监督预训练与无监督语音模型之间的差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。