Skip to main content
QUICK REVIEW

[论文解读] Robust cross-domain disfluency detection with pattern match networks

Vicky Zayats, Mari Ostendorf|arXiv (Cornell University)|Nov 17, 2018
Network Security and Intrusion Detection参考文献 8被引用 11
一句话总结

本文提出了一种新型的模式匹配神经网络,通过使用学习到的邻近相似度分数作为输入特征,自动发现不流畅模式,从而消除了手工特征工程的需求。该模型在域内性能与手工特征相当,且在跨域不流畅检测中显著优于基线模型,展现出在Switchboard、CallHome、SCOTUS和FCIC等多样化语音语料中的鲁棒性。

ABSTRACT

In this paper we introduce a novel pattern match neural network architecture that uses neighbor similarity scores as features, eliminating the need for feature engineering in a disfluency detection task. We evaluate the approach in disfluency detection for four different speech genres, showing that the approach is as effective as hand-engineered pattern match features when used on in-domain data and achieves superior performance in cross-domain scenarios.

研究动机与目标

  • 通过自动发现语音中的模式,消除不流畅检测中对手工特征工程的依赖。
  • 提升不流畅检测在Switchboard、CallHome、SCOTUS和FCIC等多样化语音语体中的跨域泛化能力。
  • 开发一种神经架构,利用相邻词之间的相似度分数作为特征,检测修复前-修复后模式。
  • 评估模型在域外设置下的鲁棒性,其中传统模型如LSTM会因过度拟合域内模式而表现不佳。
  • 证明基于相似度的特征在域内和跨域场景下可达到或超越手工设计的模式匹配特征性能。

提出的方法

  • 模型使用学习到的嵌入表示和余弦相似度,计算每个词与其前后固定窗口内词的邻近相似度分数。
  • 相似度分数计算公式为 $ \alpha^{\{f,b\}}_{i,j} = \text{sim}(W^1 x_i, W^2 x_j) $,其中 $ W^1, W^2 $ 分别为词元和词性标注表示的可学习权重矩阵。
  • 生成的相似度矩阵 $ \alpha \in \mathbb{R}^{w \times n \times d_f} $ 输入一维卷积神经网络(CNN),以检测局部多标记模式匹配。
  • CNN通过检测相似度矩阵中的空间相关性,学习识别如“we were”匹配“I was”等模式。
  • 该架构通过将相似度分数作为特征而非注意力权重,避免使用注意力机制。
  • 模型在四个语料库上端到端训练:Switchboard(域内)、CallHome、SCOTUS和FCIC(域外),超参数在Switchboard开发集上进行调优。

实验结果

研究问题

  • RQ1神经网络能否在不依赖手工特征的情况下自动发现不流畅模式?
  • RQ2使用学习到的相似度分数的模式匹配网络性能与使用手工设计模式匹配特征的模型相比如何?
  • RQ3所提出的模型在跨域不流畅检测场景中是否比现有模型泛化能力更强?
  • RQ4LSTM在跨域设置中为何失败?模式匹配网络能否缓解此问题?
  • RQ5基于相似度的特征在具有不同不流畅模式的多样化语音语体中,能在多大程度上提升鲁棒性?

主要发现

  • 该模式匹配网络在Switchboard测试集上取得86.7的F1分数,与使用手工特征的LSTM(86.8)相当,且优于CRF(71.3)。
  • 在域外数据上,模型在CallHome(65.2)、SCOTUS(79.9)和FCIC(66.1)上均取得显著优于LSTM基线和CRF的F1分数。
  • 使用手工特征的LSTM在域外数据上表现出精度急剧下降(如CallHome上为54.7),并出现大量不流畅现象的误报,尤其在长句中更为明显。
  • 通过错误分析示例可见,使用学习到的相似度特征的模型相比使用手工特征的LSTM,能显著减少误报。
  • 在跨域设置中,该模式匹配网络比CRF和LSTM更具鲁棒性,表明其对领域偏移的不流畅模式具有更好的泛化能力。
  • 该模型在包括正式(SCOTUS)、非正式(CallHome)和技术性(FCIC)在内的多样化领域中表现稳定,表明其具备强大的领域泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。