Skip to main content
QUICK REVIEW

[论文解读] Query-by-example Spoken Term Detection using Attention-based Multi-hop Networks

Chia-Wei Ao, Hung-yi Lee|arXiv (Cornell University)|Sep 1, 2017
Speech Recognition and Synthesis参考文献 20被引用 4
一句话总结

本文提出一种端到端的基于注意力机制的多跳神经网络,用于基于示例的语音术语检测(STD),实现无需转录的直接声学匹配。该模型利用注意力机制定位音频片段中的查询词,并通过多跳机制细化表示,在运行时复杂度显著降低的情况下,性能与DTW相当,尤其在无监督设置下,无需标注数据即可模仿DTW的表现。

ABSTRACT

Retrieving spoken content with spoken queries, or query-by- example spoken term detection (STD), is attractive because it makes possible the matching of signals directly on the acoustic level without transcribing them into text. Here, we propose an end-to-end query-by-example STD model based on an attention-based multi-hop network, whose input is a spoken query and an audio segment containing several utterances; the output states whether the audio segment includes the query. The model can be trained in either a supervised scenario using labeled data, or in an unsupervised fashion. In the supervised scenario, we find that the attention mechanism and multiple hops improve performance, and that the attention weights indicate the time span of the detected terms. In the unsupervised setting, the model mimics the behavior of the existing query-by-example STD system, yielding performance comparable to the existing system but with a lower search time complexity.

研究动机与目标

  • 开发一种端到端的深度学习模型,用于基于示例的语音术语检测(STD),直接在声学信号上运行,无需转录。
  • 通过用可学习的神经网络替代动态时间规整(DTW),解决DTW计算复杂度高且无可训练参数的局限性。
  • 支持有监督和无监督训练场景,允许通过用户反馈或从DTW蒸馏知识来提升模型性能,即使在无标签情况下亦可实现。
  • 利用注意力机制定位较长音频片段中查询词的时间范围,避免对预分割的词边界的依赖。
  • 通过多跳推理提升泛化能力和性能,即通过音频片段中的上下文信息,迭代更新查询表示。

提出的方法

  • 使用MFCC声学特征表示语音查询和音频片段,作为模型的输入。
  • 采用单向LSTM编码器将语音查询嵌入为固定维向量。
  • 应用注意力机制,计算查询向量与音频片段每个时间步的对齐得分,生成注意力权重,突出相关区域。
  • 实现多跳机制,通过音频片段中的上下文感知信息,迭代更新查询表示,多轮迭代后提升表示质量。
  • 使用关键词检测器(前馈网络)输出置信度分数,判断查询词是否存在于音频片段中。
  • 在有监督设置下,使用标签数据的二元交叉熵损失进行训练;在无监督设置下,通过DTW的相似度分数作为回归目标进行蒸馏。
Fig. 1 : Framework and training scenarios
Fig. 1 : Framework and training scenarios

实验结果

研究问题

  • RQ1基于注意力机制的端到端多跳网络是否能在降低计算复杂度的同时,优于传统的DTW方法,实现基于示例的语音术语检测?
  • RQ2注意力机制在多大程度上提升了STD中的定位准确性和性能?能否揭示检测到的术语的时间跨度?
  • RQ3多跳推理是否增强了模型的泛化能力,特别是在训练与测试数据不匹配的情况下?
  • RQ4使用DTW作为教师模型进行无监督训练的神经网络,是否能在推理时间更短的前提下,实现与DTW相当的性能?
  • RQ5在集成设置中,DTW与所提出的基于注意力机制的模型是否具有互补性?

主要发现

  • 在有监督设置下,所提出的基于注意力机制的多跳网络在测试集1上达到0.6676的平均平均精度(MAP),优于单跳模型和基线DTW方法。
  • 注意力权重能高精度地定位查询词的结束时间:25%的预测误差小于1秒,且大多数注意力峰值位于真实结束时间的0.1–0.5秒以内。
  • 多跳机制提升了泛化能力,3跳模型在测试集2和3上表现最佳,分别达到0.6404和0.5837的MAP。
  • 在无监督设置下,3跳注意力模型在测试集2和3上的表现优于DTW(MAP:0.5964和0.5702 vs. 0.5778和0.5678),证明其在无标签数据下具有更优的泛化能力。
  • 该模型在推理阶段比DTW快7倍,时间复杂度为O(M×n),而DTW为O(M×N),其中n为跳跃次数,N为查询长度,因此更适合实时应用。
  • 将DTW输出与3跳注意力模型进行集成,可进一步提升性能,在测试集1上达到0.6789的MAP,证实了两种方法的互补性。
Fig. 2 : Attention mechanism
Fig. 2 : Attention mechanism

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。