[论文解读] Differentiable Weighted Finite-State Transducers
本文提出了一种可微分的加权有限状态转换器(WFST)框架,通过将WFST操作集成到深度学习流水线中,实现了结构化序列模型的端到端训练。通过支持自动微分,该框架使损失函数、潜在变量建模(例如子词分解)以及新型层(如卷积WFST层)能够联合优化,从而在更少参数下实现更高的准确率,该方法在语音识别和手写识别任务中得到了验证。
We introduce a framework for automatic differentiation with weighted finite-state transducers (WFSTs) allowing them to be used dynamically at training time. Through the separation of graphs from operations on graphs, this framework enables the exploration of new structured loss functions which in turn eases the encoding of prior knowledge into learning algorithms. We show how the framework can combine pruning and back-off in transition models with various sequence-level loss functions. We also show how to learn over the latent decomposition of phrases into word pieces. Finally, to demonstrate that WFSTs can be used in the interior of a deep neural network, we propose a convolutional WFST layer which maps lower-level representations to higher-level representations and can be used as a drop-in replacement for a traditional convolution. We validate these algorithms with experiments in handwriting recognition and speech recognition.
研究动机与目标
- 为在模型训练过程中支持通过加权有限状态转换器(WFST)进行自动微分,克服静态WFST在推理中使用时的局限性。
- 允许通过图运算而非手工编码实现,表达并优化结构化序列级损失函数(例如CTC、ASG)。
- 通过在训练过程中对潜在分解进行边缘化,学习任务特定的子词分解,提升模型适应能力。
- 将WFST作为可学习层集成到深度神经网络中,替代或增强传统卷积层。
- 证明可微分WFST可在减少参数和计算成本的同时提升模型准确率。
提出的方法
- 将图结构(WFST)与操作分离,支持通过WFST组合、交集和前向评分实现自动微分。
- 将序列级损失函数(如ASG、CTC)表示为图运算:通过约束图与归一化图的前向得分差值计算损失。
- 使用带剪枝和回退机制的转移WFST,实现对大规模词汇表的高效计算。
- 利用WFST对潜在子词分解进行建模,在训练过程中对可能的子词单元进行边缘化,使模型能够学习任务特定的子词单元。
- 设计一种卷积WFST层,将低层次表示(如字母)映射到高层次表示(如子词单元),其转换规则可学习。
- 通过可微分WFST操作的反向传播端到端训练整个模型,梯度由框架的C++和Python前端计算。
实验结果
研究问题
- RQ1加权有限状态转换器能否被设计为可微分,以支持深度学习模型中的端到端训练?
- RQ2与手工编码实现相比,可微分WFST能否更灵活地表达和优化新型结构化序列级损失函数?
- RQ3能否通过基于WFST的边缘化方法,在训练过程中动态学习潜在子词分解,从而提升大规模词汇量任务上的性能?
- RQ4WFST能否作为深度神经网络中的可学习层使用,替代或超越传统卷积层?
- RQ5集成可微分WFST是否能在语音和手写识别任务中提升模型准确率,同时降低模型复杂度?
主要发现
- 可微分WFST框架支持通过图运算和自动微分实现结构化损失函数(如ASG和CTC)的端到端训练。
- 对潜在子词分解进行边缘化可提升识别准确率,尤其在大规模词汇量任务中,能恢复因固定子词分词而损失的性能。
- 在IAM手写识别数据集上,卷积WFST层以仅2,048个参数达到19.5%的CER,优于传统卷积层(20.7% CER,79,000个参数)。
- WFST卷积层的参数和计算量随子词长度(w)增长,而非输入通道数(ci),相比标准卷积显著减少参数与计算量。
- 模型能根据输入动态选择最优子词分解,例如在紧密排列的手写文本中更倾向于使用高层级标记,体现了自适应表征学习能力。
- 实验表明,可微分WFST支持联合优化数据与图中编码的先验知识,提升泛化能力并减少暴露偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。