[论文解读] Sum-Product Networks for Sequence Labeling
本文提出在线性链条件随机场(LC-CRFs)中使用求和-乘积网络(SPNs)作为深度、可微且高效的高阶因子,用于序列标注。通过用SPNs替代传统的的一阶或线性高阶因子,该模型能够捕捉多个输入片段与输出标签之间的复杂非线性依赖关系,同时实现精确且高效的推理。该方法在TIMIT数据集上实现了18.2%的音素错误率(PER),优于先前的模型,包括NHO-LC-CRFs。
We consider higher-order linear-chain conditional random fields (HO-LC-CRFs) for sequence modelling, and use sum-product networks (SPNs) for representing higher-order input- and output-dependent factors. SPNs are a recently introduced class of deep models for which exact and efficient inference can be performed. By combining HO-LC-CRFs with SPNs, expressive models over both the output labels and the hidden variables are instantiated while still enabling efficient exact inference. Furthermore, the use of higher-order factors allows us to capture relations of multiple input segments and multiple output labels as often present in real-world data. These relations can not be modelled by the commonly used first-order models and higher-order models with local factors including only a single output label. We demonstrate the effectiveness of our proposed models for sequence labeling. In extensive experiments, we outperform other state-of-the-art methods in optical character recognition and achieve competitive results in phone classification.
研究动机与目标
- 解决一阶和线性高阶模型在序列标注中难以捕捉输入片段与输出标签之间复杂非线性依赖关系的局限性。
- 通过将求和-乘积网络(SPNs)作为高阶输入和输出相关因子集成到结构化预测模型中,实现高效且精确的推理。
- 探索SPNs在建模光学字符识别和音素分类等序列建模任务中丰富且深层依赖关系方面的有效性。
- 在性能和泛化能力方面,将基于SPN的模型与现有最先进方法(包括NHO-LC-CRFs和HO-HU-CRFs)进行比较。
提出的方法
- 该模型通过将标准局部因子和高阶因子替换为SPNs,扩展了高阶线性链CRFs(HO-LC-CRFs),SPNs是能够实现精确且高效推理的深度结构化概率模型。
- SPNs被用于表示输入依赖的高阶因子,这些因子将m个输入片段映射到n个输出标签,从而能够建模复杂且非线性的关系。
- SPN架构由深层的求和节点和乘积节点组成,其中求和节点执行加权混合,乘积节点对变量的联合分布进行分解。
- 该模型使用消息传递机制,在隐藏变量和输出变量上实现高效的边缘推理,即使在深层结构下也能保持精确性。
- 采用稀疏的二元组和三元组因子来处理输入无关的组件,以减少过拟合,模型通过基于梯度的端到端优化进行训练。
- 为进行比较,该方法还评估了在相同框架(HO-HU-CRFs)中使用判别式受限玻尔兹曼机(RBMs)作为SPNs的替代方案。
实验结果
研究问题
- RQ1SPNs能否有效建模序列标注中输入片段与输出标签之间的非线性、高阶依赖关系?
- RQ2将SPNs集成到HO-LC-CRFs中是否能够在保持高模型表达能力的同时,实现精确且高效的推理?
- RQ3基于SPN的HO-LC-CRFs在序列标注基准测试中,与最先进模型(如NHO-LC-CRFs和HO-HU-CRFs)相比,性能如何?
- RQ4与基于标准MLP的高阶因子相比,SPNs在序列模型中在多大程度上减少了过拟合?
主要发现
- SPN-HO-LC-CRF模型在TIMIT数据集上实现了18.2%的音素错误率(PER),优于所有一阶模型,并与最先进方法相当或更优。
- 表现最佳的SPN-HO-LC-CRF配置包含三层隐藏层、每个求和节点两个乘积节点、三个隐藏状态,实现了18.2%的PER。
- HO-HU-CRF模型性能略优,达到17.8%的PER,但SPN-HO-LC-CRFs依然具有竞争力,并具备精确推理的优势。
- 当m=n=1和m=n=2时,输入依赖的SPN-HO-LC-CRFs优于一阶SPN-LC-CRFs及其他基线模型(包括GMM-LC-CRFs和CNFs)。
- 使用稀疏的输入无关二元组和三元组因子有助于减少过拟合,尤其是在使用高阶输入依赖因子时。
- 实验表明,SPN层中使用求和操作略优于使用最大值操作,测试错误率分别为19.6%和19.7% vs. 20.0%(原为19.9%)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。