Skip to main content
QUICK REVIEW

[论文解读] Adobe-MIT submission to the DSTC 4 Spoken Language Understanding pilot task

Franck Dernoncourt, Ji Young Lee|arXiv (Cornell University)|May 7, 2016
Speech and dialogue systems参考文献 17被引用 3
一句话总结

本论文提出了一种用于任务导向对话中语音语言理解的联合系统,采用SVM和逻辑回归进行话语行为识别,使用CRF进行语义标注。在DSTC 4预赛任务中,最佳系统在导游角色的话语行为识别上达到0.67的F1分数,在双方角色的语义标注上达到0.52的F1分数。

ABSTRACT

The Dialog State Tracking Challenge 4 (DSTC 4) proposes several pilot tasks. In this paper, we focus on the spoken language understanding pilot task, which consists of tagging a given utterance with speech acts and semantic slots. We compare different classifiers: the best system obtains 0.52 and 0.67 F1-scores on the test set for speech act recognition for the tourist and the guide respectively, and 0.52 F1-score for semantic tagging for both the guide and the tourist.

研究动机与目标

  • 为应对对话状态追踪挑战4(DSTC 4)中的语音语言理解(SLU)预赛任务,重点聚焦于话语行为识别与语义标注。
  • 开发并比较多种分类模型,以准确识别任务导向对话中的话语行为与语义槽。
  • 评估在SLU中,说话人相关与说话人无关模型以及特征工程策略的有效性。
  • 设计一种基于CRF的语义标注系统,整合语言学特征与本体约束。
  • 通过结构化预测与特征工程,实现在话语行为识别与语义标注上的高性能。

提出的方法

  • 为每个说话人分别训练基于5000个最常见一元组、二元组、三元组及说话人切换特征的SVM,用于话语行为识别。
  • 实现一个使用单一说话人无关分类器的逻辑回归模型,在开发集上性能优于说话人相关模型。
  • 设计一个基于规则的基线系统(系统1),包含约10条手工规则,根据话语上下文预测话语行为。
  • 使用来自7个连续词的特征(包括大小写、字符后缀、大写字母、数字存在性及词性标记)应用条件随机场(CRFs)。
  • 为主要类别、子类别、关系和from-to修饰符分别训练四个独立的CRF,并通过本体约束合并结果。
  • 通过确保子类别、关系和from-to标签仅在主类别本体允许的范围内才被包含,实现预测结果的融合。

实验结果

研究问题

  • RQ1在任务导向对话中,说话人相关与说话人无关模型在话语行为识别性能上如何比较?
  • RQ2在话语行为分类准确率方面,引入话语历史与说话人身份特征的影响是什么?
  • RQ3使用丰富语言学特征的CRF在捕捉语义槽边界与属性方面有多有效?
  • RQ4基于本体约束的CRF融合能否提升语义标注的一致性与准确性?
  • RQ5在训练数据有限的情况下,简单规则基线系统在SLU任务中的贡献是什么?

主要发现

  • 系统5采用逻辑回归与说话人无关模型,在测试集上对游客角色的话语行为识别F1分数达到最高,为0.6117。
  • 系统3基于SVM与说话人相关模型,在导游角色上的F1分数达到0.6740,优于该设置下的其他系统。
  • 语义标注系统在导游角色上F1分数为0.5239,在游客角色上为0.5207,表现出跨角色的一致性能。
  • 使用说话人身份与话语历史特征相比基线系统有所提升,系统5在游客角色上相比系统1的F1分数提高了5.5%。
  • 采用12种特征类型与基于本体的融合策略的CRF语义标注系统,F1分数达到0.52,表明在语义槽检测上具有较强的泛化能力。
  • 基于规则的系统1作为弱基线,游客角色的F1分数仅为0.3252,凸显了学习型模型在此任务中的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。