[论文解读] Multi-Domain Dialogue State Tracking based on State Graph
本文提出 Graph-DST,一种多领域对话状态追踪模型,该模型基于训练数据中的共现模式,构建一个连接领域、槽位和取值的结构化状态图。通过使用关系图卷积网络(R-GCN)编码该图,并将其融合进 Transformer 编码器,模型在保持高效性的同时提升了推理准确率,在 MultiWOZ 2.1 上实现了 53.85% 的最先进联合目标准确率。
We investigate the problem of multi-domain Dialogue State Tracking (DST) with open vocabulary, which aims to extract the state from the dialogue. Existing approaches usually concatenate previous dialogue state with dialogue history as the input to a bi-directional Transformer encoder. They rely on the self-attention mechanism of Transformer to connect tokens in them. However, attention may be paid to spurious connections, leading to wrong inference. In this paper, we propose to construct a dialogue state graph in which domains, slots and values from the previous dialogue state are connected properly. Through training, the graph node and edge embeddings can encode co-occurrence relations between domain-domain, slot-slot and domain-slot, reflecting the strong transition paths in general dialogue. The state graph, encoded with relational-GCN, is fused into the Transformer encoder. Experimental results show that our approach achieves a new state of the art on the task while remaining efficient. It outperforms existing open-vocabulary DST approaches.
研究动机与目标
- 为解决基于注意力机制的模型在开放词汇对话状态追踪中的局限性,这些模型可能因非结构化的标记级注意力而形成虚假连接。
- 通过引入超越局部对话历史的全局、通用对话转换模式(例如领域共现),提升 DST 性能。
- 设计一种结构化、多关系的状态图,从训练数据中编码领域-领域、领域-槽位和槽位-槽位的共现关系。
- 将该图表示集成到基于 Transformer 的编码器中,以增强上下文建模能力,同时保持推理效率。
提出的方法
- 构建一个对话状态图,其中节点代表前一话轮对话状态中的领域、槽位和取值,边代表从训练数据中提取的共现关系。
- 使用关系图卷积网络(R-GCN)编码节点和边的嵌入,捕捉领域、槽位和取值之间的多关系依赖。
- 将图编码的表示与输入序列(对话历史和先前状态)在双向 Transformer 编码器中进行融合。
- 采用端到端的预测-生成框架进行训练,直接从输入和图增强的上下文预测槽位取值。
- 在解码过程中应用可学习的注意力机制,以加权图表示和序列表示的贡献。
- 使用联合损失函数进行优化,以提升联合目标准确率,鼓励所有(领域,槽位)对的一致性预测。
实验结果
研究问题
- RQ1通过结构化状态图编码领域、槽位和取值的共现模式,能否提升开放词汇对话状态追踪性能?
- RQ2与仅依赖局部注意力相比,引入通用对话转换模式(如领域共现)对 DST 性能有何影响?
- RQ3使用关系 GCN 编码多关系图结构,是否能比 Transformer 中的标记级注意力带来更好的泛化能力?
- RQ4状态图对推理效率有何影响?是否能实现低延迟的高效集成?
- RQ5在哪些领域中,基于图的方法能带来最大收益?原因是什么?
主要发现
- Graph-DST 在 MultiWOZ 2.1 测试集上实现了 53.85% 的新最先进联合目标准确率,优于现有开放词汇 DST 方法。
- 与不使用状态图的基线相比,该模型在 Hotel 领域提升了 +3.05%,在 Train 领域提升了 +3.36%。
- 在槽位相关性较高的领域(如酒店星级与免费停车),性能提升最为显著,因为图结构能捕捉隐式的槽位-槽位共现关系。
- 模型保持了高效率,相较于 SOM-DST 仅增加 4ms 延迟,且在 P100 GPU 上每轮平均推理时间为 52ms。
- 错误分析表明,图结构在槽位间无相关性的领域(如 Restaurant)或需要实时值提取的槽位(如出租车出发时间)中效果较弱,表明输入结构存在局限性。
- 与标记级模式图相比,状态图提供了更具信息量的归纳偏置,这一点由其性能增益远超 CSFN-SDT 模式图的 0.42% 提升所证实。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。