[论文解读] Contextual Semantic Parsing for Multilingual Task-Oriented Dialogues
该论文提出了一种多语言对话状态追踪框架,利用神经机器翻译结合槽值对齐技术,自动创建高质量、低资源语言数据集,无需人工标注。通过结合仅编码最近话语和当前信念状态的上下文语义解析模型(BART-CSP),减少翻译错误的累积,实现在多语言基准测试(包括RiSAWOZ、CrossWOZ和MultiWOZ-ZH)上联合目标准确率11–52.5%的最先进性能提升。
Robust state tracking for task-oriented dialogue systems currently remains restricted to a few popular languages. This paper shows that given a large-scale dialogue data set in one language, we can automatically produce an effective semantic parser for other languages using machine translation. We propose automatic translation of dialogue datasets with alignment to ensure faithful translation of slot values and eliminate costly human supervision used in previous benchmarks. We also propose a new contextual semantic parsing model, which encodes the formal slots and values, and only the last agent and user utterances. We show that the succinct representation reduces the compounding effect of translation errors, without harming the accuracy in practice. We evaluate our approach on several dialogue state tracking benchmarks. On RiSAWOZ, CrossWOZ, CrossWOZ-EN, and MultiWOZ-ZH datasets we improve the state of the art by 11%, 17%, 20%, and 0.3% in joint goal accuracy. We present a comprehensive error analysis for all three datasets showing erroneous annotations can lead to misguided judgments on the quality of the model. Finally, we present RiSAWOZ English and German datasets, created using our translation methodology. On these datasets, accuracy is within 11% of the original showing that high-accuracy multilingual dialogue datasets are possible without relying on expensive human annotations. We release our datasets and software open source.
研究动机与目标
- 在无需昂贵人工标注数据集的情况下,实现低资源语言的高精度对话状态追踪。
- 通过仅限制输入上下文为最近话语和当前信念状态,缓解多语言对话状态追踪中翻译错误的累积效应。
- 开发一种可扩展的自动化流水线,利用神经机器翻译结合槽值对齐技术,创建多语言对话数据集。
- 评估所提方法在多语言基准测试中的鲁棒性,并分析可能误导模型评估的标注错误。
- 发布开源工具和数据集(RiSAWOZ-EN和RiSAWOZ-DE),以促进未来多语言任务导向对话的研究。
提出的方法
- 使用神经机器翻译技术,将现有对话数据集(如RiSAWOZ)自动翻译为目标语言,引入一种新颖的对齐机制以保持槽值的保真度。
- 应用槽值对齐模型,将源语言的槽和值映射到目标语言中的正确翻译,减少关键实体的误译。
- 设计一种基于BART的上下文语义解析(CSP)模型,仅编码当前信念状态以及最近的用户和代理话语,省略完整对话历史。
- 使用序列到序列Transformer架构(BART)在翻译后的数据集上微调,以预测槽值对,利用预训练语言理解能力实现更好的泛化性能。
- 应用一种损失函数,优化联合目标准确率,聚焦于同时正确预测所有槽值对。
- 在包括RiSAWOZ、CrossWOZ、MultiWOZ-ZH以及新创建的RiSAWOZ-EN-auto和RiSAWOZ-DE-auto数据集在内的多语言基准上评估模型。
实验结果
研究问题
- RQ1无需人工后期编辑,仅通过自动机器翻译结合槽值对齐,能否生成高质量的多语言对话数据集?
- RQ2仅将输入上下文限制为最近话语和当前信念状态,是否能减少对话状态追踪中翻译错误的累积?
- RQ3在训练数据为自动翻译的多语言场景下,上下文语义解析模型是否能优于完整历史模型?
- RQ4现有基准中存在标注错误如何影响对话状态追踪模型的评估?
- RQ5在自动翻译数据上训练的多语言对话系统,其性能在多大程度上可与人工标注基线相媲美?
主要发现
- 所提出的对齐方法在RiSAWOZ上的联合目标准确率相比非对齐翻译提升了45.6%,消除了对昂贵人工后期编辑的需求。
- BART-CSP模型在RiSAWOZ上实现了10.7%的联合目标准确率提升,在CrossWOZ上实现了17%的提升,优于先前最先进模型。
- 在自动翻译的数据集(RiSAWOZ-EN-auto和RiSAWOZ-DE-auto)上,BART-CSP分别实现了32.4%和52.5%的联合目标准确率提升,表明对翻译噪声具有强大鲁棒性。
- 该模型在新创建的RiSAWOZ-EN和RiSAWOZ-DE数据集上的表现与原始英文数据集相比仅相差11%以内,表明零样本多语言迁移具有高度保真度。
- 错误分析显示,CrossWOZ中33%的误标注是遗漏了“Best for crowd”槽,表明标注不一致性可能误导模型评估。
- 该模型在逻辑推理任务(如价格范围扩展,例如将100–150扩展为80–150)上表现不佳,即使代理回复中隐含了相关信息,也常无法推断出新范围。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。