[论文解读] A Response Retrieval Approach for Dialogue Using a Multi-Attentive Transformer
该论文提出了一种用于目标导向性多模态对话系统中响应检索的多注意力Transformer模型,通过用户请求和所提及产品来条件化响应。该模型在SIMMC Fashion数据集上的所有检索指标(MRR、R@1、R@5、R@10、平均排名)中取得第二名成绩,通过引入语义分数,其在R@10上相比基线最高提升43.9%,在MRR上最高提升27.7%。
This paper presents our work for the ninth edition of the Dialogue System Technology Challenge (DSTC9). Our solution addresses the track number four: Simulated Interactive MultiModal Conversations. The task consists in providing an algorithm able to simulate a shopping assistant that supports the user with his/her requests. We address the task of response retrieval, that is the task of retrieving the most appropriate agent response from a pool of response candidates. Our approach makes use of a neural architecture based on transformer with a multi-attentive structure that conditions the response of the agent on the request made by the user and on the product the user is referring to. Final experiments on the SIMMC Fashion Dataset show that our approach achieves the second best scores on all the retrieval metrics defined by the organizers. The source code is available at https://github.com/D2KLab/dstc9-SIMMC.
研究动机与目标
- 开发一种用于购物助手场景下情境化、多模态对话的响应检索系统。
- 解决在用户请求和产品目录中特定产品属性基础上对齐响应的挑战。
- 通过将模型条件化于多个上下文输入(用户请求、所提及产品和响应候选)来提升检索性能。
- 在SIMMC Fashion数据集上评估该模型,该数据集是用于交互式、多模态、目标导向性对话的基准数据集。
- 证明多注意力机制在提升响应相关性和检索准确性方面的有效性。
提出的方法
- 使用参数冻结的BERT编码器来编码用户请求和产品属性。
- 采用单层Transformer解码器,包含三个并行注意力头:对生成标记的自注意力、对用户请求的交叉注意力,以及对所提及产品的交叉注意力。
- 解码器同时关注用户请求和产品嵌入,以在相关上下文中条件化响应生成。
- 通过比较候选响应与用户请求及产品属性,计算语义分数,以增强检索准确性。
- 最终响应分数由解码器的交叉注意力分数与语义分数的加权和计算得出。
- 在SIMMC Fashion数据集上通过对比学习目标进行端到端微调,以最大化正确响应的排名。
实验结果
研究问题
- RQ1多注意力Transformer架构是否能在多模态、目标导向性对话设置中有效检索最合适的响应?
- RQ2将响应检索同时基于用户请求和所提及产品进行条件化,如何提升检索性能?
- RQ3基于请求和产品嵌入的语义分数集成对检索指标有何影响?
- RQ4该模型在SIMMC Fashion基准上与强基线及最先进方法相比表现如何?
- RQ5多注意力机制在多大程度上增强了上下文对齐和响应相关性?
主要发现
- 在官方的test-std划分上,该模型在MRR上达到0.390的第二名成绩,相比基线提升27.7%。
- 在test-std集上,该模型在R@1上达到26.7%,相比基线提升22.2%。
- 在test-dev划分上,该模型在引入语义分数后MRR达到0.419,相比无该分数的版本提升2.1%。
- 在test-dev上,该模型在R@5上达到55.9%,在test-std上达到52.1%,显著优于基线。
- 在test-dev上,平均排名指标从基线的27.4降至本模型的13.6,表明正确响应的平均排名显著降低。
- 在两个测试划分上,该模型在所有五个评估指标(MRR、R@1、R@5、R@10、平均排名)中均取得第二名的总体最佳表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。