Skip to main content
QUICK REVIEW

[论文解读] Fine-Grained Sentence Functions for Short-Text Conversation

Wei Bi, Jun Gao|arXiv (Cornell University)|Jul 24, 2019
Topic Modeling参考文献 20被引用 4
一句话总结

本文提出了 STC-Sefun,一个大规模短文本对话数据集,包含细粒度的句子功能标注(两级共20种类型),可提升对话系统中的响应生成质量。通过训练分类器以预测句子功能,并将其整合到检索与生成模型中,作者在响应相关性、信息量和流畅性方面均取得显著提升,其中重排序的检索模型在关键指标上优于基线模型与生成模型。

ABSTRACT

Sentence function is an important linguistic feature referring to a user's purpose in uttering a specific sentence. The use of sentence function has shown promising results to improve the performance of conversation models. However, there is no large conversation dataset annotated with sentence functions. In this work, we collect a new Short-Text Conversation dataset with manually annotated SEntence FUNctions (STC-Sefun). Classification models are trained on this dataset to (i) recognize the sentence function of new data in a large corpus of short-text conversations; (ii) estimate a proper sentence function of the response given a test query. We later train conversation models conditioned on the sentence functions, including information retrieval-based and neural generative models. Experimental results demonstrate that the use of sentence functions can help improve the quality of the returned responses.

研究动机与目标

  • 解决缺乏大规模、人工标注的短文本对话数据集且带有句子功能标签的问题。
  • 开发可靠的句子功能分类模型,用于识别话语中的句子功能,并预测给定查询的合适响应句子功能。
  • 研究在检索式与神经生成对话模型中引入句子功能如何提升响应质量。
  • 评估句子功能建模对多种对话系统架构中响应相关性、信息量、流畅性与准确性的影响力。

提出的方法

  • 从短文本对话中人工标注10,000对查询-响应,采用两级句子功能标签:4种子类型(疑问句、陈述句、祈使句、感叹句)与20种子类型(如 Wh-风格疑问句、是/否疑问句)。
  • 训练两个独立的句子功能分类模型:一个用于对未标注数据中的句子功能进行分类,另一个用于根据查询预测目标响应的句子功能。
  • 利用训练好的分类器构建大规模自动标注语料库,以支持对话模型的大规模训练与评估。
  • 通过结合杰卡德相似度与预测目标句子功能的兼容性,使用混合得分对候选响应进行重排序,以增强检索式模型。
  • 通过在句子功能嵌入上进行条件控制,扩展序列到序列与CVAE-based生成模型,SeFun-CVAE中引入类型判别器以更好地解耦潜在空间中的句子功能信息。
  • 使用标准指标评估模型:流畅性、相关性、信息量以及预测句子功能的准确性。

实验结果

研究问题

  • RQ1细粒度的句子功能标注能否提升短文本对话系统中响应的质量?
  • RQ2在大规模短文本对话语料库中,对输入查询与潜在响应的句子功能预测准确度如何?
  • RQ3在检索式与生成式对话模型中,基于预测句子功能进行条件控制,能在多大程度上提升响应的相关性与信息量?
  • RQ4在响应质量与准确性方面,检索式模型与生成式模型中,哪一种架构更受益于引入句子功能信息?

主要发现

  • 重排序的检索模型在流畅性(69.6%)、相关性(74.4%)、信息量(77.2%)与目标句子功能预测准确率(50.5%)方面显著优于检索基线模型(63.4%、68.4%、61.5%、34.3%)。
  • 对于生成模型,C-Seq2seq在整体性能上表现最佳,相关性达58.9%,在第二级句子功能预测上的准确率为37.2%,优于Seq2seq基线及其他变体。
  • SeFun-CVAE模型(包含类型判别器)的句子功能准确率(36.7%)高于基线KgCVAE(33.7%),证明了在潜在空间中显式解耦句子功能的有效性。
  • 尽管流畅性与相关性得分较低,但表现最佳的生成模型(SeFun-CVAE与C-Seq2seq)在句子功能准确率上仍优于检索基线,表明基于句子功能的条件控制可更好地控制响应类型。
  • 重排序的检索模型在所有指标上均持续优于所有生成模型,表明在短文本对话中,句子功能整合在检索式框架中更为有效。
  • 案例研究证实,即使与查询的词项重叠较低,重排序的检索模型仍能生成更连贯且功能适配的响应,这是由于其与目标句子功能的更好对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。