Skip to main content
QUICK REVIEW

[论文解读] Learning Matching Models with Weak Supervision for Response Selection in Retrieval-based Chatbots

Yu Wu, Wei Wu|arXiv (Cornell University)|May 7, 2018
Topic Modeling参考文献 19被引用 6
一句话总结

本文提出一种弱监督学习方法,利用预训练的序列到序列(Seq2Seq)模型作为弱标注器,为未标注的响应候选生成软匹配分数,从而在检索式聊天机器人中提升响应选择模型的训练效果。该方法通过利用真实存在的困难负样本和软监督,显著提升了公开基准上的性能,优于标准的随机负采样基线。

ABSTRACT

We propose a method that can leverage unlabeled data to learn a matching model for response selection in retrieval-based chatbots. The method employs a sequence-to-sequence architecture (Seq2Seq) model as a weak annotator to judge the matching degree of unlabeled pairs, and then performs learning with both the weak signals and the unlabeled data. Experimental results on two public data sets indicate that matching models get significant improvements when they are learned with the proposed method.

研究动机与目标

  • 为解决响应选择中随机负采样带来的局限性,该方法可减少噪声性假负样本并避免决策边界扭曲。
  • 在标注数据稀缺的情况下,通过利用从索引中检索到的未标注响应候选,提升匹配模型的学习效果。
  • 通过引入语义多样且具有挑战性的困难负样本,模拟真实世界的检索场景。
  • 通过使用预训练Seq2Seq模型生成的软匹配分数作为弱监督,提升模型的鲁棒性和泛化能力。
  • 证明弱监督结合Seq2Seq模型可带来响应选择性能的统计显著提升。

提出的方法

  • 在大规模无标注的人机对话数据上预训练一个Seq2Seq模型,作为弱标注器,为未标注的输入-响应对分配软匹配分数。
  • 通过从预构建的索引中检索响应候选,构建未标注数据,以模拟真实的检索场景。
  • 利用Seq2Seq模型生成的弱监督信号(软分数)通过交叉熵损失函数训练匹配模型,替代传统的硬零一标签。
  • 该方法采用教师-学生框架,使Seq2Seq模型将人类对话中的知识迁移至匹配模型。
  • 训练数据包含真实正样本(人工响应)和多样化的负样本候选(来自检索),包括困难负样本。
  • 该方法可兼容任何神经匹配模型架构,如LSTM、CNN、BiLSTM或SMN。

实验结果

研究问题

  • RQ1当标注数据有限时,来自预训练Seq2Seq模型的弱监督是否能提升响应选择性能?
  • RQ2与硬二值标签相比,使用软匹配分数是否能带来更好的响应选择模型决策边界?
  • RQ3通过包含困难负样本的检索式未标注响应候选进行训练,是否能提升模型的鲁棒性和泛化能力?
  • RQ4性能提升是源于弱监督信号,还是数据构建策略,或两者兼有?
  • RQ5检索到的响应候选数量如何影响匹配模型的学习效果?

主要发现

  • 所提方法在多种匹配模型上显著提升了响应选择性能,在STC数据集上P@1最高提升4.5%,在Douban数据集上提升3.9%。
  • 使用弱监督微调的SMN模型(SMN+WS)在Douban数据集上达到P@1为0.421,相比基线SMN相对提升3.9%。
  • 在所有指标上,该方法均优于随机负采样基线,且在两个数据集上均达到统计显著性提升(p < 0.01)。
  • 消融实验证实,弱监督信号和构建包含困难负样本的真实训练数据两者均对性能提升至关重要。
  • 将响应候选数量从2增加到20,性能持续提升,STC数据集上LSTM的P@1从0.603提升至0.616。
  • 对Seq2Seq弱标注器进行迭代微调并未提升匹配模型性能,表明当前弱信号已足够有效,且难以通过强化学习进一步优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。