Skip to main content
QUICK REVIEW

[论文解读] Adversarial Domain Adaptation for Duplicate Question Detection

Darsh Shah, Tao Leí|arXiv (Cornell University)|Sep 7, 2018
Topic Modeling参考文献 39被引用 5
一句话总结

本文提出对抗性域自适应(ADA)方法,用于在不同StackExchange论坛之间检测重复问题,通过共享问题编码器与域判别器对齐特征空间。在所有域对上,该方法相较基线模型平均提升5.6%的相对性能,且效果与域之间的n-gram相似度高度相关。

ABSTRACT

We address the problem of detecting duplicate questions in forums, which is an important step towards automating the process of answering new questions. As finding and annotating such potential duplicates manually is very tedious and costly, automatic methods based on machine learning are a viable alternative. However, many forums do not have annotated data, i.e., questions labeled by experts as duplicates, and thus a promising solution is to use domain adaptation from another forum that has such annotations. Here we focus on adversarial domain adaptation, deriving important findings about when it performs well and what properties of the domains are important in this regard. Our experiments with StackExchange data show an average improvement of 5.6% over the best baseline across multiple pairs of domains.

研究动机与目标

  • 解决在缺乏标注训练数据的论坛中检测重复问题的挑战。
  • 通过域自适应,实现从已标注论坛(如StackOverflow)到未标注目标论坛(如Apple、Android)的迁移学习。
  • 探究对抗性域自适应在跨域重复问题检测中何时以及为何有效。
  • 通过在训练中使用枢轴域,评估模型在未见目标域上的泛化能力。
  • 识别预测域自适应成功与否的语言学与统计学特征。

提出的方法

  • 使用共享问题编码器,将源域和目标域的输入问题映射为稠密向量表示。
  • 在最小化重复问题标签分类损失的同时,训练编码器以欺骗域判别器,使其无法区分样本所属的域。
  • 采用基于Wasserstein GAN的对抗损失,相比标准GAN,显著提升了训练稳定性并降低了AUC的方差。
  • 实现两种相似度函数:基于Sigmoid的分类器(使用交叉熵损失)与余弦相似度函数(使用成对铰链损失)。
  • 应用对抗正则化,对齐源域与目标域的潜在表示,减少域偏移。
  • 端到端训练模型,结合分类损失、对抗损失与相似度损失。

实验结果

研究问题

  • RQ1对抗性域自适应在不同StackExchange论坛之间的重复问题检测中效果如何?
  • RQ2哪些源域与目标域的属性可预测该任务中域自适应的成功?
  • RQ3对抗性域自适应能否泛化到训练过程中未见过的目标域?
  • RQ4对抗自适应的性能与直接迁移方法及BM25基线方法相比如何?
  • RQ5域自适应的有效性在多大程度上与域之间的n-gram相似度相关?

主要发现

  • 对抗性域自适应在StackExchange家族的所有源-目标域对中,相较最佳基线模型,平均实现5.6%的相对性能提升。
  • 在AskUbuntu → Android对中,最高提升达14%,表明在相似域上表现优异。
  • 域自适应性能与n-gram相似度正相关:与自适应效果的皮尔逊相关系数分别为0.57(unigrams)、0.80(bigrams)与0.94(trigrams)。
  • 从Quora迁移至其他域时,自适应几乎未带来性能提升,证实域相似度至关重要。
  • 当使用枢轴域(如AskUbuntu)进行对抗训练时,模型可泛化至未见目标域,在Apple与Android上均优于直接迁移。
  • Wasserstein GAN损失显著提升了训练稳定性,相比基于分类的GAN,AUC方差降低了17倍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。