[论文解读] Denoising Bodies to Titles: Retrieving Similar Questions with Recurrent Convolutional Models.
该论文提出一种结合循环神经网络与卷积神经网络的混合模型,采用门控卷积结构将问题正文映射为其语义标题,从而实现语义相似问题的检索。该模型在原始论坛数据上进行端到端预训练,并在有限标注数据上进行微调,相较于信息检索基线模型提升10%,相较于标准神经网络(如CNN和LSTM)提升6%。
Question answering forums are rapidly growing in size with no automated ability to refer to and reuse existing answers. In this paper, we develop a methodology for finding semantically related questions. The task is difficult since 1) key pieces of information are often buried in extraneous detail in the question body and 2) available annotations are scarce and fragmented, driven by participants. We design a novel combination of recurrent and convolutional models (gated convolutions) to effectively map questions to their semantic representations. The models are pre-trained within an encoder-decoder framework (from body to title) on the basis of the entire raw corpus, and fine-tuned discriminatively from limited annotations. Our evaluation demonstrates that our model yields 10\% gain over a standard IR baseline, and 6\% over standard neural network architectures (including CNNs and LSTMs) trained analogously.
研究动机与目标
- 解决在标注数据有限的情况下,从快速增长的问答论坛中检索语义相似问题的挑战。
- 克服从嘈杂、冗长的问题正文中提取关键语义内容的困难。
- 开发一种方法,利用原始论坛语料进行预训练,并利用有限标注数据进行微调。
- 在标准信息检索和神经网络基线模型的基础上,进一步提升问题检索性能。
提出的方法
- 使用门控卷积网络将问题正文编码为密集的语义表征。
- 在编码器-解码器框架下进行预训练,以从完整问题正文重建问题标题。
- 该架构结合循环层与卷积层,以捕捉文本中的序列模式与局部模式。
- 利用真实论坛交互中获得的稀疏、碎片化标注数据进行判别式微调。
- 通过在原始数据上进行端到端训练,学习鲁棒的语义表征,再进行适应性调整。
- 门控卷积通过选择性关注相关输入模式,增强特征学习能力。
实验结果
研究问题
- RQ1神经网络模型能否有效将嘈杂、冗长的问题正文映射到其核心语义标题?
- RQ2在仅拥有有限标注数据的情况下,基于原始论坛数据的预训练在多大程度上能提升检索性能?
- RQ3与标准信息检索和神经网络基线相比,混合循环-卷积架构在问题检索任务中是否表现更优?
- RQ4在低资源设置下,对稀疏标注数据进行微调在多大程度上能提升模型的泛化能力?
主要发现
- 所提出的模型在检索语义相似问题方面,相较于标准信息检索(IR)基线模型,相对性能提升10%。
- 在相同训练条件下,相较于标准神经网络架构(包括CNN和LSTM),其检索准确率提升6%。
- 在完整原始语料上进行预训练显著提升了模型性能,即使标注数据有限。
- 门控卷积与端到端预训练的结合,有效实现了噪声过滤与语义表征学习。
- 在稀疏标注数据上进行微调带来了显著性能提升,证明了该模型在真实论坛数据场景下的适应能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。