[论文解读] Matching Article Pairs with Graphical Decomposition and Convolutions
本文提出了一种新颖的方法,通过将长篇新闻文章建模为概念交互图(CIG),实现文章匹配。其中,概念作为顶点,句子根据共享概念进行分组。该方法利用图卷积网络(GCNs)在共现概念上聚合局部匹配信号,在一个包含60,000对文章的新基准数据集上实现了SOTA性能,准确率提升了23.09%。
Identifying the relationship between two articles, e.g., whether two articles published from different sources describe the same breaking news, is critical to many document understanding tasks. Existing approaches for modeling and matching sentence pairs do not perform well in matching longer documents, which embody more complex interactions between the enclosed entities than a sentence does. To model article pairs, we propose the Concept Interaction Graph to represent an article as a graph of concepts. We then match a pair of articles by comparing the sentences that enclose the same concept vertex through a series of encoding techniques, and aggregate the matching signals through a graph convolutional network. To facilitate the evaluation of long article matching, we have created two datasets, each consisting of about 30K pairs of breaking news articles covering diverse topics in the open domain. Extensive evaluations of the proposed methods on the two datasets demonstrate significant improvements over a wide range of state-of-the-art methods for natural language matching.
研究动机与目标
- 为解决描述同一事件但用词和结构各异的长篇新闻文章匹配问题。
- 克服现有句子对匹配模型在长文档中难以捕捉复杂实体与事件交互的局限性。
- 提出一种图形化分解方法,实现在文章间以概念为锚点的局部化匹配。
- 构建并发布两个大规模、专业标注的开放领域长文档匹配数据集。
- 证明基于图的建模方法(使用GCNs)在准确率上显著优于基于词项与深度学习的方法。
提出的方法
- 通过提取关键词并基于共现与语义相似度将它们聚类为概念顶点,构建概念交互图(CIG)。
- 根据关键词重叠将句子分配至概念顶点,为每个概念形成局部句子组。
- 根据语义或句法交互强度计算概念顶点之间的加权边。
- 应用多种编码技术(神经网络与词项方法)为两篇文章中每个共现概念生成局部匹配向量。
- 利用图卷积网络(GCNs)在整张CIG上聚合局部匹配信号,捕捉全局结构依赖关系。
- 采用分而治之策略:按概念局部匹配,再通过GCN层全局聚合,生成最终分类结果。
实验结果
研究问题
- RQ1与序列建模相比,将长文章图形化分解为基于概念的子单元,是否能提升匹配性能?
- RQ2图卷积网络在聚合文章对中多个概念的局部匹配信号方面,效果如何?
- RQ3基于概念锚定的比较在长文匹配中,是否显著优于端到端神经网络或词项方法?
- RQ4为长文档匹配构建的新大规模、专业标注数据集,能否支持可靠评估与基准测试?
- RQ5所提出方法在开放领域新闻中,是否能在多样化主题与媒体来源上实现良好泛化?
主要发现
- 在首个30,000对文章的数据集中,该方法相比SOTA方法实现了17.31%的准确率绝对提升。
- 在第二个30,000对文章的数据集中,该方法实现了23.09%的准确率绝对提升,显著优于所有基线模型。
- 使用概念交互图能够比序列RNN或注意力机制模型更有效地建模长文档中复杂的实体与事件交互。
- 图卷积网络对性能至关重要,因其能以保留全局结构上下文的方式聚合跨概念的局部匹配信号。
- 创建并发布包含60,000对文章的两个新数据集,为未来长文档匹配研究提供了宝贵基准。
- 该方法在多样化主题与媒体来源上具有良好的泛化能力,两个数据集上均表现出一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。