[论文解读] Fine-grained Event Categorization with Heterogeneous Graph Convolutional Networks
该论文提出了一种新颖的成对流行度图卷积网络(PP-GCN),用于利用从社交媒体文本和外部知识库构建的异质信息网络(HIN)进行细粒度社交事件分类。通过引入基于知识的元路径实例社交事件相似度(KIES)度量方法以及基于流行度的分类器,该模型在两个真实世界数据集上实现了最先进性能,相较于基线方法在NMI上提升了6%–24%,在事件检测准确率上相较于SE-GCN提升了10%–14%。
Events are happening in real-world and real-time, which can be planned and organized occasions involving multiple people and objects. Social media platforms publish a lot of text messages containing public events with comprehensive topics. However, mining social events is challenging due to the heterogeneous event elements in texts and explicit and implicit social network structures. In this paper, we design an event meta-schema to characterize the semantic relatedness of social events and build an event-based heterogeneous information network (HIN) integrating information from external knowledge base, and propose a novel Pair-wise Popularity Graph Convolutional Network (PP-GCN) based fine-grained social event categorization model. We propose a Knowledgeable meta-paths Instances based social Event Similarity (KIES) between events and build a weighted adjacent matrix as input to the PP-GCN model. Comprehensive experiments on real data collections are conducted to compare various social event detection and clustering tasks. Experimental results demonstrate that our proposed framework outperforms other alternative social event categorization techniques.
研究动机与目标
- 为解决社交媒体中类别数量庞大且各类样本稀疏所导致的细粒度社交事件分类挑战。
- 对人物、地点、时间及实体等异质事件元素,以及显式和隐式社交网络结构进行建模。
- 通过整合外部知识库并学习可解释的元路径权重,提升事件检测与聚类性能。
- 构建一个稳定且可泛化的表示学习框架,防止在低资源事件类别中发生过拟合。
- 通过知识增强的相似度度量(KIES)实现半监督聚类,使其具备跨数据集泛化能力。
提出的方法
- 构建基于事件的异质信息网络(HIN),整合实体、关系以及与外部知识库的链接(例如:'位于'、'属于')。
- 设计一种基于知识的元路径实例社交事件相似度(KIES)度量方法,利用语义与结构关系计算HIN的加权邻接矩阵。
- 提出一种成对流行度图卷积网络(PP-GCN),通过基于流行度的分类器联合学习元路径权重与判别性事件实例表征。
- 将GCN中的标准回归头替换为基于成对事件实例特征的模值比分类器,以提升稳定性和泛化能力。
- 利用学习到的元路径权重与KIES相似度,通过k-means实现半监督聚类,并在数据集之间应用迁移学习。
- 端到端训练模型,采用联合优化事件检测与相似度学习的损失函数,利用标注数据进行监督。
实验结果
研究问题
- RQ1基于知识增强的异质图卷积网络是否能够超越传统基于文本或同质图的方法,在细粒度社交事件分类中取得更优表现?
- RQ2所提出的KIES相似度度量在捕捉社交事件之间语义与结构关系方面的有效性如何?
- RQ3PP-GCN中的成对流行度分类器在稳定性与泛化能力方面是否优于基于角度或距离的分类器?
- RQ4在某一数据集(如腾迅)上学习到的元路径权重在多大程度上可迁移至另一数据集(如微博)以提升聚类性能?
- RQ5所提出的框架是否能够缓解在训练样本稀疏的低资源、细粒度事件类别中的过拟合问题?
主要发现
- PP-GCN在事件检测任务中相较SE-GCN准确率提升10%–14%,当用流行度分类器替换回归头后,准确率进一步提升3%–5%。
- KIES相似度度量优于WMD、mSDA与CCG,在腾迅与微博数据集的半监督事件聚类中,NMI提升6%–24%。
- 将腾迅数据集上学习到的元路径权重迁移至微博数据集,使聚类NMI提升超过2%,而反向迁移效果不佳,表明数据质量与标签丰富度影响元路径学习。
- PP-GCN中的流行度分类器在超过7,000个训练周期内表现出稳定且持续上升的准确率,而基于角度的PA-GCN则出现周期性波动,表明其泛化能力更强且过拟合更少。
- 通过可学习的元路径权重,模型的可解释性得到增强,这些权重反映了不同事件相关关系(如'位于'、'属于')的相对重要性。
- 全面的消融实验表明,KIES相似度与流行度分类器均为模型卓越性能的关键因素,二者对最终结果均有显著贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。