[论文解读] Federated Hierarchical Hybrid Networks for Clickbait Detection
本文提出联邦分层混合网络(FedHHN),一种联邦学习框架,可在不共享原始数据的前提下,联合训练存储在不同参与方的标题与内容的点击诱骗检测模型。通过利用混合神经架构中的标题与内容之间的分层关系,FedHHN 实现了最先进性能,AUC-ROC 为 0.66835,F1 分数为 0.52898,与理想集中式训练设置下的模型表现极为接近。
Online media outlets adopt clickbait techniques to lure readers to click on articles in a bid to expand their reach and subsequently increase revenue through ad monetization. As the adverse effects of clickbait attract more and more attention, researchers have started to explore machine learning techniques to automatically detect clickbaits. Previous work on clickbait detection assumes that all the training data is available locally during training. In many real-world applications, however, training data is generally distributedly stored by different parties (e.g., different parties maintain data with different feature spaces), and the parties cannot share their data with each other due to data privacy issues. It is challenging to build models of high-quality federally for detecting clickbaits effectively without data sharing. In this paper, we propose a federated training framework, which is called federated hierarchical hybrid networks, to build clickbait detection models, where the titles and contents are stored by different parties, whose relationships must be exploited for clickbait detection. We empirically demonstrate that our approach is effective by comparing our approach to the state-of-the-art approaches using datasets from social media.
研究动机与目标
- 解决因隐私限制导致训练数据分散在多个参与方的现实场景中点击诱骗检测的挑战。
- 克服先前模型依赖集中式数据的局限性,该情况在实践中常因数据孤岛而不可行。
- 开发一种联邦学习框架,有效利用来自不同来源的标题与内容特征,而无需共享数据。
- 通过建模标题与其对应文章内容之间的语义关联,提升点击诱骗检测性能,这对识别误导性或模糊的标题至关重要。
- 证明在数据非共享且分布于各参与方的条件下,使用分层混合网络的联邦训练仍可达到与集中式训练相当的性能。
提出的方法
- 提出一种名为点击诱骗联邦学习的联邦训练框架,使模型可在两个参与方(如标题持有方与内容持有方)之间训练,而无需共享原始数据。
- 设计一种分层混合网络(HHN),通过注意力机制和表示向量的拼接,捕捉标题与内容的局部特征及其复杂依赖关系。
- 采用联邦平均(FedAvg)策略聚合来自双方的模型更新,同时保护数据隐私。
- 使用如 TextCNN、TextRNN 或 FastText 等架构分别训练标题与内容的编码器,然后以分层方式融合其表示。
- 在融合表示上应用共享分类器头以预测点击诱骗标签,并通过联邦学习管道反向传播损失。
- 通过允许不同本地模型架构(如不同编码器)同时保持统一全局模型,确保各参与方之间的模型兼容性。
实验结果
研究问题
- RQ1当标题与内容由互不合作的独立参与方分别存储时,联邦学习框架能否有效训练点击诱骗检测模型?
- RQ2与孤立建模相比,建模标题与内容之间的语义关联如何提升点击诱骗检测性能?
- RQ3在数据孤岛约束下训练的联邦模型,能在多大程度上匹配拥有完整数据访问权限的集中式模型的性能?
- RQ4与简单拼接或独立建模相比,标题与内容表示的分层融合是否带来更好的检测效果?
- RQ5所提出的联邦框架能否在标题与内容编码器采用不同神经网络架构时仍保持良好泛化能力?
主要发现
- FedHHN 实现了 0.66835 的 AUC-ROC 和 0.52898 的 F1 分数,优于所有基线联邦模型,甚至超越部分集中式训练模型。
- 在联邦设置下训练的模型(FedHHN)与理想集中式模型(HHN)表现几乎完全一致,AUC-ROC 差异仅为 0.00389,F1 分数差异为 0.00257。
- 仅使用标题的模型比仅使用内容的模型更具信息量,因为仅基于标题训练的模型(如 TextCNN(𝒯))优于仅基于内容训练的模型(如 TextCNN(𝑪))。
- 同时包含标题与内容特征显著提升了性能,证实二者之间的关联对检测误导性标题至关重要。
- 点击诱骗联邦学习实现了非共享数据参与方之间的有效协作,在不违反隐私约束的前提下实现了高质量模型。
- 与 FedCNN、FedRNN 和 FedSAN 等其他联邦模型相比,FedHHN 展现出更优性能,表明分层混合架构在捕捉跨模态依赖关系方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。