Skip to main content
QUICK REVIEW

[论文解读] Adversarial Active Learning based Heterogeneous Graph Neural Network for Fake News Detection

Yuxiang Ren, Bo Wang|arXiv (Cornell University)|Jan 27, 2021
Misinformation and Its Impacts参考文献 51被引用 4
一句话总结

本文提出AA-HGNN,一种基于对抗性主动学习的异质图神经网络,用于虚假新闻检测。该方法利用分层注意力机制建模异质信息网络(HINs),并通过对抗性选择器查询高价值训练样本。在低资源设置下,该框架仅需极少标注样本即可实现最先进性能,在真实世界数据集上的F1得分相比文本模型和标准GNN模型最高提升9%。

ABSTRACT

The explosive growth of fake news along with destructive effects on politics, economy, and public safety has increased the demand for fake news detection. Fake news on social media does not exist independently in the form of an article. Many other entities, such as news creators, news subjects, and so on, exist on social media and have relationships with news articles. Different entities and relationships can be modeled as a heterogeneous information network (HIN). In this paper, we attempt to solve the fake news detection problem with the support of a news-oriented HIN. We propose a novel fake news detection framework, namely Adversarial Active Learning-based Heterogeneous Graph Neural Network (AA-HGNN) which employs a novel hierarchical attention mechanism to perform node representation learning in the HIN. AA-HGNN utilizes an active learning framework to enhance learning performance, especially when facing the paucity of labeled data. An adversarial selector will be trained to query high-value candidates for the active learning framework. When the adversarial active learning is completed, AA-HGNN detects fake news by classifying news article nodes. Experiments with two real-world fake news datasets show that our model can outperform text-based models and other graph-based models when using less labeled data benefiting from the adversarial active learning. As a model with generalizability, AA-HGNN also has the ability to be widely used in other node classification-related applications on heterogeneous graphs.

研究动机与目标

  • 为应对虚假新闻检测中受限标注数据的问题,特别是专家标注所面临的高成本与时效性约束。
  • 将虚假新闻检测建模为一种新闻导向的异质信息网络(News-HIN)中的节点分类问题,整合创作者、主题与文章及其关系。
  • 通过将主动学习与对抗训练相结合,选择最具信息量的样本进行标注,从而在数据稀缺条件下提升模型性能。
  • 开发一种可泛化的框架,可应用于异质图上的多种节点分类任务,而不仅限于虚假新闻检测。

提出的方法

  • 模型采用分层图注意力网络(HGAT)通过关注异质网络中不同类型邻居来学习节点表征,从而保留结构与语义上的异质性。
  • 引入对抗性主动学习框架,其中选择器网络与分类器在网络中相互竞争,以识别最不确定或最具信息量的节点用于标注。
  • 选择器采用可微分的查询策略,以最大化期望信息增益,从而实现主动学习流程的端到端训练。
  • 框架联合优化图神经网络的节点分类任务与选择器的查询选择,实现在数据稀缺条件下的高效且有效的数据标注。
  • 将新闻文章的文本特征进行嵌入,并与HIN中的结构表征融合,以增强节点嵌入的丰富性。
  • 模型通过在标注节点上使用交叉熵损失进行端到端训练,主动学习循环通过高价值查询迭代扩展训练集。

实验结果

研究问题

  • RQ1具有分层注意力机制的异质图神经网络能否有效建模虚假新闻检测中多类型实体与关系?
  • RQ2在虚假新闻检测中,当标注数据稀缺时,对抗性主动学习如何提升模型性能?
  • RQ3所提出的对抗性选择器是否在选择信息量丰富的样本方面优于启发式查询策略(如基于熵或随机选择)?
  • RQ4HIN与主动学习的结合在多大程度上可减少所需标注样本数量,同时保持或提升检测准确率?
  • RQ5所提出的框架在虚假新闻检测之外,能否泛化到异质图上的其他节点分类任务?

主要发现

  • AA-HGNN在虚假新闻检测中优于仅使用文本的模型和标准GNN(如GCN、GAT),当仅使用1,200个标注节点训练时,F1得分比基线模型高9%(后者需2,800个标注节点)。
  • 对抗性主动学习策略显著提升性能:当使用2,800个训练节点时,AA-HGNN相比未使用主动学习的同一模型,性能提升9%。
  • 对抗性选择器始终能查询到质量更高的样本,相较于基于熵或随机选择的策略,其在所有查询批次中均表现出更优且更稳定的性能增益。
  • 基于HGAT的模型在News-HIN上优于同质GNN(GCN、GAT),例如GCN在PolitiFact数据集上达到0.9688的精确率,但仅0.0246的召回率,表明其对虚假新闻的检测能力极差。
  • AA-HGNN在低数据比例(如训练数据的20%)下仍保持强性能,而其他模型则无法泛化,表明其在数据稀缺条件下具有强大鲁棒性。
  • 由于其架构与训练范式,该模型在异质图上的其他节点分类任务中也表现出良好泛化能力,表明其在虚假新闻检测之外具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。