[论文解读] MiDAS: Multi-integrated Domain Adaptive Supervision for Fake News Detection
MiDAS 提出了一种用于虚假新闻检测的多集成领域自适应监督框架,通过使用领域不变嵌入和局部利普希茨平滑性,为每个新样本选择最相关的预训练模型。该方法在9个多样化的虚假新闻数据集上实现了最先进性能,通过基于训练数据重叠动态排名模型,相比弱监督基线方法准确率提升超过10%。
COVID-19 related misinformation and fake news, coined an 'infodemic', has dramatically increased over the past few years. This misinformation exhibits concept drift, where the distribution of fake news changes over time, reducing effectiveness of previously trained models for fake news detection. Given a set of fake news models trained on multiple domains, we propose an adaptive decision module to select the best-fit model for a new sample. We propose MiDAS, a multi-domain adaptative approach for fake news detection that ranks relevancy of existing models to new samples. MiDAS contains 2 components: a doman-invariant encoder, and an adaptive model selector. MiDAS integrates multiple pre-trained and fine-tuned models with their training data to create a domain-invariant representation. Then, MiDAS uses local Lipschitz smoothness of the invariant embedding space to estimate each model's relevance to a new sample. Higher ranked models provide predictions, and lower ranked models abstain. We evaluate MiDAS on generalization to drifted data with 9 fake news datasets, each obtained from different domains and modalities. MiDAS achieves new state-of-the-art performance on multi-domain adaptation for out-of-distribution fake news classification.
研究动机与目标
- 解决虚假新闻检测中的概念漂移挑战,即不断演变的错误信息模式会降低模型在时间和领域上的泛化能力。
- 克服单一领域模型在跨领域和分布外设置下的局限性,尤其是在像新冠疫情信息疫情这类随时间演变的主题背景下。
- 开发一个动态决策模块,根据样本训练数据分布的相关性,为每个输入样本选择最适合的模型。
- 通过整合多个微调模型并利用统一的领域不变表示空间,提升早期虚假新闻检测的泛化能力和鲁棒性。
提出的方法
- 使用领域不变编码器将来自多个领域的输入映射到共享的、不变的嵌入空间,以保持跨领域的语义相似性。
- 利用测试样本周围嵌入空间的局部利普希茨平滑性来估计模型相关性——较高的平滑性表明与模型训练数据的对齐度更好。
- 根据估计的平滑性(训练数据重叠的代理指标)对模型进行排序,仅选择排名靠前的模型进行预测,并对排名较低的模型选择性地放弃预测。
- 将预训练和微调模型与其各自的训练数据联合集成,以共同学习领域不变表示并实现跨模型比较。
- 在每个测试样本周围的ε球内应用基于扰动的采样,以估计局部平滑性,使用利普希茨常数L作为模型可靠性的度量。
- 调整最近邻数(m)和ε阈值,以在预测覆盖率和准确率之间取得平衡,消融研究显示鲁棒性与泛化能力之间存在权衡。
实验结果
研究问题
- RQ1如何从一组预训练的、领域特定的虚假新闻检测器中,为一个新出现的、分布外的样本有效选择最相关的模型?
- RQ2在领域不变嵌入空间中的局部利普希茨平滑性能否作为模型相关性和预测准确性的可靠代理?
- RQ3通过共享编码器整合多个领域特定模型,如何提升在漂移的、未见的虚假新闻数据上的泛化能力?
- RQ4在局部平滑性估计中,调整平滑性阈值和邻居数量时,预测覆盖率与准确率之间的权衡关系如何?
- RQ5MiDAS在概念漂移条件下,相较于弱监督和基线领域自适应方法,在多领域虚假新闻检测中能多大程度上实现性能超越?
主要发现
- MiDAS 在涵盖不同领域和模态的9个多样化虚假新闻数据集上实现了最先进性能,证明了其在概念漂移下的强大泛化能力。
- 与弱标签基线相比,该框架在检测准确率上提升了超过10%,尤其在分布外设置下表现显著。
- 使用 m=1(最近邻)时,覆盖率最低(0.03–0.05),但准确率最高(F1 达到 0.97);当 m 增加到 150 时,覆盖率提升至 1.00,但准确率下降(部分数据集 F1 降至 0.57)。
- 消融研究证实,各组件的收敛稳定,完整版 MiDAS 模型在准确率和覆盖率上均优于消融变体。
- 通过调整 m 参数和 ε 阈值,该方法能有效平衡覆盖率与准确率,表明放宽平滑性阈值可使更多模型参与预测,但会以精度下降为代价。
- 在 coaid 数据集上,F1 分数从 m=100 时的 0.73 降至 m=150 时的 0.56,尽管覆盖率仅从 0.98 略增至 1.00,表明过于宽松的阈值会降低性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。