Skip to main content
QUICK REVIEW

[论文解读] Gradient-Based Adversarial Training on Transformer Networks for Detecting Check-Worthy Factual Claims

Kevin Meng, Damian Jimenez|arXiv (Cornell University)|Feb 18, 2020
Adversarial Robustness in Machine Learning参考文献 34被引用 9
一句话总结

本论文提出首个基于Transformer的对抗性正则化事实性主张检测模型,用于检测值得核查的事实性主张,在ClaimBuster和CLEF2019数据集上实现最先进性能,相比先前模型F1得分提升4.70分。该方法采用基于梯度的对抗性训练,以增强基于BERT架构的事实性主张分类任务中的鲁棒性与泛化能力。

ABSTRACT

We present a study on the efficacy of adversarial training on transformer neural network models, with respect to the task of detecting check-worthy claims. In this work, we introduce the first adversarially-regularized, transformer-based claim spotter model that achieves state-of-the-art results on multiple challenging benchmarks. We obtain a 4.70 point F1-score improvement over current state-of-the-art models on the ClaimBuster Dataset and CLEF2019 Dataset, respectively. In the process, we propose a method to apply adversarial training to transformer models, which has the potential to be generalized to many similar text classification tasks. Along with our results, we are releasing our codebase and manually labeled datasets. We also showcase our models' real world usage via a live public API.

研究动机与目标

  • 通过深度学习提升在大规模文本流中检测值得核查事实性主张的能力。
  • 解决现有主张检测系统中模型鲁棒性与泛化能力不足的挑战。
  • 为自然语言理解任务中的基于Transformer的模型开发一种新型对抗性训练框架。
  • 发布一个公开可访问的高质量数据集与代码库,以支持社区在自动化事实核查领域的研究。
  • 通过提供实时公开API,提升主张检测模型在现实世界中的可部署性。

提出的方法

  • 提出一种专为Transformer模型设计的基于梯度的对抗性训练方法,通过输入扰动提升模型鲁棒性。
  • 在主张检测数据上微调基于BERT的架构,使用在输入嵌入上进行梯度上升生成的对抗性样本。
  • 提出一种数据增强策略,通过扰动输入词元生成对抗性主张,同时保持语义一致性。
  • 采用两阶段训练流程:先在通用NLP任务上进行预训练,再在主张价值分类任务上进行对抗性微调。
  • 使用结合标准交叉熵损失与对抗性损失的损失函数,以优化模型的泛化能力与鲁棒性。
  • 在对抗性训练中应用标签平滑与Dropout,进一步正则化模型并防止过拟合。

实验结果

研究问题

  • RQ1对抗性训练能否提升基于Transformer的模型在主张检测任务中的性能与鲁棒性?
  • RQ2对抗性正则化对低资源或噪声较多的主张数据集的泛化能力有何影响?
  • RQ3经过对抗性训练的Transformer模型在基准主张价值检测数据集上,相较于非对抗性基线模型能多大程度上实现性能超越?
  • RQ4对抗性训练能否缓解事实性主张检测中对同义词替换与语义扰动的脆弱性?
  • RQ5所提出方法在政治辩论与新闻内容等多样化领域中的可扩展性如何?

主要发现

  • 所提出的对抗性训练Transformer模型在ClaimBuster数据集上相比先前最先进模型F1得分提升4.70分。
  • 在CLEF2019基准测试中,模型F1得分为0.5181,优于先前最佳模型CB-BBA,提升0.0604 F1分。
  • 与非对抗性基线相比,该模型在对抗性扰动(包括同义词替换)下表现出更优的鲁棒性。
  • 对抗性训练的使用显著提升了CLEF2019评估中检索与分类任务的mAP与nDCG得分。
  • 该模型在多种评估指标下均保持高精确率与高召回率,表明其在罕见与常见主张类型上均表现均衡。
  • 代码库与人工标注数据集的发布有望加速社区在自动化主张检测领域的研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。