[论文解读] Accenture at CheckThat! 2021: Interesting claim identification and ranking with contextually sensitive lexical training data augmentation
该论文提出了一种基于 BERT 和 RoBERTa 的上下文敏感词汇数据增强方法,用于提升多语言社交媒体中事实核查的声明识别与排序性能。通过基于上下文嵌入将关键词替换为语义合适的同义词,该方法显著提升了模型表现——在 CLEF 2021 CheckThat! 实验室的阿拉伯语赛道中取得了最高的 mAP(0.658),由于有效的数据合成以及模型对训练数据量的敏感性,其在所有语言中表现最优。
This paper discusses the approach used by the Accenture Team for CLEF2021 CheckThat! Lab, Task 1, to identify whether a claim made in social media would be interesting to a wide audience and should be fact-checked. Twitter training and test data were provided in English, Arabic, Spanish, Turkish, and Bulgarian. Claims were to be classified (check-worthy/not check-worthy) and ranked in priority order for the fact-checker. Our method used deep neural network transformer models with contextually sensitive lexical augmentation applied on the supplied training datasets to create additional training samples. This augmentation approach improved the performance for all languages. Overall, our architecture and data augmentation pipeline produced the best submitted system for Arabic, and performance scales according to the quantity of provided training data for English, Spanish, Turkish, and Bulgarian. This paper investigates the deep neural network architectures for each language as well as the provided data to examine why the approach worked so effectively for Arabic, and discusses additional data augmentation measures that should could be useful to this problem.
研究动机与目标
- 提升多语言社交媒体中可核查声明的识别与排序性能,以支持自动化事实核查。
- 解决低资源语言(如阿拉伯语、保加利亚语、土耳其语和西班牙语)训练数据不平衡的挑战。
- 通过上下文感知的数据增强提升模型泛化能力与性能,且不依赖外部数据源。
- 探究基于上下文嵌入的词汇增强是否能在低资源 NLP 设置下优于随机或非上下文增强方法。
- 确定在多种语言中平衡性能提升与计算成本的最优增强强度(概率)。
提出的方法
- 该方法利用 BERT 和 RoBERTa 模型,为训练集中可核查声明中的词语生成上下文合适的同义词替换。
- 对于每个声明,模型计算标记级别的嵌入概率,并选择在上下文分布下可能性最高的替换词。
- 超参数 p 控制替换标记的概率;经消融实验后选定 p = 0.1,以在性能与计算成本之间取得最佳平衡。
- 增强后的样本以相同的“可核查”标签追加到原始训练数据中,从而扩大正样本数量。
- 最终模型架构包含一个平均池化层和分类头前的 dropout 层,以防止微调过程中的过拟合。
- 排序通过模型的 softmax 输出完成,利用正负类别概率之差对声明进行优先级排序。
实验结果
研究问题
- RQ1上下文敏感的词汇数据增强是否能在多语言事实核查任务中提升低资源语言的声明检测性能?
- RQ2在不同语言中,模型性能如何随数据增强强度(p)的变化而变化?
- RQ3尽管在所有语言中应用了相似的增强方法,为何该方法在阿拉伯语中表现更优?
- RQ4在低资源 NLP 场景下,基于上下文嵌入的增强是否能优于随机或非上下文增强方法?
- RQ5训练数据的数量与分布如何与数据增强相互作用,进而影响模型性能?
主要发现
- 该上下文敏感的词汇增强方法在开发集上显著提升了五种语言(阿拉伯语、保加利亚语、英语、西班牙语、土耳其语)中“可核查”类别的 F1 分数。
- 该系统在阿拉伯语赛道中取得了 0.658 的最高平均平均精度(mAP),超越了所有其他参赛提交结果。
- 性能随训练数据量的增加而正向提升,接收更多训练样本的语言(如土耳其语和阿拉伯语,各 3,095 个样本)表现出更高的 mAP 值。
- 该模型在保加利亚语中 mAP 达 0.497,在西班牙语中为 0.491,表明在中等资源语言中表现强劲。
- 在英语中性能出现下降(mAP = 0.101),表明当基线数据已相对充足时,该方法的有效性可能降低。
- 消融实验确认,p = 0.1 在性能增益与计算成本之间提供了最佳权衡,更高值则导致收益递减。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。