[论文解读] Accenture at CheckThat! 2020: If you say so: Post-hoc fact-checking of claims using transformer-based models
本论文提出了一种基于Transformer的后处理事实核查方法,利用在英语和阿拉伯语数据集上微调的RoBERTa和BERT模型,识别并排序值得核查的社会媒体声明。该方法取得了最先进水平的结果,在英语赛道获得第1名(mAP = 0.8064),在阿拉伯语赛道获得第1至第4名(P@30最高达0.7000),并通过回译显著提升了低资源阿拉伯语数据上的性能。
We introduce the strategies used by the Accenture Team for the CLEF2020 CheckThat! Lab, Task 1, on English and Arabic. This shared task evaluated whether a claim in social media text should be professionally fact checked. To a journalist, a statement presented as fact, which would be of interest to a large audience, requires professional fact-checking before dissemination. We utilized BERT and RoBERTa models to identify claims in social media text a professional fact-checker should review, and rank these in priority order for the fact-checker. For the English challenge, we fine-tuned a RoBERTa model and added an extra mean pooling layer and a dropout layer to enhance generalizability to unseen text. For the Arabic task, we fine-tuned Arabic-language BERT models and demonstrate the use of back-translation to amplify the minority class and balance the dataset. The work presented here was scored 1st place in the English track, and 1st, 2nd, 3rd, and 4th place in the Arabic track.
研究动机与目标
- 开发一种机器学习系统,以识别并排序需要专业事实核查的社会媒体声明,从而减轻记者的信息过载负担。
- 通过数据增强技术提升模型泛化能力,应对阿拉伯语低资源NLP挑战。
- 应用预训练Transformer模型(BERT、RoBERTa)进行多语言社交媒体文本中声明的分类与优先级排序。
- 评估回译和预处理策略在提升不平衡阿拉伯语声明检测数据上模型性能方面的有效性。
- 通过构建可靠、可解释且可扩展的事实核查推荐系统,支持领域专家的决策工作流程。
提出的方法
- 在标注了声明核查价值的社会媒体数据集上,对RoBERTa和阿拉伯语BERT模型进行微调。
- 通过添加平均池化层和Dropout,增强英语模型在未见文本上的泛化能力。
- 应用回译(阿拉伯语 → 英语 → 阿拉伯语)对阿拉伯语训练集中少数类进行数据增强,提升模型鲁棒性。
- 评估了多种预处理策略(去除符号点、URL、标点符号、停用词),但未发现性能提升,因此全部舍弃。
- 使用P@k和mAP作为评估指标,衡量在保留测试集上的排序性能。
- 开展内部评估以比较不同模型变体,最终选择表现最佳的配置用于提交。
实验结果
研究问题
- RQ1RoBERTa和BERT模型在极少微调和有限标注数据下,能否有效识别社交媒体文本中的值得核查声明?
- RQ2回译在低资源、不平衡的阿拉伯语声明检测数据集上,如何提升模型性能?
- RQ3各种预处理技术对多语言声明检测中Transformer模型性能有何影响?
- RQ4使用预训练模型进行迁移学习,能否减少事实核查系统对大规模标注数据的需求?
- RQ5通过回译进行数据增强,在不引入标签泄漏的前提下,能在多大程度上缓解阿拉伯语声明检测中的类别不平衡问题?
主要发现
- Accenture团队在英语赛道中以0.8064的平均平均精度(mAP)获得第1名,优于其他参赛作品。
- 在阿拉伯语赛道中,团队分别获得第1、2、3、4名,P@30得分分别为0.7000、0.6750、0.6694和0.6639。
- 回译(阿拉伯语 → 英语 → 阿拉伯语)显著提升了模型性能,使P@30从0.6694(未修改)提升至0.7000(数据增强后)。
- 去除符号点、URL和标点符号等预处理步骤未提升性能,最终被排除。
- 使用回译生成的数据在所有测试技术中提供了最大的性能提升,甚至超过超参数调优和数据平衡方法。
- 尽管训练与测试数据间存在主题差异,该模型在未见测试集上仍表现出强大的泛化能力,尤其在阿拉伯语赛道中表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。