[论文解读] ReINTEL: A Multimodal Data Challenge for Responsible Information Identification on Social Network Sites
本文介绍了 ReINTEL,这是一个针对越南语社交媒体上可靠与不可靠新闻检测的多模态共享任务,采用人工标注的 10,007 条社交媒体帖子数据集,包含文本、视觉和元数据特征。该挑战在私有测试集上取得了 0.9521 的 AUC-ROC 最高分,确立了在低资源环境下使用自然语言处理与计算机视觉技术进行多模态虚假新闻检测的基准。
This paper reports on the ReINTEL Shared Task for Responsible Information Identification on social network sites, which is hosted at the seventh annual workshop on Vietnamese Language and Speech Processing (VLSP 2020). Given a piece of news with respective textual, visual content and metadata, participants are required to classify whether the news is `reliable' or `unreliable'. In order to generate a fair benchmark, we introduce a novel human-annotated dataset of over 10,000 news collected from a social network in Vietnam. All models will be evaluated in terms of AUC-ROC score, a typical evaluation metric for classification. The competition was run on the Codalab platform. Within two months, the challenge has attracted over 60 participants and recorded nearly 1,000 submission entries.
研究动机与目标
- 为应对社交媒体网站(SNSs)上不可靠信息传播日益严重的问题,尤其是在新冠疫情等危机期间。
- 开发一个可靠的基准,用于检测利用多模态数据(文本、图像和元数据)的虚假新闻,特别针对越南语 SNSs。
- 提供一个大规模的人工标注数据集,以支持未来在多模态虚假新闻检测和负责任信息识别方面的研究。
- 在相同数据集上,通过标准化评估框架评估和比较多种机器学习模型。
提出的方法
- 数据集从越南语社交媒体(如 Facebook、Zalo)和越南报纸中收集,涵盖 2020 年 3 月至 6 月期间的帖子,重点关注新冠疫情信息过载期。
- 共由 23 名经过培训的标注员对 10,007 条帖子进行标注,使用五级李克特量表评估可靠性,最终二元标签(0:可靠,1:不可靠)基于共识确定。
- 标注工具包含关于来源可信度、事实准确性及语言得体性的指导准则,确保标注员之间的一致性。
- 参赛者需使用文本、视觉和元数据特征(如点赞数、分享数、评论数)构建模型,将新闻分类为可靠或不可靠。
- 该挑战在 Codalab 上举办,主要评估指标为 AUC-ROC,训练集(8,000 个样本)和测试集(2,000 个未标注样本)分离。
- 模型以 ID 和预测为不可靠的概率的格式进行训练和提交,结果使用 scikit-learn 的 ROC-AUC 实现与真实标签进行评估。
实验结果
研究问题
- RQ1结合文本、图像和元数据的多模态方法在检测越南语社交媒体上不可靠新闻方面的有效性如何?
- RQ2在低资源语言环境下,迁移学习模型(如 phoBERT、RoBERTa、ViT)在新闻可靠性分类中的表现如何?
- RQ3集成方法和特征工程(如 TF-IDF、SVD、元特征)在该分类任务中如何提升 AUC-ROC 分数?
- RQ4在多模态设置中,视觉特征在区分可靠与不可靠新闻方面贡献有多大?
- RQ5在新冠疫情等高风险事件期间,检测越南语 SNS 上虚假信息面临的主要挑战和性能趋势是什么?
主要发现
- 表现最佳的模型在私有测试集上取得了 0.9521 的 AUC-ROC 分数,表明其在多模态虚假新闻检测方面表现强劲。
- 公开测试集的最高 AUC-ROC 得分为 0.9427,表明参赛者模型具有良好的泛化能力。
- 所有参赛模型的平均 AUC-ROC 为 0.8703,表明竞赛中模型性能整体稳定。
- 排名前六名的团队均使用了集成方法,表明模型堆叠可有效提升可靠性检测性能。
- 表现最佳的团队(Kurtosis)结合了 TF-IDF、SVD 和梯度提升树(LightGBM、CatBoost),凸显了传统 NLP 与表格特征工程的价值。
- 仅有 1 支团队(Toyo-Aime)采用了结合 CNN、BERT 和全连接层的多模态方法,表明尽管视觉-语言融合具有潜力,但其实际采用仍有限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。