Skip to main content
QUICK REVIEW

[论文解读] ImageArg: A Multi-modal Tweet Dataset for Image Persuasiveness Mining

Zhexiong Liu, Meiqi Guo|arXiv (Cornell University)|Sep 14, 2022
Misinformation and Its Impacts被引用 11
一句话总结

本文提出 ImageArg,一个包含1,003条推文的多模态数据集,对图像说服力、图像内容及说服模式(修辞、情感、逻辑)进行了标注。该研究将基于文本的论辩挖掘拓展至视觉领域,通过开发新颖的标注方案并基准化多模态模型,揭示当前模型在图像说服力任务中表现不佳,尤其在识别图像中的文本元素方面存在困难,凸显了对专用图像编码器的迫切需求。

ABSTRACT

The growing interest in developing corpora of persuasive texts has promoted applications in automated systems, e.g., debating and essay scoring systems; however, there is little prior work mining image persuasiveness from an argumentative perspective. To expand persuasiveness mining into a multi-modal realm, we present a multi-modal dataset, ImageArg, consisting of annotations of image persuasiveness in tweets. The annotations are based on a persuasion taxonomy we developed to explore image functionalities and the means of persuasion. We benchmark image persuasiveness tasks on ImageArg using widely-used multi-modal learning methods. The experimental results show that our dataset offers a useful resource for this rich and challenging topic, and there is ample room for modeling improvement.

研究动机与目标

  • 为解决论辩挖掘中关于图像说服力研究的不足,创建一个聚焦社交媒体中视觉说服力的多模态数据集。
  • 将原本为论文设计的基于文本的论辩标注方案扩展至推文中的图像内容与说服模式。
  • 在立场检测、图像说服力分类、图像内容分类及说服模式检测四项关键任务上,建立多模态学习模型的基准。
  • 探究图像模态对说服效果的影响,并识别建模视觉说服力的关键挑战。
  • 为未来开发基于文本输入推荐说服性图像的智能工具提供支持。

提出的方法

  • 开发了一套新颖的说服分类法,用于标注推文中图像的功能与说服模式(修辞、情感、逻辑),将基于文本的论辩标注方案拓展至视觉领域。
  • 由人工标注者对1,003条关于枪支管控的推文进行标注,包括图像说服力评分、图像内容(6种类别)及说服模式,并进行了标注者间一致性分析。
  • 提出一种多模态学习框架,结合文本编码器(如BERT)与图像编码器(如ResNet),用于分类立场、说服力、内容及说服模式。
  • 采用多模态融合策略(如拼接或注意力融合)将文本与视觉表征结合,用于下游分类任务。
  • 通过五折交叉验证评估模型性能,使用AUC与F1分数,并对不同模态组合(T-M、I-M、M-M)进行消融实验。
  • 通过检索特定文本对应的最具有说服力与最无说服力的图像,开展定性分析,揭示OCR与视觉符号理解方面的局限。

实验结果

研究问题

  • RQ1图像的引入在多大程度上提升了推文论点的说服力?这种影响能否通过新标注方案进行定量测量?
  • RQ2不同类型的图像内容(如统计数据、标语、物体)与特定说服模式(修辞、情感、逻辑)之间存在何种相关性?
  • RQ3与仅使用文本或仅使用图像的基线模型相比,多模态模型在图像说服力分类任务中的表现如何?
  • RQ4当前多模态模型在图像说服力任务中的主要瓶颈是什么,特别是图像编码器能力方面的限制?
  • RQ5训练后的模型能否有效检索出与给定推文文本最匹配的说服性图像?哪些类型的图像最可能被选中?

主要发现

  • 仅使用图像的模型(I-M)在大多数任务上的表现均低于仅使用文本的模型(T-M)和多模态模型(M-M),表明通用图像编码器(如ImageNet预训练模型)在理解论辩性图像方面能力不足。
  • T-M模型在立场检测任务中取得了最高的AUC,表明图像内容可能为该任务引入噪声或冗余信息。
  • M-M模型在逻辑(logos)任务中表现最佳,表明多模态融合能有效利用包含统计图表的视觉数据。
  • I-M模型在情感(pathos)任务中表现优于T-M模型,表明视觉情感线索(如面部表情、场景)比仅通过文本更易被视觉编码器捕捉。
  • T-M模型在修辞(ethos)任务中表现最佳,揭示图像编码器难以识别标语或证言等关键文本元素,而这些元素对修辞说服至关重要。
  • 定性分析表明,模型能更有效地检索出包含特定物体(如枪支)的图像,而对包含文本内容(如标语)的图像检索效果较差,凸显了对集成OCR或符号感知图像编码器的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。