Skip to main content
QUICK REVIEW

[论文解读] SANCL: Multimodal Review Helpfulness Prediction with Selective Attention and Natural Contrastive Learning

Wei Han, Hui Chen|arXiv (Cornell University)|Sep 12, 2022
Sentiment Analysis and Opinion Mining被引用 8
一句话总结

该论文提出SANCL,一种用于多模态评论有用性预测的新框架,结合基于探测的选通注意力机制与自然对比学习,以提升表征学习效果。通过利用可学习探测掩码聚焦关键句子,并借助对比学习利用数据内在相关性,SANCL在三个基准数据集上实现了最先进性能,同时显著降低显存占用。

ABSTRACT

With the boom of e-commerce, Multimodal Review Helpfulness Prediction (MRHP), which aims to sort product reviews according to the predicted helpfulness scores has become a research hotspot. Previous work on this task focuses on attention-based modality fusion, information integration, and relation modeling, which primarily exposes the following drawbacks: 1) the model may fail to capture the really essential information due to its indiscriminate attention formulation; 2) lack appropriate modeling methods that take full advantage of correlation among provided data. In this paper, we propose SANCL: Selective Attention and Natural Contrastive Learning for MRHP. SANCL adopts a probe-based strategy to enforce high attention weights on the regions of greater significance. It also constructs a contrastive learning framework based on natural matching properties in the dataset. Experimental results on two benchmark datasets with three categories show that SANCL achieves state-of-the-art baseline performance with lower memory consumption.

研究动机与目标

  • 为解决多模态评论有用性预测(MRHP)中无差别注意力机制的局限性,后者无法聚焦于任务关键内容。
  • 通过利用文本、图像与产品描述模态之间的自然相关性,改进多模态表征学习。
  • 在保持或提升预测性能的同时,降低MRHP任务中的显存消耗。
  • 开发一种通过选择性注意力与对比学习提升模型可解释性与鲁棒性的框架。
  • 在真实电商评论数据集中验证基于探测的注意力与多领域对比学习的有效性。

提出的方法

  • 引入基于探测的选择性注意力机制,其中可学习掩码用于突出显示评论与产品文本中语义重要的句子,以优化注意力权重。
  • 利用探测掩码重新归一化注意力分数并指导特征池化,确保对信息量更高的内容给予更高关注。
  • 设计基于数据自然匹配特性的多领域对比学习框架,采用CPC(对比预测编码)模型优化表征。
  • 定义两个领域:一个用于图像-评论对,另一个用于产品-评论对,各自使用投影表征计算对比损失。
  • 通过在各领域间最小化对比损失,增强相关模态间的语义对齐,提升下游预测性能。
  • 模型联合优化主MRHP任务与辅助对比损失,实现在计算开销极低的前提下提升表征学习效果。

实验结果

研究问题

  • RQ1基于探测的选择性注意力机制是否能提升对评论中关键句子的关注,从而改善有用性预测?
  • RQ2通过对比学习引入自然数据相关性是否能增强MRHP任务中的多模态表征学习?
  • RQ3所提出的SANCL框架是否能在降低显存消耗的同时实现最先进性能,相较现有模型?
  • RQ4选择性注意力与对比学习这两个独立组件对整体性能提升的贡献分别是什么?
  • RQ5该模型对评论中的噪声或无关内容是否具备鲁棒性?在多样化电商领域中是否能保持高性能?

主要发现

  • SANCL在三个不同电商类别的基准数据集上均达到最先进性能,其中在Electronics数据集上的MAP得分为56.19。
  • 在Amazon-MRHP Home & Kitchen数据集上,训练时平均显存占用降低至2.4GB,相比MCR基线(13.7GB)减少4.7倍。
  • 消融实验表明,若移除探测掩码或可学习的β参数,性能会下降,证实选择性注意力在聚焦关键内容方面的重要性。
  • 对比学习组件贡献显著:若移除$cpc_{ii}$或$cpc_{pr}$,性能均出现下降,若两者同时移除,性能下降最为严重。
  • 在案例研究中,SANCL正确预测了一则评论的有用性得分为4.53,而MCR模型完全失败(预测得分为-1.08),表明其具备更强鲁棒性。
  • 在真实示例中,模型取得高CPC得分($cpc_{ii}=0.82$,$cpc_{pr}^{t}=0.76$),表明图像与文本间具有强语义对齐,支持准确预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。