Skip to main content
QUICK REVIEW

[论文解读] MEMD-ABSA: A Multi-Element Multi-Domain Dataset for Aspect-Based Sentiment Analysis

Hongjie Cai, Nan Song|arXiv (Cornell University)|Jun 29, 2023
Sentiment Analysis and Opinion Mining被引用 6
一句话总结

本文提出了MEMD-ABSA,一个大规模、多领域、多元素的方面级情感分析数据集,涵盖五个领域(图书、服装、酒店、餐厅、笔记本电脑),包含近20,000条评论句子和约30,000个显性和隐性方面-类别-观点-情感四元组。在开放领域设置下进行评估时,生成式与非生成式模型在隐性方面和观点抽取任务上均表现出显著性能下降,凸显了该领域仍存在的挑战。

ABSTRACT

Aspect-based sentiment analysis is a long-standing research interest in the field of opinion mining, and in recent years, researchers have gradually shifted their focus from simple ABSA subtasks to end-to-end multi-element ABSA tasks. However, the datasets currently used in the research are limited to individual elements of specific tasks, usually focusing on in-domain settings, ignoring implicit aspects and opinions, and with a small data scale. To address these issues, we propose a large-scale Multi-Element Multi-Domain dataset (MEMD) that covers the four elements across five domains, including nearly 20,000 review sentences and 30,000 quadruples annotated with explicit and implicit aspects and opinions for ABSA research. Meanwhile, we evaluate generative and non-generative baselines on multiple ABSA subtasks under the open domain setting, and the results show that open domain ABSA as well as mining implicit aspects and opinions remain ongoing challenges to be addressed. The datasets are publicly released at \url{https://github.com/NUSTM/MEMD-ABSA}.

研究动机与目标

  • 为解决方面级情感分析(ABSA)领域缺乏大规模、多领域数据集的问题,这些数据集同时包含显性和隐性方面与观点。
  • 克服现有数据集规模小、局限于单一领域(如餐厅、笔记本电脑)且常忽略隐性情感元素的局限性。
  • 在开放领域设置下实现ABSA模型的全面评估,涵盖同领域、跨领域和领域外场景。
  • 提供标准化、高质量的四元组抽取标注指南,涉及方面、类别、观点和情感,包括隐性元素。
  • 在多个子任务上对生成式与非生成式模型进行基准测试,揭示处理隐性方面与观点时持续存在的挑战。

提出的方法

  • 作者通过人工标注五个领域(图书、服装、酒店、餐厅、笔记本电脑)的近20,000条评论句子,构建了新的数据集MEMD-ABSA。
  • 每条句子均标注了四个元素:方面词、方面类别、观点词和情感极性,涵盖显性和隐性实例。
  • 标注过程遵循详细且标准化的指南,以确保一致性和可靠性,并报告了标注者间的一致性度量结果。
  • 该数据集包含约30,000个四元组,显著大于先前的基准(如SemEval-2014/2016)。
  • 作者在开放领域设置下,对多个最先进模型(包括生成式模型,如T5-index、T5-paraphrase,以及非生成式模型)在ASPE、AOPE、AOS、ACS和ACOS等子任务上进行了评估。
  • 评估覆盖同领域、跨领域和领域外设置,以检验模型的泛化能力和鲁棒性。

实验结果

研究问题

  • RQ1当在包含显性和隐性方面与观点的大规模、多领域数据集上进行训练和测试时,模型在不同ABSA子任务(如ASPE、AOPE、AOS、ACS、ACOS)上的性能如何变化?
  • RQ2在多元素ABSA背景下,生成式与非生成式模型在领域外设置下的泛化能力如何?
  • RQ3与仅在显性数据上训练的模型相比,包含隐性方面与观点是否会影响ABSA模型的性能?
  • RQ4T5-based模型(如T5-index、T5-paraphrase)在跨多样化领域提取ACOS四元组方面具有哪些相对优势与劣势?
  • RQ5MEMD-ABSA数据集的规模与多样性如何相较于以往基准,提升ABSA模型的评估质量?

主要发现

  • 所有模型的性能,尤其是在ACOS(方面-类别-观点-情感四元组)任务上,当引入隐性方面与观点时显著下降,表明隐性元素抽取仍是主要挑战。
  • T5-index与T5-paraphrase在各领域均达到接近最优性能,其中T5-index在AOS任务上优于T5-paraphrase,且在ACOS任务上表现相当。
  • 仅在显性样本上训练的模型性能始终低于在同时包含显性和隐性样本的数据集上训练的模型,证实了隐性元素检测的难度。
  • 结果表明,尽管大语言模型取得了进展,开放领域ABSA,尤其是针对隐性方面与观点,依然是一个开放且具有挑战性的问题。
  • MEMD-ABSA数据集使ABSA模型在跨领域评估中更具鲁棒性和泛化能力,揭示了以往小规模、同领域基准所掩盖的性能差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。