Skip to main content
QUICK REVIEW

[论文解读] Survey of Aspect-based Sentiment Analysis Datasets

Siva Uday Sampreeth Chebolu, Franck Dernoncourt|arXiv (Cornell University)|Apr 11, 2022
Sentiment Analysis and Opinion Mining被引用 8
一句话总结

本综述整理并分析了来自25个以上领域和98种语言的98个公开可用的情感方面分析(ABSA)数据集,全面概述了子任务、标注实践和数据集特征。研究识别出意见短语标注和基于评论的ABSA中的关键挑战,倡导采用标准化、多样化和多语言的数据集,并提出一个由社区驱动的平台,以提升ABSA研究中评估的公平性和模型的鲁棒性。

ABSTRACT

Aspect-based sentiment analysis (ABSA) is a natural language processing problem that requires analyzing user-generated reviews to determine: a) The target entity being reviewed, b) The high-level aspect to which it belongs, and c) The sentiment expressed toward the targets and the aspects. Numerous yet scattered corpora for ABSA make it difficult for researchers to identify corpora best suited for a specific ABSA subtask quickly. This study aims to present a database of corpora that can be used to train and assess autonomous ABSA systems. Additionally, we provide an overview of the major corpora for ABSA and its subtasks and highlight several features that researchers should consider when selecting a corpus. Finally, we discuss the advantages and disadvantages of current collection approaches and make recommendations for future corpora creation. This survey examines 65 publicly available ABSA datasets covering over 25 domains, including 45 English and 20 other languages datasets.

研究动机与目标

  • 为解决ABSA数据集分散且不一致的问题,这些问题是模型训练和评估的障碍。
  • 为研究人员提供一个集中化、可搜索且可扩展的公开ABSA数据集数据库。
  • 分析现有数据收集方法的优势与局限性,并指导未来数据集的创建。
  • 强调意见短语标注的重要性,以及向基于评论的ABSA转变,以实现更全面的情感理解。
  • 倡导标准化、多语言覆盖以及稳健的标注者间一致性,以提升模型泛化能力和评估的公平性。

提出的方法

  • 系统性地审查和整理来自多样化领域和语言的98个公开ABSA数据集。
  • 根据子任务、标注格式、方面粒度(术语与类别)、情感极性标注对数据集进行分类。
  • 在12个子任务上评估数据集性能,包括方面术语抽取(ATE)、方面类别分类(ACC)、目标情感检测(TSD)、意见短语抽取(AOPE),以及联合任务如ASTE和ASQP。
  • 分析较低层级任务(如TSD、ASD)与较高层级联合任务(如ASQP)之间的性能差异,识别出三元组合并中的瓶颈。
  • 创建一个实时的、由社区维护的网站(https://github.com/RiTUAL-UH/ABSA-Datasets-Info),以支持持续的数据集贡献和更新。
  • 使用定量基准比较方法,跨数据集(如SemEval-2014、SemEval-2015、ACOS、rest_acos)评估任务复杂性和模型泛化能力。

实验结果

研究问题

  • RQ1哪些ABSA数据集最适合用于特定子任务(如方面术语抽取或意见短语识别)的模型训练与评估?
  • RQ2不同子任务的性能指标如何变化?为何在孤立任务上表现良好,而在联合任务(如ASQP)上表现较差?
  • RQ3当前数据集收集实践中存在哪些关键局限性,特别是在意见短语标注和基于评论的情感分析方面?
  • RQ4未来ABSA数据集在标准化、多语言覆盖和标注者间一致性方面应如何改进,以增强模型鲁棒性?
  • RQ5社区驱动、可扩展的平台在维护最新、全面且可访问的ABSA数据集仓库方面发挥什么作用?

主要发现

  • ACOS_lap和rest_acos等数据集在方面和目标情感检测(TSD和ASD)方面表现强劲,但在ASTE和ASQP等联合任务中性能显著下降,表明多标注合并存在挑战。
  • 意见短语抽取(AOPE)与其他任务(如TSD或ASD)之间的性能差距,尤其是在SE-15和SE-16等数据集中,表明意见短语标注是ABSA中的主要瓶颈。
  • 尽管在单个任务中实现了较高的标注者间一致性,但将目标、方面、意见和情感对齐为四元组(ASQP)的复杂性导致整体性能下降,凸显了联合抽取的难度。
  • 研究表明,基本任务(如TSD)上的高性能并不能保证在ASQP等综合任务中的成功,强调了对任务间依赖关系建模的改进需求。
  • 意见短语表达更清晰的数据集在AOPE任务中得分更高,但即便如此,ASQP性能仍不理想,表明核心挑战在于准确且一致的联合预测。
  • 综述识别出对标准化、多语言和基于评论的ABSA数据集的迫切需求,尤其是在低资源语言中,以提升模型泛化能力和现实世界适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。