Skip to main content
QUICK REVIEW

[论文解读] Deep Learning Brasil at ABSAPT 2022: Portuguese Transformer Ensemble Approaches

Juliana Resplande Sant'Anna Gomes, Eduardo Augusto Santos Garcia|arXiv (Cornell University)|Nov 8, 2023
Sentiment Analysis and Opinion Mining被引用 6
一句话总结

该论文在 IberLEF 2022 上通过基于多语言和葡萄牙语专用 Transformer 的集成模型,实现了葡萄牙语方面感知情感分析(ABSAPT)的最先进结果。在方面术语抽取(ATE)任务中,采用在葡萄牙语和多语言数据上微调的 RoBERTa 和 mDeBERTa 模型的集成;在情感倾向抽取(SOE)任务中,使用 PTT5-large 模型的投票集成,两项任务均取得 82.38% 的平衡准确率,达到新的最先进性能。

ABSTRACT

Aspect-based Sentiment Analysis (ABSA) is a task whose objective is to classify the individual sentiment polarity of all entities, called aspects, in a sentence. The task is composed of two subtasks: Aspect Term Extraction (ATE), identify all aspect terms in a sentence; and Sentiment Orientation Extraction (SOE), given a sentence and its aspect terms, the task is to determine the sentiment polarity of each aspect term (positive, negative or neutral). This article presents we present our participation in Aspect-Based Sentiment Analysis in Portuguese (ABSAPT) 2022 at IberLEF 2022. We submitted the best performing systems, achieving new state-of-the-art results on both subtasks.

研究动机与目标

  • 在 IberLEF 2022 上实现葡萄牙语方面感知情感分析(ABSAPT)的最先进性能。
  • 解决低资源葡萄牙语文本中方面术语抽取(ATE)和情感倾向抽取(SOE)的挑战。
  • 利用多语言和葡萄牙语专用预训练 Transformer 模型,提升两个子任务的性能。
  • 探索集成策略和数据增强技术,以缓解类别不平衡并提升泛化能力。

提出的方法

  • 在 ATE 任务中,作者在 BIO 标注的葡萄牙语数据集上微调了 RoBERTa-PT-base 和 mDeBERTa-base 模型,并使用来自 MAMs、Evalita 和 Semeval 的外部多语言数据。
  • 最终的 ATE 模型采用三个表现最佳模型的中位数集成,对每个 token 的标签概率进行聚合。
  • 在 SOE 任务中,最佳表现的系统采用基于 PTT5-large 的条件文本生成方法,通过提示模型为每个方面术语生成情感标签。
  • SOE 集成通过在生成的标签上使用投票策略,结合多个 PTT5-large 模型的预测结果。
  • 在提示 GPT-3 前未对评论进行翻译,使用零样本推理评估少样本能力。
  • 使用包含完整评论和方面术语的评论级输入,而非句子级抽取,以在两项任务中保留上下文信息。
Figure 1: Aspect polarity heat map from top 15 ocorrences.
Figure 1: Aspect polarity heat map from top 15 ocorrences.

实验结果

研究问题

  • RQ1基于多语言和葡萄牙语专用 Transformer 的集成模型是否能在葡萄牙语 ATE 和 SOE 任务中超越单模型基线?
  • RQ2在低资源葡萄牙语 ABSA 中,使用 GPT-3 和 PTT5 等大语言模型的零样本和少样本提示策略效果如何?
  • RQ3与单个模型预测相比,使用 PTT5-large 模型的投票集成是否能提升情感分类性能?
  • RQ4数据不平衡和方面术语分布在多大程度上影响葡萄牙语 ABSA 中的模型泛化能力?
  • RQ5针对 SOE 任务,条件文本生成方法是否能超越传统分类微调方法?

主要发现

  • 最终 ATE 提交结果达到 67.14% 的准确率,优于所有其他团队,在 ABSAPT 2022 基准上创下新 SOTA 记录。
  • SOE 系统达到 82.38% 的平衡准确率、81.80% 的 F1 分数和 81.31% 的精确率,在比赛中排名所有团队首位。
  • RoBERTa-PT-base 和 mDeBERTa-base 模型的集成在多语言数据上训练时,取得了最高的 ATE 性能,F1 得分为 85.9%。
  • PTT5-large 在无外部数据的情况下,在三个测试子集中的两个子集上取得了最佳 SOE 结果,子集 1 的准确率为 86.8%。
  • 零样本 GPT-3 推理达到 80.0% 的准确率和 66.0% 的 F1 分数,尽管未进行微调,仍表现出强大的少样本能力。
  • 使用包含方面术语的完整评论输入,相比句子级抽取,提升了 SOE 性能,因为保留了上下文线索。
Figure 2: The number of occurrences of the 15 most common aspect occurrences in the training dataset.
Figure 2: The number of occurrences of the 15 most common aspect occurrences in the training dataset.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。