Skip to main content
QUICK REVIEW

[论文解读] Aspect and Opinion Term Extraction for Hotel Reviews using Transfer Learning and Auxiliary Labels

Yosef Ardhito Winatmoko, Ali Akbar Septiandri|arXiv (Cornell University)|Sep 26, 2019
Sentiment Analysis and Opinion Mining参考文献 28被引用 11
一句话总结

该论文提出了一种基于 BERT 的模型,结合条件随机场(CRF)和辅助标签,用于提取印尼语酒店评论中的方面和观点术语。通过利用多语言 BERT 和一种新颖的子词标记辅助标注方案,该方法仅用 2–4 个训练周期即实现了最先进(SOTA)的 F1 分数,显著优于需要 200 个周期的 Bi-LSTM 基线模型。

ABSTRACT

Aspect and opinion term extraction is a critical step in Aspect-Based Sentiment Analysis (ABSA). Our study focuses on evaluating transfer learning using pre-trained BERT (Devlin et al., 2018) to classify tokens from hotel reviews in bahasa Indonesia. The primary challenge is the language informality of the review texts. By utilizing transfer learning from a multilingual model, we achieved up to 2% difference on token level F1-score compared to the state-of-the-art Bi-LSTM model with fewer training epochs (3 vs. 200 epochs). The fine-tuned model clearly outperforms the Bi-LSTM model on the entity level. Furthermore, we propose a method to include CRF with auxiliary labels as an output layer for the BERT-based models. The CRF addition further improves the F1-score for both token and entity level.

研究动机与目标

  • 评估使用多语言 BERT 进行迁移学习在低资源、非正式印尼语文本中进行方面和观点术语抽取的有效性。
  • 解决 BERT 的子词分词机制在基于 CRF 的序列标注任务中破坏标签一致性的问题。
  • 通过为特殊标记和子词引入辅助标签(A, Z, X, Y),提升序列标注性能,以保持 BIO 标注的一致性。
  • 在印尼语酒店评论上,将所提出的 BERT+CRF 模型与强基线 Bi-LSTM 模型在 F1 分数和训练效率方面进行比较。
  • 证明端到端微调 BERT 搭配 CRF 和辅助标签可生成鲁棒且高性能的 ABSA 模型,且仅需极少训练周期。

提出的方法

  • 在 4,000 条印尼语酒店评论上微调多语言 BERT-base(不区分大小写),学习率为 1e-4,权重衰减为 1e-2,批量大小为 32。
  • 在输出层应用 CRF 以强制执行 BIO 标注约束,确保合法的标签转移(例如,I-ASPECT 仅能跟在 B-ASPECT 之后)。
  • 引入四种辅助标签:A([CLS])、Z([SEP])、X(用于属于方面/情感的子词标记)、Y(用于不属于任何目标实体的子词)。
  • 使用 X-ASPECT 和 X-SENTIMENT 标记尾部子词(例如 "##nya" 在 "tempatnya" 中),以保持实体边界在子词分割处的一致性。
  • 使用 PyTorch-CRF 库实现 CRF 层,超参数在 1,000 个样本的验证集上进行调优。
  • 在标记级别任务上训练 BERT+CRF 模型 3 个周期,在实体级别任务上训练 4 个周期;而原始 BERT 模型由于早期过拟合,仅训练了 2 个周期。

实验结果

研究问题

  • RQ1在印尼语酒店评论上微调的多语言 BERT 是否能在方面和观点术语抽取任务中达到与 Bi-LSTM 搭配 CMLA 和双嵌入等专用模型相媲美的性能?
  • RQ2为子词标记引入 CRF 与辅助标签后,对非正式印尼语文本中方面和观点术语抽取的 F1 分数有何影响?
  • RQ3与需要数百个训练周期的模型相比,所提方法在多大程度上减少了训练时间和资源消耗?
  • RQ4辅助标签是否能缓解 BERT 子词分词导致的无效 BIO 序列问题(例如,I-ASPECT 前无 B-ASPECT)?
  • RQ5该模型在标记级别和实体级别分类中的表现如何,特别是在检测完整方面和情感短语方面?

主要发现

  • 使用辅助标签的 BERT+CRF 模型在标记级别取得了 78.4% 的 F1 分数,比 Bi-LSTM 基线最高提升了 2 个百分点的绝对值。
  • 在实体级别,基于 BERT 的模型在方面和情感检测任务中均取得了最高的 F1 分数,超过 Bi-LSTM 模型。
  • 未使用 CRF 的原始 BERT 模型产生了 65 个无效的 BIO 序列(例如,I-ASPECT 前无 B-ASPECT),证明了 CRF 在保证标签一致性方面的必要性。
  • BERT+CRF 模型仅需 3–4 个周期即可收敛,而 Bi-LSTM 模型则需要 200 个周期,显著降低了训练时间和计算成本。
  • 引入 CRF 与辅助标签后,标记级别和实体级别的 F1 分数均提升了最高达 2%,证实其在处理子词分割问题上的有效性。
  • 该模型在训练集中覆盖了测试集唯一词元的 75.4%,表明其在非正式且嘈杂的文本中仍具备强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。