Skip to main content
QUICK REVIEW

[论文解读] Reasoning Implicit Sentiment with Chain-of-Thought Prompting

Hao Fei, Bobo Li|arXiv (Cornell University)|May 18, 2023
Sentiment Analysis and Opinion Mining被引用 4
一句话总结

本文提出 ThoR,一种三跳思维链(chain-of-thought)提示框架,通过依次推理细粒度方面、潜在观点和最终情感极性,提升隐式情感分析(ISA)性能。通过利用具备结构化思维链提示和自一致性机制的大语言模型(LLMs),ThoR 在使用 GPT-3(175B)的零样本 ISA 任务中,相较基线模型实现 51.10% 的 F1 分数提升,显著优于先前方法。

ABSTRACT

While sentiment analysis systems try to determine the sentiment polarities of given targets based on the key opinion expressions in input texts, in implicit sentiment analysis (ISA) the opinion cues come in an implicit and obscure manner. Thus detecting implicit sentiment requires the common-sense and multi-hop reasoning ability to infer the latent intent of opinion. Inspired by the recent chain-of-thought (CoT) idea, in this work we introduce a Three-hop Reasoning (THOR) CoT framework to mimic the human-like reasoning process for ISA. We design a three-step prompting principle for THOR to step-by-step induce the implicit aspect, opinion, and finally the sentiment polarity. Our THOR+Flan-T5 (11B) pushes the state-of-the-art (SoTA) by over 6% F1 on supervised setup. More strikingly, THOR+GPT3 (175B) boosts the SoTA by over 50% F1 on zero-shot setting. Our code is open at https://github.com/scofield7419/THOR-ISA.

研究动机与目标

  • 为解决隐式情感分析(ISA)中的挑战,即观点线索缺失或模糊,需依赖常识和多跳推理。
  • 通过模仿人类逐步推理的方式,提升 ISA 中情感预测的准确性。
  • 将思维链(CoT)提示范式扩展至情感分析领域,尤其针对隐式情感检测任务。
  • 证明使用 LLM 的结构化、渐进式推理显著优于零样本和有监督设置下的直接预测。

提出的方法

  • 设计一个三步提示框架,首先推断目标的细粒度方面,然后推断潜在观点,最后确定情感极性。
  • 实施自一致性机制,通过在多条推理路径中选择投票一致性高的候选答案,提升推理可靠性。
  • 引入推理修正方法用于有监督微调,将中间推理输出作为输入以预测最终标签,由真实标签进行引导。
  • 采用大语言模型(LLMs)如 Flan-T5(11B)和 GPT-3(175B)作为骨干模型,利用其世界知识和推理能力。
  • 应用 CoT 提示以激发中间推理步骤,使模型成为多跳推理者而非直接标签预测器。
  • 将框架集成至零样本和有监督微调设置中,以评估泛化能力和性能提升。

实验结果

研究问题

  • RQ1思维链提示能否通过在 LLM 中启用逐步推理,有效提升隐式情感分析性能?
  • RQ2与直接分类相比,结构化的三跳推理(方面 → 观点 → 极性)如何提升情感预测性能?
  • RQ3在零样本和有监督设置下,模型规模在多大程度上放大 ThoR 框架的性能增益?
  • RQ4推理路径中的自一致性如何提升鲁棒性并降低隐式情感检测中的错误率?
  • RQ5ThoR 的主要失败模式是什么?这些失败模式在零样本和微调设置下有何不同?

主要发现

  • ThoR + Flan-T5(11B)在有监督设置下相较最佳基线实现超过 6% 的 F1 分数提升。
  • ThoR + GPT-3(175B)在零样本设置下相较基线实现 51.10% 的相对 F1 分数提升,展现出强大的泛化能力。
  • 当微调后,零样本 ThoR 使用 Flan-T5-11B 的错误率从 48.27% 降至 12.79%,表明监督对推理质量有显著提升作用。
  • 失败模式分析显示,无监督 GPT-3 的错误主要源于噪声数据标注,而微调后的 T5 模型则更易学习到虚假相关性。
  • ThoR 的性能增益在更大模型中更为显著,证实其有效性与大规模 LLM 的涌现推理能力密切相关。
  • ThoR 是思维链提示在隐式情感分析领域中的首次成功应用,在零样本和有监督设置下均建立了新的 SOTA 水准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。