Skip to main content
QUICK REVIEW

[论文解读] "I'd Like to Have an Argument, Please": Argumentative Reasoning in Large Language Models

Adrian de Wynter, Tangming Yuan|arXiv (Cornell University)|Sep 29, 2023
Topic Modeling被引用 4
一句话总结

本文通过论据挖掘(AM)和论据对提取(APE)任务,评估了 GPT-3 和 GPT-4 在不同输入与输出表示形式(从具体文本到抽象符号格式,如 AMR 图)下的论辩推理能力。研究发现,模型性能对表示设计极为敏感,最优示例数为 4–5 个;然而,思维链(CoT)提示可缓解这种敏感性,并消除‘示例效应’,表明 CoT 在复杂推理场景中增强了鲁棒性。

ABSTRACT

We evaluate two large language models (LLMs) ability to perform argumentative reasoning. We experiment with argument mining (AM) and argument pair extraction (APE), and evaluate the LLMs' ability to recognize arguments under progressively more abstract input and output (I/O) representations (e.g., arbitrary label sets, graphs, etc.). Unlike the well-known evaluation of prompt phrasings, abstraction evaluation retains the prompt's phrasing but tests reasoning capabilities. We find that scoring-wise the LLMs match or surpass the SOTA in AM and APE, and under certain I/O abstractions LLMs perform well, even beating chain-of-thought--we call this symbolic prompting. However, statistical analysis on the LLMs outputs when subject to small, yet still human-readable, alterations in the I/O representations (e.g., asking for BIO tags as opposed to line numbers) showed that the models are not performing reasoning. This suggests that LLM applications to some tasks, such as data labelling and paper reviewing, must be done with care.

研究动机与目标

  • 评估类似 GPT-3 和 GPT-4 的大语言模型(LLMs)在真实应用场景(如数据标注和同行评审)中的论辩推理能力。
  • 研究从具体文本到抽象符号格式(如 AMR 图)的输入与输出表示形式如何影响 LLM 在论据挖掘(AM)和论据对提取(APE)任务中的性能。
  • 检查示例数量对推理性能的影响,识别潜在的‘示例效应’,即过多示例会降低性能。
  • 评估思维链(CoT)提示是否能缓解因输入/输出表示设计不当或示例过多导致的性能下降。

提出的方法

  • 本研究使用 Review-Rebuttal Submission-v2(RRv2)数据集,包含 4,764 对评审-反驳文本,已标注论据片段及论据-反驳对齐关系。
  • 在多种输入与输出表示设置下进行实验:具体形式(原始文本)、符号形式(任意标签)和抽象形式(AMR 图),以测试推理抽象化水平。
  • 使用 AM(BIO 标注)和 APE(二值矩阵对齐)的标准指标评估性能,并在不同上下文示例数量(1 至 40 个)下分析结果。
  • 通过使用分步推理模板(如“让我们一步步思考”)对模型进行思维链(CoT)提示,与非 CoT 基线进行性能对比。
  • 分析聚焦于表示设计与示例数量对模型准确率的影响,对不同设置下的性能趋势进行统计评估。
  • 本研究评估了 GPT-3 和 GPT-4,特别关注 CoT 在 AMR 等抽象表示中的表现,但因 token 限制,未能完成完整的 CoT-AMR 评估。

实验结果

研究问题

  • RQ1从具体文本到抽象 AMR 图等不同输入与输出表示形式,如何影响 LLM 在 AM 和 APE 任务中的论辩推理性能?
  • RQ2上下文示例数量是否对推理性能产生系统性影响?若存在,是否存在最优数量?
  • RQ3思维链(CoT)提示在多大程度上缓解了因输入/输出表示不佳或示例过多导致的性能下降?
  • RQ4当强制模型使用符号或抽象表示时,其推理行为如何变化?这是否影响其可靠性?

主要发现

  • GPT-4 在 APE 任务中达到最先进(SOTA)性能,在 AM 任务中接近 SOTA,表明其在论辩推理方面具备强大的基线能力。
  • 当输入表示过于抽象(如 AMR 图)时,性能显著下降;但当输出表示为符号形式(如标签矩阵)时,性能保持相对稳定,尽管绝对性能在后者中有所下降。
  • 观察到‘示例效应’:性能在 4–5 个示例时达到峰值,随后随示例数量增加(最多 40 个)线性下降,表明过多上下文会损害推理准确性。
  • 思维链(CoT)提示消除了示例效应,并在不同输入与输出表示下产生一致的输出分布,表明其提升了鲁棒性。
  • CoT 并不一定在绝对性能上优于非 CoT 基线,但能有效缓解不良表示设计和高示例数量带来的负面影响。
  • 本研究指出,由于 token 长度限制,无法完成完整的 CoT-AMR 评估,但非 CoT AMR 与 CoT AMR 之间观察到的性能差距表明,这是未来研究的关键方向。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。