Skip to main content
QUICK REVIEW

[论文解读] Navigating the Grey Area: How Expressions of Uncertainty and Overconfidence Affect Language Models

Kaitlyn Zhou, Dan Jurafsky|arXiv (Cornell University)|Feb 26, 2023
Topic Modeling被引用 6
一句话总结

本文研究了认识性标记——表达确定性、不确定性或证据性的表达——在零样本问答任务中对语言模型准确率的影响。通过在提示中注入50种不同的认识性标记,作者发现,高确定性表达(如“我确定”)相比低确定性表达,会使模型准确率降低7%;而证据性标记如“维基百科说”则能提升性能,表明模型更可能模仿预训练数据中的模式,而非对认识状态进行推理。

ABSTRACT

The increased deployment of LMs for real-world tasks involving knowledge and facts makes it important to understand model epistemology: what LMs think they know, and how their attitudes toward that knowledge are affected by language use in their inputs. Here, we study an aspect of model epistemology: how epistemic markers of certainty, uncertainty, or evidentiality like "I'm sure it's", "I think it's", or "Wikipedia says it's" affect models, and whether they contribute to model failures. We develop a typology of epistemic markers and inject 50 markers into prompts for question answering. We find that LMs are highly sensitive to epistemic markers in prompts, with accuracies varying more than 80%. Surprisingly, we find that expressions of high certainty result in a 7% decrease in accuracy as compared to low certainty expressions; similarly, factive verbs hurt performance, while evidentials benefit performance. Our analysis of a popular pretraining dataset shows that these markers of uncertainty are associated with answers on question-answering websites, while markers of certainty are associated with questions. These associations may suggest that the behavior of LMs is based on mimicking observed language use, rather than truly reflecting epistemic uncertainty.

研究动机与目标

  • 理解自然语言中不确定性和确定性表达如何影响语言模型在问答任务中的表现。
  • 构建认识性标记的语言类型学,包括模糊语、事实性动词和证据性表达,以系统评估其影响。
  • 探究语言模型是否基于语义意义解释认识性标记,还是基于预训练数据中的统计共现模式。
  • 揭示反直觉模型行为的潜在原因,例如高确定性表达导致准确率下降。
  • 通过识别未经验证归属和错位认识信号的风险,指导语言模型的安全部署。

提出的方法

  • 作者构建了50种认识性标记的类型学,将其分类为模糊语、强化语(确定性标记)、事实性动词和证据性表达。
  • 他们将这些标记注入零样本提示中,用于问答风格的问题,将标准提示如“法国的首都是什么?”转换为“我确定它是……”。
  • 通过标准准确率指标在问答基准上评估模型表现,比较不同认识性标记类型下的响应表现。
  • 作者分析了一个主流预训练数据集的训练数据,以考察认识性标记与答案类型之间的关联。
  • 进行了定性和定量分析,以追溯模型行为与预训练数据中语言模式的关系。
  • 实验包括零样本提示和对模型自动生成认识性标记的初步分析。

实验结果

研究问题

  • RQ1不同类型的认识性标记(如模糊语、事实性动词和证据性表达)如何影响语言模型在零样本问答任务中的准确率?
  • RQ2与低确定性表达相比,将高确定性表达注入提示是否会导致模型准确率下降?
  • RQ3语言模型的响应更多受认识性标记的语义意义影响,还是受预训练数据中统计共现模式的影响?
  • RQ4为何事实性动词和强化语会降低模型表现,尽管它们传递了自信信号?
  • RQ5模型在多大程度上模仿自然语言中的认识性表达模式,而非对认识状态进行推理?

主要发现

  • 高确定性表达,如“我确定”或“我100%确定”,相比低确定性表达如“我认为”,会使模型准确率降低7%。
  • 事实性动词如“我们意识到它是”显著降低模型表现,表明它们可能触发错误的自信信号。
  • 证据性标记如“维基百科说它是”能提升模型准确率,表明它们可能作为有用的信号来源。
  • 预训练数据集分析显示,不确定性标记更常与问答网站上的答案相关联,而确定性标记则与问题相关,表明模型行为具有数据驱动的根源。
  • 模型行为似乎反映了训练数据中的统计模式,而非真正的认识推理,因为高确定性提示反而导致表现更差,尽管其意图是增强信心。
  • 模型自动生成认识性标记的校准性仍然较差,其中言语性不确定性表达的校准性略好于确定性标记。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。