Skip to main content
QUICK REVIEW

[论文解读] Semantic Consistency for Assuring Reliability of Large Language Models

Harsh Raj, Vipul Gupta|arXiv (Cornell University)|Aug 17, 2023
Topic Modeling被引用 4
一句话总结

本文提出了一种新颖的语义一致性度量方法,用于评估大语言模型(LLMs)在开放式文本生成中的表现,超越词法相似性,捕捉真正的语义等价性。该方法提出了一种名为 Ask-to-Choose(A2C)的提示策略,在 TruthfulQA 上将准确率提升最高达 47%,语义一致性提升最高达 7 倍,展现出与人类判断的高度对齐,并优于传统度量方法。

ABSTRACT

Large Language Models (LLMs) exhibit remarkable fluency and competence across various natural language tasks. However, recent research has highlighted their sensitivity to variations in input prompts. To deploy LLMs in a safe and reliable manner, it is crucial for their outputs to be consistent when prompted with expressions that carry the same meaning or intent. While some existing work has explored how state-of-the-art LLMs address this issue, their evaluations have been confined to assessing lexical equality of single- or multi-word answers, overlooking the consistency of generative text sequences. For a more comprehensive understanding of the consistency of LLMs in open-ended text generation scenarios, we introduce a general measure of semantic consistency, and formulate multiple versions of this metric to evaluate the performance of various LLMs. Our proposal demonstrates significantly higher consistency and stronger correlation with human evaluations of output consistency than traditional metrics based on lexical consistency. Finally, we propose a novel prompting strategy, called Ask-to-Choose (A2C), to enhance semantic consistency. When evaluated for closed-book question answering based on answer variations from the TruthfulQA benchmark, A2C increases accuracy metrics for pretrained and finetuned LLMs by up to 47%, and semantic consistency metrics for instruction-tuned models by up to 7-fold.

研究动机与目标

  • 解决在大语言模型生成的文本序列中,语义一致性评估缺乏稳健性的问题,尤其在超越单标记输出的场景下。
  • 开发一种可泛化的度量方法,捕捉在改写提示下的语义等价性,从而提升真实自然语言生成应用中的可靠性。
  • 探究大语言模型中准确率与一致性之间的脱节现象,尽管通常认为二者是相关的。
  • 设计一种提示策略,以在不损害事实正确性的前提下,同时提升语义一致性和准确率。
  • 通过与人类判断及现有基于词法的度量方法对比,验证所提出的度量方法与策略的有效性。

提出的方法

  • 提出一种基于大语言模型的多阶段流水线,利用上下文学习生成改写的问题,并通过 few-shot 提示提取简短答案。
  • 使用一个辅助大语言模型,基于多种语义一致函数(如蕴含、改写、BLEURT)对生成答案的成对语义等价性进行评分。
  • 基于聚合的成对语义等价性,构建一个通用的语义一致性度量方法,支持在多种大语言模型架构和解码策略下的评估。
  • 提出 Ask-to-Choose(A2C)提示策略,通过显式呈现选项来引导模型生成一致且准确的答案。
  • 在一致性框架中整合多种语义一致函数——改写、蕴含、矛盾以及词法度量——以评估方法的鲁棒性及与人类偏好的对齐程度。
  • 每个问题采用六次大语言模型调用的推理流水线,包含答案生成、简短化和语义评分阶段,以计算最终的一致性得分。

实验结果

研究问题

  • RQ1如何比词法相似性更有效地衡量大语言模型生成文本序列中的语义一致性?
  • RQ2语义一致性在多大程度上与人类对输出相似性的判断相关?
  • RQ3提示策略能否在不降低事实正确性的前提下,同时提升大语言模型的准确率与语义一致性?
  • RQ4大语言模型中是否存在准确率与一致性之间的脱节现象?若存在,能否通过架构或提示干预手段加以调和?
  • RQ5不同语义一致函数(如蕴含、改写)在衡量一致性及与人类偏好对齐方面表现如何比较?

主要发现

  • 更大的大语言模型展现出更高的语义一致性,尽管它们也表现出一种反向缩放效应,即准确率随模型规模增大而下降。
  • 语义一致性与准确率是独立属性;模型可以一致但不准确,或准确但不一致。
  • 所提出的语义一致性度量方法与人类判断的相关性显著高于传统的基于词法的度量方法(如 BLEU 或 ROUGE)。
  • Ask-to-Choose(A2C)提示策略在封闭书本问答任务中,使指令微调模型的准确率最高提升 47%,语义一致性最高提升 7 倍。
  • 应用 A2C 后,准确答案的一致性得分保持高位或进一步提升,PP 度量值在各模型间从 0.87 上升至 0.88。
  • 人类判断与语义一致性度量之间的成对相关性保持较强,尤其在蕴含与改写函数上;A2C 应用后,熵度量的相关性略有提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。