[论文解读] AlignScore: Evaluating Factual Consistency with a Unified Alignment Function
本文提出 AlignScore,一种统一的事实一致性度量,利用在 470 万个来自七个 NLP 任务的多样化样本上训练的一般文本到文本对齐函数。通过微调 RoBERTa 模型(参数量为 1.25 亿至 3.55 亿),AlignScore 在 22 个基准测试中达到最先进性能——包括 19 个零样本数据集——其表现与 GPT-4 基于的度量相当或更优,尽管模型规模小得多。
Many text generation applications require the generated text to be factually consistent with input information. Automatic evaluation of factual consistency is challenging. Previous work has developed various metrics that often depend on specific functions, such as natural language inference (NLI) or question answering (QA), trained on limited data. Those metrics thus can hardly assess diverse factual inconsistencies (e.g., contradictions, hallucinations) that occur in varying inputs/outputs (e.g., sentences, documents) from different tasks. In this paper, we propose AlignScore, a new holistic metric that applies to a variety of factual inconsistency scenarios as above. AlignScore is based on a general function of information alignment between two arbitrary text pieces. Crucially, we develop a unified training framework of the alignment function by integrating a large diversity of data sources, resulting in 4.7M training examples from 7 well-established tasks (NLI, QA, paraphrasing, fact verification, information retrieval, semantic similarity, and summarization). We conduct extensive experiments on large-scale benchmarks including 22 evaluation datasets, where 19 of the datasets were never seen in the alignment training. AlignScore achieves substantial improvement over a wide range of previous metrics. Moreover, AlignScore (355M parameters) matches or even outperforms metrics based on ChatGPT and GPT-4 that are orders of magnitude larger.
研究动机与目标
- 解决现有事实一致性度量依赖于狭窄、任务特定函数(如 NLI 或 QA)而泛化能力有限的问题。
- 开发一种整体性、统一的对齐函数,能够评估不同文本长度和领域中的多样化事实不一致。
- 使用涵盖七个既定 NLP 任务的广泛、多样化数据分布,训练一个通用对齐模型。
- 创建一种轻量化但高度有效的度量,能够在无需任务特定微调的情况下泛化到未见过的评估场景。
- 证明较小的统一模型可在事实一致性评估中超越 GPT-4 等大型模型。
提出的方法
- 使用来自七个任务(NLI、QA、释义、事实验证、信息检索、语义相似性、摘要)的 470 万个样本,训练统一的文本到文本对齐函数。
- 重新格式化并整合 15 个数据集,形成统一的对齐学习目标,使模型能够学习在多样化文本对之间的一般信息对齐。
- 采用上下文分割策略:将长上下文划分为粗粒度块,将陈述划分为细粒度句子,以提高长文本对齐的准确性。
- 通过聚合上下文块与陈述句之间的成对对齐分数,计算最终的事实一致性得分。
- 对 RoBERTa-base 和 RoBERTa-large 模型(参数量分别为 1.25 亿和 3.55 亿)进行微调,以实现对齐函数,使用对比学习目标。
- 在 22 个大规模基准测试(包括 SummaC 和 TRUE)上评估最终的 AlignScore 度量,其中 19 个数据集在训练期间被保留(零样本评估)。
实验结果
研究问题
- RQ1在多样化 NLP 任务上训练的统一对齐函数,能否泛化到多种任务和文本类型的事实一致性评估?
- RQ2轻量化模型(3.55 亿参数)在事实一致性评估中与 GPT-4 等大型语言模型相比表现如何?
- RQ3上下文分割策略在长文本生成任务中的性能提升程度如何?
- RQ4统一训练框架是否相比任务特定度量展现出更好的零样本泛化能力?
- RQ5单一对齐函数能否有效捕捉多样化的事实不一致,包括矛盾和幻觉?
主要发现
- AlignScore 在 22 个评估数据集上均显著优于先前度量,包括 19 个未在对齐训练中使用的数据集。
- 尽管参数量小一个数量级以上,3.55 亿参数的 AlignScore 模型在性能上仍与或超过基于 GPT-4 的度量。
- AlignScore 展现出强大的零样本泛化能力,在 22 个基准测试中的 19 个(未用于对齐训练)中表现良好。
- 消融研究证实,上下文分割策略显著提升了性能,尤其在长文本上。
- 使用多样化数据源的统一训练框架,相比任务特定替代方案,产生了更稳健、更具泛化能力的对齐函数。
- 该模型在摘要、对话和事实验证等多种任务中表现一致,证实了其整体性设计的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。