[论文解读] From Sparse to Dense: GPT-4 Summarization with Chain of Density Prompting
本文提出链式密度(Chain of Density, CoD)提示方法,通过逐步抽象与融合关键实体,在不增加长度的前提下,迭代提升GPT-4摘要的实体密度。人类偏好研究表明,实体密度与人工撰写摘要相当(0.151 E/T)的摘要优于原始GPT-4摘要(0.122 E/T),表明信息量与可读性之间存在最优平衡。
Selecting the ``right'' amount of information to include in a summary is a difficult task. A good summary should be detailed and entity-centric without being overly dense and hard to follow. To better understand this tradeoff, we solicit increasingly dense GPT-4 summaries with what we refer to as a ``Chain of Density'' (CoD) prompt. Specifically, GPT-4 generates an initial entity-sparse summary before iteratively incorporating missing salient entities without increasing the length. Summaries generated by CoD are more abstractive, exhibit more fusion, and have less of a lead bias than GPT-4 summaries generated by a vanilla prompt. We conduct a human preference study on 100 CNN DailyMail articles and find that that humans prefer GPT-4 summaries that are more dense than those generated by a vanilla prompt and almost as dense as human written summaries. Qualitative analysis supports the notion that there exists a tradeoff between informativeness and readability. 500 annotated CoD summaries, as well as an extra 5,000 unannotated summaries, are freely available on HuggingFace (https://huggingface.co/datasets/griffin/chain_of_density).
研究动机与目标
- 探究摘要信息量(由实体密度驱动)与可读性(偏好较低密度)之间的权衡。
- 开发一种基于提示的迭代方法,在保持长度和连贯性的同时,提升GPT-4摘要中的实体密度。
- 通过人类偏好评估,识别摘要中信息密度的最佳水平。
- 为未来在固定长度、可变密度摘要研究中提供一个公开可用的数据集,包含500个标注和5,000个未标注的CoD摘要。
提出的方法
- 使用链式密度(CoD)提示生成初始摘要,该摘要实体稀疏,包含1–3个关键实体。
- 在五个迭代步骤中,从源文章中识别出1–3个新颖、相关、具体、忠实且不冗余的实体,并将其融合到前一摘要中,而不增加长度。
- 明确鼓励压缩、融合与抽象,以在保持长度的同时增加实体数量。
- 实体密度以每 token 的实体数(E/T)衡量,初始摘要的密度为0.089 E/T,至第5步时提升至0.151 E/T。
- 通过人类偏好研究比较各步骤的CoD摘要,标注内容涵盖信息量、连贯性与整体质量。
- 自动评估使用GPT-4对摘要在五个维度上的评分:信息量、质量、连贯性、可归属性与整体质量。
实验结果
研究问题
- RQ1人类偏好中,GPT-4摘要的实体密度达到何种水平?与人工撰写摘要相比如何?
- RQ2通过CoD提示进行的迭代增密如何影响摘要的生成质量、融合效果与首句偏差?
- RQ3在连贯性与可读性开始下降之前,提升实体密度在多大程度上能改善信息量?
- RQ4基于GPT-4的自动指标在密集摘要中能否可靠预测人类对摘要质量的偏好?
主要发现
- 人类偏好研究表明,CoD第3步(0.151 E/T)的摘要优于原始GPT-4提示生成的摘要(0.122 E/T),其中61%的第一名得票来自至少经过三步增密的摘要。
- 中位首选CoD步骤为第3步,期望首选步骤为3.06,表明人类偏好实体密度接近人工摘要水平(0.151 E/T)的摘要。
- 自动评估显示,整体质量得分在CoD第4步(4.74)达到峰值,信息量与整体质量得分随增密持续上升,而质量与连贯性得分分别在第2步与第1步后开始下降。
- 定性分析揭示信息量与可读性之间存在明显权衡,中间阶段的CoD步骤(第3–4步)实现了最佳平衡。
- GPT-4的整体得分与人类判断之间的皮尔逊相关系数为0.31,表明尽管总体相关性较低,但存在中等程度的一致性,与以往基于大语言模型评估的研究结果一致。
- 作者在HuggingFace上公开发布500个标注的CoD摘要与5,000个未标注摘要,以支持未来在固定长度、可变密度摘要研究中的应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。