[论文解读] Trading Off Diversity and Quality in Natural Language Generation
本文提出一种多目标框架,通过同时优化响应质量和多样性来评估自然语言生成中的解码算法。该研究首次在质量-多样性谱系上进行了大规模评估,发现当优先考虑质量时,nucleus采样优于其他方法,并实证验证了‘似然陷阱’现象——即高概率输出往往质量较低,同时提出了选择性采样作为全局归一化温度采样的一种可行近似。
For open-ended language generation tasks such as storytelling and dialogue, choosing the right decoding algorithm is critical to controlling the tradeoff between generation quality and diversity. However, there presently exists no consensus on which decoding procedure is best or even the criteria by which to compare them. We address these issues by casting decoding as a multi-objective optimization problem aiming to simultaneously maximize both response quality and diversity. Our framework enables us to perform the first large-scale evaluation of decoding methods along the entire quality-diversity spectrum. We find that when diversity is a priority, all methods perform similarly, but when quality is viewed as more important, the recently proposed nucleus sampling (Holtzman et al. 2019) outperforms all other evaluated decoding algorithms. Our experiments also confirm the existence of the `likelihood trap', the counter-intuitive observation that high likelihood sequences are often surprisingly low quality. We leverage our findings to create and evaluate an algorithm called \emph{selective sampling} which tractably approximates globally-normalized temperature sampling.
研究动机与目标
- 为了解决开放型语言生成任务(如对话和故事生成)中解码算法缺乏共识的问题。
- 建立一个基于人类评估的可信框架,用于在质量与多样性全谱系范围内比较解码方法。
- 研究一种反直觉现象:模型似然度与人类评分质量呈负相关,即所谓的‘似然陷阱’。
- 开发并评估一种新的解码算法——选择性采样,该算法在不显式计算分区函数的情况下近似全局归一化温度采样。
- 使用超过38,000个人工判断对近10,000个生成样本进行可扩展的大规模评估。
提出的方法
- 将解码建模为一个双目标优化问题,通过人类判断作为质量代理指标,同时最大化响应质量和多样性。
- 开展一项大规模人工评估研究,由146名众包工作者对不同模型似然度下的100个句子进行评分,以测量质量与似然度之间的关系。
- 提出选择性采样,一种基于拒绝采样的方法,可在不计算分区函数的情况下近似全局归一化温度分布。
- 利用反向KL散度和竞争目标最大化理论支撑选择性采样方法,并实现对生成句子的概率密度估计。
- 在多样化和质量导向的设置下,对多种解码算法(包括贪婪搜索、束搜索、top-k、top-p(nucleus采样)和温度采样)进行评估。
- 采用两阶段流程:首先在人类编写的语料库上进行模型训练以作为质量的代理,随后通过不同解码策略进行推理,以优化期望的权衡。
实验结果
研究问题
- RQ1在开放型语言生成中,不同解码算法在整个质量-多样性谱系上的表现如何?
- RQ2模型似然度与人工评分的响应质量之间的相关性有多大?该关系是否表现出非单调性?
- RQ3是否存在一种可行的解码算法,可在不显式计算分区函数的情况下近似全局归一化温度采样?
- RQ4当质量优先于多样性时,nucleus采样是否优于其他解码策略?
- RQ5选择性采样是否能有效平衡多样性与质量,同时支持对生成输出的概率密度估计?
主要发现
- 当优先考虑多样性时,所有解码算法表现相似,表明标准方法之间在多样性方面并无显著差异。
- 当优先考虑质量时,nucleus采样(top-p)显著优于其他解码算法,包括贪婪搜索、束搜索、top-k和温度采样。
- 研究实证证实了‘似然陷阱’的存在:尽管似然度与质量总体呈正相关,但高概率序列常被人工标注者评为低质量。
- 似然陷阱在概率分布的极端区域最为显著,即极高和极低概率序列的人工评分质量普遍较低。
- 选择性采样为全局归一化温度采样提供了一种可行的近似,可在不显式计算分区函数的情况下实现对生成句子的准确概率密度估计。
- 该框架支持在质量-多样性前沿全范围内进行大规模、基于人工评估的解码方法比较,为未来评估提供了可信基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。