[论文解读] MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers
MAUVE 引入了基于发散前沿的度量,通过在量化嵌入空间中比较模型与人类文本分布来量化神经文本分布与人类文本的接近程度。
As major progress is made in open-ended text generation, measuring how close machine-generated text is to human language remains a critical open problem. We introduce MAUVE, a comparison measure for open-ended text generation, which directly compares the learnt distribution from a text generation model to the distribution of human-written text using divergence frontiers. MAUVE scales up to modern text generation models by computing information divergences in a quantized embedding space. Through an extensive empirical study on three open-ended generation tasks, we find that MAUVE identifies known properties of generated text, scales naturally with model size, and correlates with human judgments, with fewer restrictions than existing distributional evaluation metrics.
研究动机与目标
- 为开放式文本生成提供一个原则性、可扩展的度量,既考虑退化的机器输出,也考虑对人类文本的覆盖有限。
- 通过 soft Type I 和 Type II 错误通过发散前沿来形式化模型分布与人类分布之间的差距。
- 通过对文本分布进行嵌入和量化以在低维空间中计算 KL 散度,提供一个高效的估计框架。
- 证明 Mauve 与人类判断相关,并且对嵌入/量化选择具有鲁棒性。
提出的方法
- 将 divergence curve C(P,Q) 定义为一组对 (KL(P|Rλ), KL(Q|Rλ)),其中 Rλ = λP + (1−λ)Q,且 λ ∈ (0,1)。
- 用来自人类文本和机器文本的样本来近似未知的分布 P 和 Q,通过外部模型 M 进行嵌入,得到 R^d 中的向量。
- 将嵌入的样本量化(例如 k-means)以在 k 个区间上形成离散分布 ŜP 与 ŜQ。
- 将 divergence curve 下的面积 Mauve(P,Q) 计算为 Type I 与 Type II 错误之间权衡的标量摘要。
- 提供一个实用的估计工作流,使用 MC 采样和所选的缩放常数 c 以产生可解释的 Mauve 值。
- 展示 Mauve 对嵌入选择和量化方法的鲁棒性。
实验结果
研究问题
- RQ1在跨越一系列混合比例 λ 进行评估时,神经文本分布 Q 与人类文本分布 P 有多接近?
- RQ2Mauve 能否识别生成文本的已知属性,如长度、解码算法和模型尺寸的影响?
- RQ3在与人类判断相关的同时,Mauve 是否对不同的嵌入和量化策略具有鲁棒性?
- RQ4Mauve 是否比现有的自动指标更忠实地与人类质量判断相关?
主要发现
- Mauve 与人类判断在感知质量上相关性很高,对于更像人类且更合理的输出,其相关性高于其他指标。
- Mauve 捕捉跨解码算法(greedy < ancestral < nucleus)的预期质量关系,并检测对抗性/束搜索解码中的退化。
- Mauve 随模型规模增大而提升,并与人类质量评估一致,而一些传统指标如生成困惑度则不一致。
- Mauve 对嵌入选择(GPT-2 Large 与 RoBERTa Large)以及不同的量化策略(k-means、DRMM、lattice)保持鲁棒。
- 该方法提供一个可扩展、领域无关的开放式文本生成度量,用于概括机器文本与人类文本之间的分布差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。