Skip to main content
QUICK REVIEW

[论文解读] Contrastive Entropy: A new evaluation metric for unnormalized language models

Kushal Arora, Anand Rangarajan|arXiv (Cornell University)|Jan 3, 2016
Topic Modeling参考文献 11被引用 6
一句话总结

本文提出对比熵(Contrastive Entropy, CE),一种用于评估未归一化语言模型的新判别性度量指标,用于衡量模型区分正确句子与其扭曲版本的能力。与困惑度不同,CE 不需要归一化概率,因此适用于句子级模型;实验表明,经过判别性训练的句子级 RNN 在低扭曲水平下表现出更优的 CE 分数,优于标准 RNN 和 n-gram 模型。

ABSTRACT

Perplexity (per word) is the most widely used metric for evaluating language models. Despite this, there has been no dearth of criticism for this metric. Most of these criticisms center around lack of correlation with extrinsic metrics like word error rate (WER), dependence upon shared vocabulary for model comparison and unsuitability for unnormalized language model evaluation. In this paper, we address the last problem and propose a new discriminative entropy based intrinsic metric that works for both traditional word level models and unnormalized language models like sentence level models. We also propose a discriminatively trained sentence level interpretation of recurrent neural network based language model (RNN) as an example of unnormalized sentence level model. We demonstrate that for word level models, contrastive entropy shows a strong correlation with perplexity. We also observe that when trained at lower distortion levels, sentence level RNN considerably outperforms traditional RNNs on this new metric.

研究动机与目标

  • 为解决困惑度在评估具有不可计算归一化常数的语言模型时的局限性,特别是针对分区函数难以计算的模型。
  • 提出一种适用于词级和句子级语言模型的判别性评估指标。
  • 证明通过对比训练可提升模型在新指标上的表现,尤其在句子级模型中表现更优。
  • 假设对比熵与词错误率(WER)的相关性优于困惑度,原因在于二者均具有判别性本质。

提出的方法

  • 提出对比熵(CE)作为判别性指标,用于评估模型区分原始句子与扭曲句子的能力。
  • 将 CE 定义为原始句子与其扭曲版本之间的交叉熵率,计算公式为 $ H_C = -\frac{1}{N} \sum_{W_n \in T} \log(m(W_n)) $,其中 $ m $ 为模型的未归一化概率。
  • 基于对比估计原理,训练句子级 RNN(sRNN)以最大化模型在域内与域外句子之间的判别能力。
  • 在训练过程中使用 10%、30%、50% 的扭曲水平生成负样本,提升模型对自然变异的泛化能力。
  • 采用带 $ \ell_2 $ 正则化的梯度下降法进行训练,并使用 SRILM 和 RNNLM 工具包在 Penn Treebank WSJ 数据集上进行评估。
  • 引入对比熵比 $ H_{CR} = \frac{H_C(\text{test distortion})}{H_C(\text{baseline distortion})} $ 以实现不同模型间的性能归一化。

实验结果

研究问题

  • RQ1判别性指标如对比熵是否能在评估未归一化语言模型时优于困惑度?
  • RQ2使用对比估计训练的句子级 RNN 是否能提升其在未见句子变异上的判别能力?
  • RQ3对比熵与词错误率(WER)之间是否存在强相关性,表明其相比困惑度具有更好的真实世界预测能力?
  • RQ4训练过程中扭曲水平的选择如何影响句子级语言模型在新指标上的表现?

主要发现

  • 对比熵与词级模型的困惑度表现出强相关性,验证了其与现有指标的一致性。
  • 在 10% 扭曲水平下训练的 sRNN 模型(sRNN-75(10))在 50% 扭曲水平下取得最高的对比熵得分(11.01),优于所有词级模型。
  • sRNN-75(10) 在 50%/10% 扭曲水平下的对比熵比为 5.257,显著高于 RNN(2.596)和 n-gram 模型,表明其具有更强的判别能力。
  • 在 50% 扭曲水平下训练的 sRNN-75(50) 在低扭曲水平下表现较差(10% 时为 1.978),但在高扭曲水平下比率提升至 3.275,证实了训练扭曲水平的影响。
  • 对比熵比(H_CR)在词级模型中保持稳定(2.0–2.7),而句子级模型表现出更高的比率,表明其泛化能力更强。
  • sRNN-150(10) 的对比熵比为 5.074,略低于 sRNN-75(10) 的 5.257,表明更大的潜在空间并不总是能提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。