Skip to main content
QUICK REVIEW

[论文解读] Language models are better than humans at next-token prediction

Buck Shlegeris, Fabien Roger|arXiv (Cornell University)|Dec 21, 2022
Topic Modeling被引用 5
一句话总结

本研究通过使用 OpenWebText 数据集,直接比较了人类与语言模型在下一个词预测任务上的表现,同时测量了 top-1 准确率和困惑度。研究发现,即使是小型语言模型如 GPT-3-Ada,在这两项指标上也优于人类,表明当前的语言模型在它们所训练的核心任务——下一个词预测上已达到超人类水平。

ABSTRACT

Current language models are considered to have sub-human capabilities at natural language tasks like question-answering or writing code. However, language models are not trained to perform well at these tasks, they are trained to accurately predict the next token given previous tokes in tokenized text. It is not clear whether language models are better or worse than humans at next token prediction. To try to answer this question, we performed two distinct experiments to directly compare humans and language models on this front: one measuring top-1 accuracy and the other measuring perplexity. In both experiments, we find humans to be consistently \emph{worse} than even relatively small language models like GPT3-Ada at next-token prediction.

研究动机与目标

  • 为了解决关于语言模型是否在下一个词预测任务上超越人类的模糊性,而该任务正是其训练的核心目标。
  • 采用非手工设计、真实世界互联网文本(OpenWebText)进行类比比较,而非使用精选或合成数据集。
  • 不仅通过 top-1 准确率,还通过困惑度来衡量人类表现,后者能够捕捉下一个词的完整概率分布。
  • 挑战先前认为人类困惑度低于语言模型的观点,尤其是那些基于有缺陷的外推或间接估算方法的结论。

提出的方法

  • 开展了一项 top-1 准确率实验,让人类参与者从 OpenWebText 序列中的 50,000 个词的词汇表中选择最可能的下一个词。
  • 开发了一种校准的概率估计游戏,以测量人类的困惑度,参与者需为候选词分配概率比值。
  • 使用 GPT-2-small 作为参考模型,通过基于比值的评分系统估算人类困惑度,从而实现与语言模型的直接比较。
  • 应用不确定性估计技术以评估人类困惑度估计的可靠性,承认由于校准问题可能导致的低估。
  • 对人类和语言模型采用相同的方法论,以确保困惑度得分的公平、直接比较。
  • 评估了多种语言模型,包括 GPT-3-Ada、GPT-2 和 GPT-1,使用其报告的对数概率计算困惑度以进行比较。

实验结果

研究问题

  • RQ1在真实世界互联网文本上,语言模型是否优于人类在下一个词预测任务上的表现?
  • RQ2人类在下一个词预测上的真实困惑度是多少?与小型语言模型相比如何?
  • RQ3先前对人类困惑度的估计有多可靠,特别是那些基于小型模型外推或主观判断量表的估计?
  • RQ4仅靠 top-1 准确率是否足以衡量下一个词预测的表现?还是必须建模完整的概率分布?
  • RQ5鉴于语言模型仅以该目标进行训练,它们在预测下一个词这一特定任务上超越人类的程度有多大?

主要发现

  • 人类在 OpenWebText 数据集上的 top-1 准确率约为 28%,低于在类似设置下 GPT-2 的 36% 准确率。
  • 即使是小型语言模型如 GPT-3-Ada,在 top-1 准确率和困惑度上也优于人类,表明其在核心训练目标上已达到超人类水平。
  • 人类的困惑度估计值显著高于 GPT-3-Ada,且由于概率报告的校准不良,人类困惑度被严重高估。
  • 本研究发现,人类在概率校准估计中的表现甚至不如一个两层神经网络,表明人类在该任务上的概率推理存在根本性局限。
  • 先前认为人类困惑度约为 12 的说法无效,因为其基于对小型模型的错误外推和非代表性数据集。
  • 结果表明,即使在小型模型规模下,现代语言模型在下一个词预测任务上已达到超人类水平,这对可解释性和模型能力具有重要意义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。