Skip to main content
QUICK REVIEW

[论文解读] A Content-Based Novelty Measure for Scholarly Publications: A Proof of Concept

Haining Wang|arXiv (Cornell University)|Jan 8, 2024
scientometrics and bibliometrics research被引用 4
一句话总结

本文提出了一种基于内容的学术出版物新颖性度量方法,利用在维基百科上预训练的语言模型计算意外度(surprisal),将新颖性量化为相对于学术话语的词序‘意外’程度。该方法在专家判断为新颖的论文中表现出统计显著更高的意外度(p = 0.005),验证了构念效度,并提供了一种可解释、开源的工具,可用于大规模评估新颖性。

ABSTRACT

Model Architecture GPT-2 124M Variant Number of Layers (n_layer): 12 Number of Attention Heads (n_head): 12 Embedding Size (n_embd): 768 Total Parameters: Approximately 124 million Dropout Rate: 0.0 (no dropout applied during training) Bias in LayerNorm and Linear Layers: Not used (bias = False) Refer to Radford et al. (2019) for details. Training Scheme Dataset The model utilizes the wikipedia_en dataset, which consists of English Wikipedia articles, with data up to the cutoff date of March 1, 2022, sourced from the Hugging Face datasets library (datasets.load_dataset("wikipedia", "20220301.en")). The version of datasets being used is 2.9.0. Tokenizer The specific encoding function used is tiktoken.get_encoding("gpt2"), which retrieves the tokenizer specific to GPT-2 and includes a vocabulary of 50,304 tokens. An end-of-text token (EOT), denoted by enc.eot_token (for example, 50,256 for GPT-2 BPE), is appended to each sequence of token IDs. The version of tiktoken being used is 0.2.0. Batch and Block Configuration Batch Size: 16 (micro-batch size) Block Size: 1,024 tokens Gradient Accumulation Steps: 5 Effective Total Batch Size: Approximately 327,680 tokens (16 * 1024 * 5 * 4 A100s) Optimizer (AdamW) Initial Learning Rate: 6e-4 Final Minimum Learning Rate: 6e-5 Weight Decay: 1e-1 Beta1: 0.9 Beta2: 0.95 Gradient Clipping Value: 1.0 Epsilon (eps): 1e-5 Learning Rate Decay Warmup Iterations: 2,000 Decay Iterations: 141,000 (aligned with max_iters) Training Iterations Maximum Iterations (max_iters): 141,000 Approximate Number of Epochs: 10 (totaling around 46 billion tokens) Evaluation Scheme Evaluation Interval: Every 1,000 iterations Number of Evaluation Iterations: 200 Other Dependencies For further details on other dependencies, refer to requirements.txt at https://github.com/Wang-Haining/noveval. References Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., & Sutskever, I. (2019). Language models are unsupervised multitask learners. OpenAI Blog, 1(8), 9.

研究动机与目标

  • 开发一种自动化的、可解释的学术新颖性度量方法,该方法基于内容层面而非依赖引用或关键词。
  • 通过表面效度(与科学常识的一致性)和构念效度(与专家判断的相关性)对度量方法进行验证。
  • 利用信息论原理,实现在学术稿件中细粒度的、按章节划分的新颖性评估。
  • 为编辑、审稿人及政策制定者提供一种可复现、开源的工具,用于评估学术成果的新颖性。
  • 探讨科学新颖性、创造力与跨学科性之间的关系。

提出的方法

  • 该方法使用在英语维基百科上预训练的GPT-2语言模型,估算手稿文本中每个词的概率。
  • 意外度计算为给定前序上下文时,每个词的负对数概率,平均意外度在至少包含256个前序词的1,024个词窗口内计算。
  • 该模型应用于手稿的摘要与正文的拼接文本,重点评估方法和结果部分以检测新颖性。
  • 该度量将新颖性视为异常的词组组合——即偏离学术语言预期分布的偏离,基于信息论原理。
  • 通过已知组法检验构念效度,比较领域专家一致评为‘新颖’和‘正常’的论文之间的平均意外度。
  • 使用AVA数据集(包含80篇作者身份验证竞赛中的工作笔记)在真实学术文本上评估该方法。

实验结果

研究问题

  • RQ1在通用维基百科语料上预训练的语言模型所计算的意外度,能否可靠地衡量学术出版物的内容型新颖性?
  • RQ2所提出的度量方法是否通过区分专家判断为新颖与非新颖的论文,展现出构念效度?
  • RQ3该度量在多大程度上反映了科学常识和专家对新颖性的直觉判断?
  • RQ4意外度分数中的异常值与文本特征(如数学符号、非正式语法或叙事一致性)之间存在何种关系?
  • RQ5该度量能否在章节层面应用,以检测研究论文的方法和结果部分中的新颖性?

主要发现

  • 领域专家一致评为新颖的论文,其平均意外度显著高于正常论文(p = 0.005),证实了构念效度。
  • 单尾Welch t检验得出t统计量为2.6,表明新颖论文的意外度值显著高于正常论文。
  • 8篇意外度超过5.0的论文被专家判定为新颖性较低;分析表明,过度的数学符号、非正式语法以及渐进式工作的叙事一致性导致了误报。
  • 该度量通过其信息论基础实现了可解释性,可直接理解‘意外’作为词可预测性的函数。
  • 该方法具有可复现性,并在github.com/Wang-Haining/noveval下以宽松许可协议公开提供。
  • 本研究为基于内容的新颖性度量提供了一个概念验证,避免了对引用、关键词或粗粒度知识单元的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。