Skip to main content
QUICK REVIEW

[논문 리뷰] A Content-Based Novelty Measure for Scholarly Publications: A Proof of Concept

Haining Wang|arXiv (Cornell University)|2024. 01. 08.
scientometrics and bibliometrics research인용 수 4
한 줄 요약

이 논문은 위키백과에서 훈련된 언어 모델의 놀라움(surprisal)을 사용하여 학술 논문의 내용 기반 신선도 측정법을 제안한다. 이는 학술 담론에 비해 어휘 조합의 '놀라움'으로서의 신선도를 정량화한다. 전문가가 새로운 것으로 평가한 논문에서 통계적으로 유의미하게 높은 놀라움을 보였으며(p = 0.005), 구성 타당성(construct validity)을 입증하고, 대규모로도 적용 가능한 설명 가능하고 오픈소스 도구를 제공한다.

ABSTRACT

Model Architecture GPT-2 124M Variant Number of Layers (n_layer): 12 Number of Attention Heads (n_head): 12 Embedding Size (n_embd): 768 Total Parameters: Approximately 124 million Dropout Rate: 0.0 (no dropout applied during training) Bias in LayerNorm and Linear Layers: Not used (bias = False) Refer to Radford et al. (2019) for details. Training Scheme Dataset The model utilizes the wikipedia_en dataset, which consists of English Wikipedia articles, with data up to the cutoff date of March 1, 2022, sourced from the Hugging Face datasets library (datasets.load_dataset("wikipedia", "20220301.en")). The version of datasets being used is 2.9.0. Tokenizer The specific encoding function used is tiktoken.get_encoding("gpt2"), which retrieves the tokenizer specific to GPT-2 and includes a vocabulary of 50,304 tokens. An end-of-text token (EOT), denoted by enc.eot_token (for example, 50,256 for GPT-2 BPE), is appended to each sequence of token IDs. The version of tiktoken being used is 0.2.0. Batch and Block Configuration Batch Size: 16 (micro-batch size) Block Size: 1,024 tokens Gradient Accumulation Steps: 5 Effective Total Batch Size: Approximately 327,680 tokens (16 * 1024 * 5 * 4 A100s) Optimizer (AdamW) Initial Learning Rate: 6e-4 Final Minimum Learning Rate: 6e-5 Weight Decay: 1e-1 Beta1: 0.9 Beta2: 0.95 Gradient Clipping Value: 1.0 Epsilon (eps): 1e-5 Learning Rate Decay Warmup Iterations: 2,000 Decay Iterations: 141,000 (aligned with max_iters) Training Iterations Maximum Iterations (max_iters): 141,000 Approximate Number of Epochs: 10 (totaling around 46 billion tokens) Evaluation Scheme Evaluation Interval: Every 1,000 iterations Number of Evaluation Iterations: 200 Other Dependencies For further details on other dependencies, refer to requirements.txt at https://github.com/Wang-Haining/noveval. References Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., & Sutskever, I. (2019). Language models are unsupervised multitask learners. OpenAI Blog, 1(8), 9.

연구 동기 및 목표

  • 인용 또는 키워드에 의존하지 않고, 내용 수준에서 작동하는 자동화되고 설명 가능한 학술 논문의 신선도 측정법을 개발하는 것.
  • 과학적 일반 지식과의 일치성(면면 타당성)과 전문가 평가와의 상관관계(구성 타당성)를 통해 측정법을 검증하는 것.
  • 정보 이론 원리를 활용해 학술 논문의 각 단락 수준에서 세밀한 신선도 평가를 가능하게 하는 것.
  • 편집자, 심사자, 정책 결정자들이 학술 결과물의 신선도를 평가할 수 있도록 재현 가능하고 오픈소스 도구를 제공하는 것.
  • 과학 연구에서의 신선도, 창의성, 다학제적 성격 간의 관계를 탐색하는 것.

제안 방법

  • GPT-2 언어 모델을 사용하여 영문 위키백과에서 미리 훈련된 모델을 활용해 논문 텍스트의 각 단어 발생 확률을 추정한다.
  • 놀라움은 이전 문맥을 기반으로 한 각 단어의 음의 로그 확률로 계산되며, 최소 256개의 이전 토큰을 기반으로 1,024토큰 윈도우 단위로 평균 놀라움을 산출한다.
  • 모델은 논문의 개요와 본문 텍스트를 연결하여 적용하며, 주로 방법 및 결과 섹션에 초점을 맞춰 신선도를 평가한다.
  • 측정법은 정보 이론을 기반으로 하며, 학술 언어의 기대 분포에서 벗어난 비표준 어휘 조합을 새로운 것으로 간주한다.
  • 구성 타당성은 알려진 집단 기법을 통해 검증되며, 분야 전문가가 '신선하다' 또는 '보통'으로 일치 평가한 논문 간 평균 놀라움을 비교한다.
  • 실제 학술 텍스트에서 방법을 평가하기 위해, 저자 식별 경연 대회에서 사용된 80개의 작업 노트로 구성된 AVA 데이터셋을 사용한다.

실험 결과

연구 질문

  • RQ1일반 위키백과 텍스트에서 훈련된 언어 모델의 놀라움이 학술 논문의 내용 기반 신선도를 신뢰성 있게 측정할 수 있는가?
  • RQ2제안된 측정법이 분야 전문가가 '신선하다' 또는 '신선하지 않다'로 평가한 논문을 구분할 수 있는가? (구성 타당성 검증)
  • RQ3이 측정법은 과학적 일반 지식과 전문가의 직관적 판단에 얼마나 잘 부합하는가?
  • RQ4놀라움 점수의 이질성은 수학 기호, 비공식 문법, 서사 일관성 등의 텍스트적 특징과 어떻게 관련이 있는가?
  • RQ5이 측정법은 논문의 방법 및 결과 섹션 수준에서 적용되어, 연구 논문의 특정 구성 요소에서의 신선도를 탐지할 수 있는가?

주요 결과

  • 분야 전문가가 일치하여 '신선하다'로 평가한 논문의 평균 놀라움은 일반 논문보다 유의미하게 높았다(p = 0.005), 구성 타당성이 확인되었다.
  • 일측 t-검정에서 t-통계량은 2.6를 기록하여, '신선한' 논문이 '보통' 논문보다 놀라움 값이 뚜렷이 높음을 시사했다.
  • 놀라움 점수가 5.0 이상인 8편의 논문은 전문가에 의해 덜 신선한 것으로 평가되었다. 분석 결과, 과도한 수학 기호 사용, 비공식 문법, 점진적 연구에서의 서사 일관성 등이 잘못된 경고를 유발하는 원인이 되었다.
  • 측정법은 정보 이론적 기반 덕분에 설명 가능했으며, '놀라움'이 단어 예측 가능성의 함수로 직접 이해할 수 있었다.
  • 이 방법은 재현 가능하며, permissive 라이선스 하에 github.com/Wang-Haining/noveval 에 공개되어 있다.
  • 이 연구는 인용, 키워드, 또는 근본적인 지식 단위에 의존하지 않는 내용 기반의 신선도 측정법에 대한 개념 증명을 수립했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.