Skip to main content
QUICK REVIEW

[논문 리뷰] Language models are better than humans at next-token prediction

Buck Shlegeris, Fabien Roger|arXiv (Cornell University)|2022. 12. 21.
Topic Modeling인용 수 5
한 줄 요약

이 연구는 오픈웹텍스트 데이터셋을 사용하여 인간과 언어 모델 간의 다음 토큰 예측 성능을 직접 비교하며, 상위 1위 정확도와 퍼플렉서티를 측정한다. 연구 결과, GPT-3-Ada와 같은 소형 언어 모델조차도 두 지표에서 인간을 능가함을 확인하였으며, 이는 현재의 언어 모델이 훈련된 핵심 과제인 다음 토큰 예측에서 초인적 성능을 보임을 시사한다.

ABSTRACT

Current language models are considered to have sub-human capabilities at natural language tasks like question-answering or writing code. However, language models are not trained to perform well at these tasks, they are trained to accurately predict the next token given previous tokes in tokenized text. It is not clear whether language models are better or worse than humans at next token prediction. To try to answer this question, we performed two distinct experiments to directly compare humans and language models on this front: one measuring top-1 accuracy and the other measuring perplexity. In both experiments, we find humans to be consistently \emph{worse} than even relatively small language models like GPT3-Ada at next-token prediction.

연구 동기 및 목표

  • 언어 모델이 다음 토큰 예측에서 인간을 능가하는지에 대한 애매함을 해결하기 위해, 언어 모델이 훈련받는 핵심 과제인 다음 토큰 예측에서 인간과의 성능 비교를 명확히 하기 위함.
  • 수정되지 않은 실제 인터넷 텍스트(오픈웹텍스트)를 사용하여, 수작업으로 구성된 또는 합성된 데이터셋이 아닌, 균형 잡힌 비교를 수행하기 위함.
  • 상위 1위 정확도 외에도 다음 토큰에 대한 전체 확률 분포를 반영하는 퍼플렉서티를 측정함으로써 인간의 성능을 평가하기 위함.
  • 이전 연구에서 인간의 퍼플렉서티가 언어 모델보다 낮다는 주장에 도전하기 위함이며, 특히 작은 모델에서의 외삽이나 간접 추정 방법에 기반한 잘못된 추정에 주목함.

제안 방법

  • 오픈웹텍스트 시퀀스에서 50,000개 토큰의 어휘에서 가장 가능성이 높은 다음 토큰을 선택하도록 인간 참가자를 대상으로 상위 1위 정확도 실험을 수행함.
  • 인간의 퍼플렉서티를 측정하기 위해 보정된 확률 추정 게임을 개발하였으며, 참가자들은 후보 토큰 간의 확률 비율을 할당함.
  • GPT-2-small을 기준 모델로 사용하여 비율 기반 점수 체계를 통해 인간의 퍼플렉서티를 추정함으로써 언어 모델과의 직접 비교를 가능하게 함.
  • 신뢰도 평가 기법을 적용하여 인간의 퍼플렉서티 추정의 신뢰성을 평가하였으며, 보정 문제로 인한 과소 평가 가능성을 고려함.
  • 인간과 언어 모델 간의 퍼플렉서티 점수를 동일한 방법론으로 평가하여 공정하고 직접적인 비교를 확보함.
  • GPT-3-Ada, GPT-2, GPT-1과 같은 여러 언어 모델을 평가하였으며, 각 모델의 보고된 로그 확률을 사용하여 퍼플렉서티를 계산함.

실험 결과

연구 질문

  • RQ1실제 인터넷 텍스트에서 인간보다 언어 모델이 다음 토큰 예측에서 더 우수한가?
  • RQ2실제 인간의 퍼플렉서티는 얼마이며, 소형 언어 모델과 비교해 볼 때 어떻게 되는가?
  • RQ3작은 모델에서의 외삽이나 주관적 평가 척도에 기반한 이전의 인간 퍼플렉서티 추정치는 얼마나 신뢰할 수 있는가?
  • RQ4상위 1위 정확도만으로 다음 토큰 예측 성능을 충분히 측정할 수 있는가, 아니면 전체 확률 분포 모델링이 필수적인가?
  • RQ5언어 모델이 오직 이 목표에만 훈련된 다음 토큰 예측 과제에서 인간을 얼마나 뛰어넘는가?

주요 결과

  • 인간은 오픈웹텍스트 데이터셋에서 약 28%의 상위 1위 정확도를 기록하였으며, 이는 유사한 설정에서 GPT-2의 36% 정확도보다 낮음.
  • GPT-3-Ada와 같은 소형 언어 모델조차도 상위 1위 정확도와 퍼플렉서티 양면에서 인간을 능가함을 확인하였으며, 이는 핵심 훈련 목표에서 초인적 성능을 보임을 시사함.
  • 인간의 퍼플렉서티 추정치는 GPT-3-Ada보다 현저히 높았으며, 확률 보고의 보정 부족으로 인해 인간의 퍼플렉서티가 과대평가됨.
  • 연구 결과, 인간의 보정된 확률 추정 능력은 두 층의 신경망보다 열등하여, 이 과제에서 인간의 확률적 추론 능력에 근본적인 한계가 있음을 시사함.
  • 이전에 인간의 퍼플렉서티가 약 12라고 주장한 바는 작은 모델에서의 잘못된 외삽과 비대표적 데이터셋에 기반하여 잘못된 것으로 판명됨.
  • 결과적으로 현대 언어 모델은 소형 모델 수준에서도 이미 다음 토큰 예측에서 초인적 성능을 보이며, 이는 모델의 해석 가능성과 능력에 중요한 함의를 지님.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.