Skip to main content
QUICK REVIEW

[논문 리뷰] Humans and transformer LMs: Abstraction drives language learning

Jasper Jian, Christopher D. Manning|arXiv (Cornell University)|2026. 03. 18.
Language Development and Disorders인용 수 0
한 줄 요약

본 논문은 GPT-2 사전 학습 트랜스포머가 동사 범주 및 구문 구성에 대한 언어적 추상화를 항목 특정 패턴보다 더 빨리 학습함을 보여주며, 예시 기반 설명보다 추상화 우선 학습 편향을 뒷받침한다.

ABSTRACT

Categorization is a core component of human linguistic competence. We investigate how a transformer-based language model (LM) learns linguistic categories by comparing its behaviour over the course of training to behaviours which characterize abstract feature-based and concrete exemplar-based accounts of human language acquisition. We investigate how lexical semantic and syntactic categories emerge using novel divergence-based metrics that track learning trajectories using next-token distributions. In experiments with GPT-2 small, we find that (i) when a construction is learned, abstract class-level behaviour is evident at earlier steps than lexical item-specific behaviour, and (ii) that different linguistic behaviours emerge abruptly in sequence at different points in training, revealing that abstraction plays a key role in how LMs learn. This result informs the models of human language acquisition that LMs may serve as an existence proof for.

연구 동기 및 목표

  • 트랜스포머 언어 모델이 사전 학습 동안 언어 범주를 어떻게 습득하는지 조사한다.
  • LM 학습 궤적을 추상화 우선 vs 예시 우선 인간 언어 습득 이론과 비교한다.
  • 다음 토큰 분포에 기반한 발산 지표를 사용하여 어휘 의미 및 구문 범주의 출현을 추적한다.

제안 방법

  • OpenWebText로 학습된 GPT-2 소형 모델을 450개의 체크포인트로 사용하여 학습 궤적을 모니터링한다.
  • 다음 토큰 분포 간의 쌍 간 발산(D_JS)을 정의하여 범주 일반적 학습 대 항목 특이 학습을 평가한다.
  • 새로운 발산 기반 지표를 사용하여 추상화 우선과 예시 우선 예측에 대한 LM 궤적을 비교한다.
  • 의미/주장 구조 학습과 구문 하위 범주화/비인접 의존성 등 두 가지를 평가한다.
  • 출현-공동(co-occurrence) 벡터를 사용한 예시 우선Baseline을 포함하여 학습 패턴을 대조한다.

실험 결과

연구 질문

  • RQ1LM 학습 궤적이 항목 특정 패턴보다 클래스에 대한 조기 추상화를 보이는가?
  • RQ2동사 범주, 타동성, 보충-공백 의존성과 같은 현상들에 걸쳐 언어 구성이 순차적이고 추상화 우선적인 방식으로 학습되는가?
  • RQ3훈련 궤적에서 관찰되는 LM 학습을 예시 우선 baseline이 설명하는가?
  • RQ4LM에서 다양한 언어 현상에 걸친 추상화의 등장 순서는 어떻게 되는가?

주요 결과

  • 여러 현상에 걸쳐 추상화 우선 행동이 나타나며, 항목 수준의 학습 이전에 클래스 차원의 구분이 조기에 나타난다.
  • 언어 구문은 개별 어휘 항목보다 단어 군의 범주에 대해 먼저 학습되며, 학습 시작 시점은 현상에 따라 다르다.
  • 학습 궤적은 추상화의 순차적 등장(의미상의 동사 범주, 그다음 타동성, 그리고 관계절 패턴)을 보인다.
  • 예시 우선 baseline은 GPT-2의 학습 궤적을 재현하지 못하며, 예시 암기보다 추상화 주도 학습을 지지한다.
  • 관계절 학습은 클래스 기반의 등장이나 일부 클래스별 시차 차이를 보이며, 균일한 병렬성보다 구조화된 추상화를 나타낸다.
  • 관찰된 추상화 우선 패턴은 특정 인간 언어 습득 이론과 일치하는 반면, 언어 모델은 선천적 추상화가 아니라 분포 데이터에 의존한다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.