Skip to main content
QUICK REVIEW

[논문 리뷰] What Context Features Can Transformer Language Models Use?

Joe O’Connor, Jacob Andreas|arXiv (Cornell University)|2021. 06. 15.
Topic Modeling참고 문헌 35인용 수 5
한 줄 요약

이 논문은 트랜스포머 모델이 언어 모델링을 향상시키기 위해 어떤 종류의 문맥 정보를 사용하는지 조사한다. $ρ$-정보 프레임워크를 사용하여 장기간 문맥에서 어휘적 및 구조적 특징을 제거하고, 유용한 정보의 대부분이 내용어와 국소적 공존 패턴에만 해당함을 발견한다. 기능어를 삭제하거나 단어 순서를 뒤섞는 것은 성능을 15% 미만으로 떨어뜨리며, 이는 현재 모델이 문법적 또는 문장 구성 정보에 크게 의존하지 않음을 시사한다.

ABSTRACT

Transformer-based language models benefit from conditioning on contexts of hundreds to thousands of previous tokens. What aspects of these contexts contribute to accurate model prediction? We describe a series of experiments that measure usable information by selectively ablating lexical and structural information in transformer language models trained on English Wikipedia. In both mid- and long-range contexts, we find that several extremely destructive context manipulations -- including shuffling word order within sentences and deleting all words other than nouns -- remove less than 15% of the usable information. Our results suggest that long contexts, but not their detailed syntactic and propositional content, are important for the low perplexity of current transformer language models.

연구 동기 및 목표

  • 장기간 문맥 입력의 어떤 측면이 트랜스포머 언어 모델에 유용한 정보를 기여하는지 규명하기.
  • 장기간 문맥 모델링에서 예측 성능을 이끄는 것이 문법적 구조, 단어 순서, 어휘적 내용 중 무엇인지 결정하기.
  • 형식적인 정보이론적 프레임워크를 사용해 제어된 문맥 제거(ablation)가 모델의 퍼플렉서티에 미치는 영향을 측정하기.
  • 제거 시 성능 저하가 정보 손실인지 분포 이탈인지 구분하기.
  • 향후 모델 설계에 있어 더 효율적이고 정보를 유지하는 문맥 표현 방향을 안내하기.

제안 방법

  • 연구는 언어 모델 문맥의 유용한 예측 정보를 정량화하기 위해 $ρ$-정보 프레임워크(Xu 등, 2020)를 활용한다.
  • 논문은 위키백과 데이터에서 트랜스포머 언어 모델을 훈련하고, 제어된 문맥 특징 제거 조건에서 퍼플렉서티를 평가한다.
  • 제거 조건에는 문장 내 단어 순서 뒤섞기, 명사 이외의 모든 단어 삭제, 기능어 제거 등이 포함된다.
  • 모델 성능을 원본 문맥과 대비시켜 구조적 정보와 어휘적 정보의 영향을 분리한다.
  • 실험은 768토큰 문맥 길이에서 수행되며, 모델 성능은 검증용 퍼플렉서티로 측정된다.
  • 이 프레임워크를 통해 정보 손실와 분포 이탈에 의한 성능 저하를 분리 분석할 수 있다.

실험 결과

연구 질문

  • RQ1장기간 문맥 입력의 어떤 특징가 트랜스포머 언어 모델 예측에 가장 유용한가?
  • RQ2문법적 구조나 단어 순서가 파괴될 경우 얼마나 많은 유용한 정보가 유지되는가?
  • RQ3기능어나 전반적 구조에 비해 내용어와 국소적 공존 패턴이 예측 정보를 얼마나 잘 전달하는가?
  • RQ4이름 있는 실체나 문서 식별자가 장기간 문맥의 이점을 설명하는가?
  • RQ5제거 조건에서의 성능 저하는 정보 손실 때문인가, 분포 이탈 때문인가?

주요 결과

  • 문장 내 단어 순서를 뒤섞는 것은 모델의 퍼플렉서티를 15% 미만으로만 떨어뜨리며, 국소적 단어 순서에 대한 의존성이 낮음을 시사한다.
  • 모든 단어를 명사 이외에 삭제하면 퍼플렉서티가 15% 이내로 증가하며, 내용어가 대부분의 유용한 정보를 담고 있음을 보여준다.
  • 기능어를 제거하는 것도 퍼플렉서티를 15% 이내로 증가시키며, 문법적 기능어가 예측 능력에 거의 기여하지 않음을 시사한다.
  • 문서 식별자나 이름 있는 실체만 유지할 경우 성능 저하가 심각하게 발생하며, 장기간 문맥의 이점이 주로 주제나 실체 정보 때문이라는 것은 아님을 시사한다.
  • 결과적으로 현재 트랜스포머 모델은 문법적 또는 문장 구성 구조보다 국소적 공존 통계와 내용어를 주로 사용함을 시사한다.
  • 이 연구는 이전에는 매우 파괴적인 것으로 여겨졌던 많은 제거 조건이 실제로는 유용한 정보에 미치는 영향이 미미함을 입증하며, 모델이 언어적 구조에 얼마나 의존하는지에 대한 기존 가정을 도전한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.