[논문 리뷰] Transformer Grammars: Augmenting Transformer Language Models with Syntactic Inductive Biases at Scale
이 논문은 구조화된 어휘 마스크와 결정적 트리 선형화를 통해 재귀적 문법적 조합을 통합하는 새로운 종류의 트랜스포머 언어 모델인 트랜스포머 문법(Transformer Grammars, TGs)을 소개한다. 이는 문법에 민감한 언어 모델링을 크게 향상시킨다. TGs는 훨씬 더 작고 학습 속도가 빠르지만, GPT-2-small, Gopher, Chinchilla와 같은 강력한 베이스라인 모델보다도 문법 일반화 및 파싱 재정렬 성능에서 뛰어나다.
We introduce Transformer Grammars (TGs), a novel class of Transformer language models that combine (i) the expressive power, scalability, and strong performance of Transformers and (ii) recursive syntactic compositions, which here are implemented through a special attention mask and deterministic transformation of the linearized tree. We find that TGs outperform various strong baselines on sentence-level language modeling perplexity, as well as on multiple syntax-sensitive language modeling evaluation metrics. Additionally, we find that the recursive syntactic composition bottleneck which represents each sentence as a single vector harms perplexity on document-level language modeling, providing evidence that a different kind of memory mechanism -- one that is independent of composed syntactic representations -- plays an important role in current successful models of long text.
연구 동기 및 목표
- 소규모 모델인 RNNGs에서 핵심적인 유도적 편향인 재귀적 문법적 조합이 현대 트랜스포머 언어 모델에서 스케일업되더라도 여전히 유용한가를 조사하는 것.
- 재귀적 신경망 문법(RNNGs)의 확장성 한계를 해결하기 위해 효율적인 트랜스포머-XL 아키텍처에 문법 유도적 편향을 통합하는 것.
- 문법적 구조가 문장 수준 작업뿐 아니라 문서 수준 언어 모델링에서도 성능 향상에 기여하는가를 평가하는 것.
- 문법 일반화와 퍼플렉서티 사이의 상호 관계, 특히 모델의 어휘 복사 능력과의 관계를 고려하여 성능의 상충 관계를 분석하는 것.
- 문법적 구조로 제약된 어텐션 메커니즘이 효율성을 희생시키지 않고도 구조적 일반화를 향상시킬 수 있는가를 탐색하는 것.
제안 방법
- 선형화된 파싱 트리의 구성 요소 경계에만 어텐션을 제한하는 유형화된 재귀적 어텐션 마스크를 트랜스포머-XL 아키텍처에 통합하여 문법적 조합을 강제하는 것.
- 각 구문을 비단일적이고 계층적인 비단어 기호의 조합으로 표현하며, 재귀적 어텐션 패턴을 가능하게 하기 위해 닫는 비단어 기호를 복제하는 것.
- 자기회귀적 생성 과정에서 종단어와 비단어 트리 구성요소를 동시에 모델링하여, 모델이 문자열과 문법적 구조를 모두 예측할 수 있도록 하는 것.
- 펜 트리뱅크와 BLLIP-lg 데이터셋을 사용하여 문자열과 해당 어휘-구조 트리의 연합 확률 분포를 학습하는 것.
- 구조적 어텐션을 유지하면서도 표준 트랜스포머의 효율성을 유지하는 수정된 자기회귀적 디코딩 프로세스를 구현하는 것.
- 퍼플렉서티 및 문법 일반화 메트릭에서의 성능 기여도를 분리하기 위해 회귀 분 析를 수행하는 것.
실험 결과
연구 질문
- RQ1구조적 어텐션 마스크를 통해 재귀적 문법적 조합을 통합하면 트랜스포머 모델에서 스케일업된 언어 모델링 성능이 향상되는가?
- RQ2문법에 민감한 평가 벤치마크에서 트랜스포머 문법의 성능은 문법 무관 트랜스포머와 문법 보강 모델과 비교해 어떻게 되는가?
- RQ3재귀적 문법적 조합의 유도적 편향이 퍼플렉서티를 낮추는 데 기여하는 어휘 복사 능력에 얼마나 간섭하는가?
- RQ4단일 문장에서 전체 문서로 모델링을 확장할 경우, 문법 유도적 편향이 여전히 유용한가?
- RQ5명시적인 문법적 조합을 갖춘 모델이 훨씬 더 큰 사전학습된 언어 모델보다도 문법 일반화 작업에서 승리할 수 있는가?
주요 결과
- 트랜스포머 문법은 훨씬 더 작고 훨씬 적은 데이터로 학습되었음에도 불구하고, 허 등(2020)의 문법 일반화 벤치마크에서 최고 성능을 기록했으며, GPT-2-small, Gopher, Chinchilla를 모두 앞서 갔다.
- TGs는 문법 일반화 및 파싱 재정렬 작업에서 문법 무관 트랜스포머-XL (terminals) 기반 모델과 더 강력한 TXL (trees) 모델보다도 뚜렷하게 뛰어난 성능을 보였다.
- 어느 한정 없이 종단어와 비단어 기호를 모두 예측하는 TXL (trees) 모델은 문장 수준의 퍼플렉서티에서 TGs를 略로 앞섰다. 이는 TGs의 어텐션 제약이 어휘 복사 능력에 간섭할 수 있음을 시사한다.
- 문서 수준 언어 모델링에서는 TGs가 종단어 전용 TXL (terminals) 모델과 TXL (trees) 모델 모두에 크게 뒤져, 단일로 구성된 문법적 표현 방식만으로는 장기적 맥락 모델링에 부적합함을 보여준다.
- 회귀 분 析 결과 재귀적 문법적 조합이 문법 일반화를 향상시키지만, 어휘 복사 능력이 감소하는 비용을 치르는 것으로 확인되었으며, 이는 문법 모델링과 어휘 모델링 목표 간의 부분적인 분리가 존재함을 드러냈다.
- TGs의 학습 속도는 배치 처리된 RNNGs보다 훨씬 빠르며, 이는 트랜스포머 프레임워크 내에서 문법 유도적 편향을 효율적으로 확장할 수 있음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.