[논문 리뷰] Tree Transformer: Integrating Tree Structures into Self-Attention
이 논문은 원시 텍스트에서 자기주의 주의(self-attention)를 통해 구성 문법 트리(constituency trees)를 유도하는 '구성 주의(Constituent Attention)' 모듈을 도입함으로써 트리 구조를 Transformer의 자기주의 주의 메커니즘에 통합하는 새로운 방법인 Tree Transformer를 제안한다. 이 방법은 표준 BERT 스타일의 Transformer보다 언어 모델링 퍼플렉서티(perplexity)를 향상시키고, 더 해석 가능하고 인간이 직관적으로 이해할 수 있는 주의 패턴을 생성한다.
Pre-training Transformer from large-scale raw texts and fine-tuning on the desired task have achieved state-of-the-art results on diverse NLP tasks. However, it is unclear what the learned attention captures. The attention computed by attention heads seems not to match human intuitions about hierarchical structures. This paper proposes Tree Transformer, which adds an extra constraint to attention heads of the bidirectional Transformer encoder in order to encourage the attention heads to follow tree structures. The tree structures can be automatically induced from raw texts by our proposed "Constituent Attention" module, which is simply implemented by self-attention between two adjacent words. With the same training procedure identical to BERT, the experiments demonstrate the effectiveness of Tree Transformer in terms of inducing tree structures, better language modeling, and further learning more explainable attention scores.
연구 동기 및 목표
- 표준 Transformer 자기주의 주의가 인간의 문법 계층적 구조에 대한 직관과 일치하지 않기 때문에 계층적 구조 인식의 부족을 해결하기 위해.
- 감독된 파싱 트리가 필요 없이 원시이고 표시되지 않은 텍스트에서 자동으로 구성 문법 트리 구조를 유도하는 방법을 개발하기 위해.
- 자기주의 주의 헤드를 문법 구성 요소 내에서만 주의하도록 제약을 두어, 자기주의 주의 메커니즘의 해석 가능성과 성능을 향상시키기 위해.
- 트리 기반 주의가 표준 Transformer와 비교해 언어 모델링 성능과 더 설명 가능한 주의 패턴을 제공하는지 평가하기 위해.
제안 방법
- 이웃하는 단어들을 연결하고 하향식으로 구성 요소를 구축하는 데 자기주의 주의를 사용하는 '구성 주의(Constituent Attention)' 모듈을 도입한다.
- 각 Transformer 레이어의 주의 헤드에 트리 구조 제약을 적용하여, 동일한 문법 구성 요소 내에서만 주의하도록 강제한다.
- 단지 구성 주의 모듈 추가 외에는 BERT와 동일한 사전학습 및 미세조정 절차를 사용한다.
- 트리 구조와 문맥 표현을 동시에 학습할 수 있는 미분 가능하고 종단 간(end-to-end) 학습 프로세스를 활용한다.
- 위계적 위치 정보를 모델에 제공하기 위해 위치 인코딩과 유도된 트리 구조를 모두 활용한다.
- 각 헤드가 유도된 트리에 의해 정의된 동일한 구성 요소 내에서만 주의하도록 제약을 두는 다중 헤드 주의 기법을 사용한다.
실험 결과
연구 질문
- RQ1감독된 인간 표시 파싱 트리에 의존하지 않고도 자기주의 주의 메커니즘을 계층적 문법 구조에 따라 유도할 수 있는가?
- RQ2유도된 트리 구조를 주의에 통합하면 표준 Transformer보다 언어 모델링 성능이 향상되는가?
- RQ3Tree Transformer의 주의 헤드는 표준 BERT 스타일 모델의 주의 헤드보다 얼마나 더 해석 가능하고 인간의 직관에 부합하는 주의 패턴을 보이는가?
- RQ4구성 주의 모듈이 약한 감독 방식으로 원시 텍스트에서 인간의 표시와 유사한 일관성 있는 구성 문법 트리를 효과적으로 유도할 수 있는가?
- RQ5모델 크기와 학습 절차를 동일하게 제어했을 때, Tree Transformer의 성능은 표준 Transformer보다 어떻게 비교되는가?
주요 결과
- 12개의 레이어와 58M 파라미터를 가진 Tree Transformer는 WSJ 테스트 세트에서 테스트 퍼플렉서티 45.6을 기록하여 유사하거나 더 높은 파라미터 수를 가진 표준 Transformer보다 뛰어난 성능을 보였다.
- 표준 Transformer보다 10% 더 많은 파라미터를 가졌음에도 불구하고, 동일한 작업에서 더 낮은 퍼플렉서티(45.6 vs. 48.1)를 기록하여, 구조적 인덕티브 바이어스(inductive bias)의 성능 향상 기여를 확인했다.
- 모델이 유도한 구성 문법 트리는 비감독적 파싱 평가를 통해 인간이 표시한 파싱 결과와 일관성을 보였으며, 타당성이 입증되었다.
- Tree Transformer의 주의 행렬은 표준 Transformer보다 더 체계적이고 위계적인 패턴을 보이며, 인간의 문법 조합에 대한 직관과 더 잘 부합했다.
- 사전학습된 BERT에서 초기화해도 성능을 유지하지만, 유도된 트리 구조는 덜 일관성 있게 나타나, BERT의 주의 헤드가 다른 인덕티브 바이어스를 학습하고 있음을 시사했다.
- 구성 주의 모듈을 추가함으로써 계산 비용은 20% 증가하고 파라미터 수는 약 10% 증가하지만, 해석 가능성과 모델링 품질 향상에 상당한 기여를 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.