[논문 리뷰] The Bottom-up Evolution of Representations in the Transformer: A Study with Machine Translation and Language Modeling Objectives
이 논문은 기계 번역(MT), 좌측에서 우측으로 방향성 언어 모델링(LM), 그리고 마스크된 언어 모델링(MLM)과 같은 학습 목적이 트랜스포저의 토큰 표현의 진화에 어떻게 영향을 미치는지 조사한다. 공액상관분석과 상호정보량 추정을 사용하여, LM 레이어는 과거의 맥락을 점점 잃고 미래 예측을 형성하는 반면, MLM 레이어는 먼저 토큰 정체성을 잊고 맥락 정보를 일반화한 후 높은 레이어에서 이를 재구성함으로써 MLM의 뛰어난 사전학습 성능을 설명한다.
We seek to understand how the representations of individual tokens and the structure of the learned feature space evolve between layers in deep neural networks under different learning objectives. We focus on the Transformers for our analysis as they have been shown effective on various tasks, including machine translation (MT), standard left-to-right language models (LM) and masked language modeling (MLM). Previous work used black-box probing tasks to show that the representations learned by the Transformer differ significantly depending on the objective. In this work, we use canonical correlation analysis and mutual information estimators to study how information flows across Transformer layers and how this process depends on the choice of learning objective. For example, as you go from bottom to top layers, information about the past in left-to-right language models gets vanished and predictions about the future get formed. In contrast, for MLM, representations initially acquire information about the context around the token, partially forgetting the token identity and producing a more generalized token representation. The token identity then gets recreated at the top MLM layers.
연구 동기 및 목표
- 학습 목적이 트랜스포저 레이어 간 토큰 표현의 진화에 어떻게 영향을 미치는지 이해하기 위해.
- 다른 목표(MT, LM, MLM) 하에서 레이어 간 정보 흐름 역학을 조사하기 위해.
- 유사한 아키텍처를 가졌음에도 불구하고 마스크된 언어 모델링(MLM)이 왜 사전학습에서 좌측에서 우측으로 방향성 언어 모델링(LM)보다 뛰어난지, 표현 진화 기반으로 설명하기 위해.
- 레이어 간 토큰 정체성, 맥락, 위치, 문법 정보에 대한 표현의 인코딩과 상실 방식을 분석하기 위해.
제안 방법
- 각 레이어에서 토큰 정체성과 출력 레이블이 표현에 얼마나 유지되는지 측정하기 위해 상호정보량 추정을 적용한다.
- 다른 토큰의 표현 간 영향도와 레이어 간 표현 전환 정도를 정량화하기 위해 공액상관분석(cca)을 사용한다.
- 유사도 기반 분석을 통해 각 표현에 대해 인접한 토큰, 위치, CCG 슈퍼태그의 중요도를 측정한다.
- 모델 아키텍처와 데이터를 동일하게 유지하면서 MT, LM, MLM 세 가지 목표 간 표현 진화를 비교한다.
- t-SNE 시각화를 적용하여 CCG 태그 기반으로 레이어 간 토큰 표현의 공간 재정렬(예: 'is')을 분석한다.
- bottleneck 학습 관점에서 표현의 정보 압축과 예측 간 상충관계를 분석한다.
실험 결과
연구 질문
- RQ1다른 학습 목표(MT, LM, MLM) 하에서 토큰 표현이 레이어 간 어떻게 진화하는가?
- RQ2이 진화 과정에서 어떤 종류의 정보(예: 토큰 정체성, 맥락, 문법)가 유지되거나 상실되거나 새로 습득되는가?
- RQ3유사한 아키텍처를 가졌음에도 불구하고 마스크된 언어 모델링(MLM)이 좌측에서 우측으로 방향성 언어 모델링(LM)보다 더 뛰어난 사전학습 성능을 보이는 이유는 무엇인가?
- RQ4레이어 간 토큰 간 상호작용은 어떻게 변화하며, 목표에 따라 어떻게 다를까?
- RQ5다른 목표에서 과거 맥락과 미래 맥락에 대한 정보를 표현이 얼마나 포함하고 있는가?
주요 결과
- 좌측에서 우측으로 방향성 언어 모델(LM)에서는 하단 레이어에서부터 과거 정보가 점진적으로 손실되고, 표현은 점점 미래 토큰 예측을 강화한다.
- 마스크된 언어 모델링(MLM)에서는 표현이 처음에 토큰 정체성을 잊고 맥락 정보를 일반화한 후, 높은 레이어에서 정체성을 재구성한다.
- 공액상관분석 결과, MLM 모델의 표현은 뚜렷한 전환을 겪으며, 특히 맥락이 인코딩되는 초기 레이어에서 레이어 간 영향력이 강하다.
- 인접한 토큰의 중요도는 MLM에서 두 번째 레이어까지 증가하다가 감소하며, 맥락 인코딩과 토큰 재구성의 이중 단계 과정을 나타낸다.
- CCG 슈퍼태그 중요도는 LM과 MLM 모두 높은 레이어에서 떨어지지만, 패턴이 다르다: LM은 과거의 문법적 구조를 축적하는 반면, MLM은 재구성 전에 맥락에 집중한다.
- t-SNE 시각화 결과, 같은 단어(예: 'is')의 표현이 CCG 태그 기반으로 레이어 간 재정렬되며, MLM과 LM에서 각각 다른 군집 패턴이 나타난다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.