[논문 리뷰] Transformers Generalize Linearly
이 논문은 투스트럼이 문법적 시퀀스-투-시퀀스 작업에서 선형 패턴과 계층적 패턴 사이에서 모호한 훈련 데이터가 존재할 때 계층적 일반화에 대한 인도적 편향을 보이는지 조사한다. 내분포 데이터에서 강력한 성능을 보이지만, 계층적 구조가 요구되는 외분포 일반화 작업에서는 투스트럼이 일관되게 실패하며, 선형 일반화에 뚜렷한 경향을 보이며, 이 편향에서 조차도 순환 신경망보다도 뛰어난 성능을 보인다.
Natural language exhibits patterns of hierarchically governed dependencies, in which relations between words are sensitive to syntactic structure rather than linear ordering. While re-current network models often fail to generalize in a hierarchically sensitive way (McCoy et al.,2020) when trained on ambiguous data, the improvement in performance of newer Trans-former language models (Vaswani et al., 2017)on a range of syntactic benchmarks trained on large data sets (Goldberg, 2019; Warstadtet al., 2019) opens the question of whether these models might exhibit hierarchical generalization in the face of impoverished data.In this paper we examine patterns of structural generalization for Transformer sequence-to-sequence models and find that not only do Transformers fail to generalize hierarchically across a wide variety of grammatical mapping tasks, but they exhibit an even stronger preference for linear generalization than comparable recurrent networks
연구 동기 및 목표
- 투스트럼이 문법적 시퀀스-투-시퀀스 작업에서 계층적 일반화에 대한 인도적 편향을 보이는지 확인하는 것.
- 동일하고 모호한 훈련 데이터 하에서 투스트럼과 순환 신경망(LSTM, GRU)의 일반화 행동을 비교하는 것.
- 문법 벤치마크에서의 성공이 아키텍처적 인도적 편향 때문인지, 대규모 훈련 데이터에 노출된 결과 때문인지 평가하는 것.
- 선형과 계층적 일반화 패턴을 구분할 수 있도록 하는 외분포 테스트 세트에서의 일반화 평가.
- 관찰된 투스트럼의 문법적 성공이 아키텍처적 인도적 편향인지, 데이터 기반 패턴 학습 때문인지 조사하는 것.
제안 방법
- 선형과 계층적 일반화 모두를 허용하는 모호한 훈련 데이터를 가진 네 가지 영어 전이 작업을 설계하는 것.
- 내분포 테스트 세트와 외분포 일반화(gen) 세트를 만들며, 선형과 계층적 일반화 패턴을 구분하는 것.
- 동일한 데이터에서 4헤드, 3층, 128차원 투스트럼 모델과 순환 모델(LSTM, GRU)을 주의 기반 여부에 따라 훈련하는 것.
- 순환 모델은 1층 구조를 사용하며, 은닉층과 임bedding 공간은 각각 256차원이며, 모델 유형당 10번의 무작위 가중치 초기화를 실시하는 것.
- 10회 런의 중앙값 정확도를 사용해 모델을 평가하며, 전체 시퀀스 정확도와 핵심 요소(예: 부정 기호, 반사적 대명사 등)의 위치를 중심으로 메트릭을 설정하는 것.
- 예측 결과를 반사적-선형, 주어-선형, 계층적 클래스로 분류하여 비문맥적 작업에서의 일반화 전략을 평가하는 것.
실험 결과
연구 질문
- RQ1훈련 데이터가 선형 패턴과 계층적 패턴 사이에서 모호할 때, 투스트럼 아키텍처가 계층적 일반화에 편향을 보이는가?
- RQ2외분포 문법 일반화 작업에서 투스트럼의 일반화 성능는 순환 신경망(LSTM, GRU)과 비교해 어떻게 되는가?
- RQ3투스트럼의 문법 벤치마크에서의 성공은 아키텍처적 인도적 편향 때문인지, 대규모 훈련 데이터에 노출된 결과 때문인지 어느 정도인가?
- RQ4선형 패턴이 훈련 데이터와도 일치할 때, 모호한 데이터로 훈련된 모델이 계층적 구조로 올바르게 일반화할 수 있는가?
- RQ5다양한 신경망 아키텍처에서 선형과 계층적 일반화 선호도의 상대적 강도는 어떠한가?
주요 결과
- 투스트럼은 모든 작업에서 내분포 테스트 세트에서 거의 최상의 성능를 기록하며, 훈련 데이터에서 강력한 패턴 학습을 이룬다는 것을 시사한다.
- 외분포 일반화 세트에서는 투스트럼이 일관되게 실패하며, 계층적 일반화가 요구되는 작업(예: neg-main, 반사적 비문맥)에서 거의 영정확도를 기록한다.
- 모든 모델, 투스트럼을 포함해, 외분포 세트에서 선형 일반화 전략(예: neg-first, reflexive-linear)을 압도적으로 선호하며, 계층적 패턴이 유일하게 일관된 일반화일지라도 그렇다.
- LSTM은 반사적 비문맥 작업에서 가장 높은 중앙값 계층적 성능(65.8%)을 기록하며, 투스트럼과 GRU를 모두 앞선다.
- 선형 일반화 선호도는 모든 작업과 모델 유형에서 일관되며, 투스트럼은 선형 패턴에 가장 강한 편향을 보인다.
- 결과는 투스트럼의 문법 벤치마크에서의 성공이 계층적 구조에 대한 내재된 인도적 편향 때문이 아니라, 대규모 문장어에서의 데이터 기반 패턴 학습 때문임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.