Skip to main content
QUICK REVIEW

[논문 리뷰] The Devil is in the Detail: Simple Tricks Improve Systematic Generalization of Transformers

Róbert Csordás, Kazuki Irie|arXiv (Cornell University)|2021. 08. 26.
Advanced Neural Network Applications참고 문헌 46인용 수 5
한 줄 요약

이 논문은 단순한 아키텍처 및 훈련 설정 조정—예를 들어 임bedding 스케일링, 조기 정지, 상대적 위치 임베딩, Universal Transformer 변형—이 다섯 가지 벤치마크 데이터셋에서 Transformer의 체계적 일반화를 극적으로 향상시킨다는 것을 보여준다. 상대적 위치 임베딩을 사용할 경우, COGS에서 정확도를 35%에서 81%로, PCFG의 생산성 분할에서 50%에서 85%로 향상시키며, SCAN의 길이 분할에서는 100%에 도달한다. 이는 IID 분할에서 성능 격차가 없음에도 불구하고 성능 향상을 이룬다.

ABSTRACT

Recently, many datasets have been proposed to test the systematic generalization ability of neural networks. The companion baseline Transformers, typically trained with default hyper-parameters from standard tasks, are shown to fail dramatically. Here we demonstrate that by revisiting model configurations as basic as scaling of embeddings, early stopping, relative positional embedding, and Universal Transformer variants, we can drastically improve the performance of Transformers on systematic generalization. We report improvements on five popular datasets: SCAN, CFQ, PCFG, COGS, and Mathematics dataset. Our models improve accuracy from 50% to 85% on the PCFG productivity split, and from 35% to 81% on COGS. On SCAN, relative positional embedding largely mitigates the EOS decision problem (Newman et al., 2020), yielding 100% accuracy on the length split with a cutoff at 26. Importantly, performance differences between these models are typically invisible on the IID data split. This calls for proper generalization validation sets for developing neural networks that generalize systematically. We publicly release the code to reproduce our results.

연구 동기 및 목표

  • 표준 벤치마크에서 강력한 성능를 보이지만 체계적 일반화 작업에서 지속적인 실패를 보이는 표준 Transformer 모델의 문제를 해결한다.
  • 기본 초모수와 절대적 위치 임베딩과 같은 비최적의 기본 설정이 체계적 일반화 평가의 공정성을 해칠 수 있는지 조사한다.
  • 복잡한 인덕티브 비 biases를 도입하지 않고도 아키텍처 및 훈련 조정의 미세한 변경으로 체계적 일반화 성능을 크게 향상시킬 수 있음을 입증한다.
  • 성능 격차가 IID 분할에서 드러나지 않기 때문에, 전용 일반화 검증 세트가 필수적임을 강조한다.
  • 신경망에서 체계적 일반화에 대한 향후 연구를 위해 더 강력하고 재현 가능한 기준을 확립한다.

제안 방법

  • 단어 임베딩을 Glorot 균일 분포로 초기화하고 √d_model로 스케일링하여 토큰 임베딩 업스케일링(TEU)을 적용함으로써 위치 임베딩과 균형을 이루도록 한다.
  • 단어 임베딩을 Kaiming 정규 분포(σ = 1/√d_model)로 초기화하고 위치 임베딩의 크기를 1/√d_model로 감소시켜 위치 임베딩 다운스케일링(PED)을 구현한다.
  • Dai 등(2019)의 분해된 어텐션 기반 메커니즘을 사용해 상대적 위치 임베딩을 도입하며, 학습된 벡터 u와 v, 상대적 위치 임베딩 P_i-j를 통해 상대적 위치를 명시적으로 모델링한다.
  • 과적합을 방지하기 위해 검증 손실 기반 조기 정지를 적용함으로써 IID 분할에서의 과적합을 방지하면서도 일반화 성능를 유지한다.
  • 모든 레이어에서 공유 파라미터를 사용해 Universal Transformer 변형을 훈련함으로써 시퀀스 모델링 및 일반화 능력을 향상시킨다.
  • 절대적 위치 임베딩과 상대적 위치 임베딩을 동시에 사용하지 않으며, 인코더-디코더 인터페이스를 제외한 모든 레이어에서 상대적 위치 어텐션을 사용한다.

실험 결과

연구 질문

  • RQ1표준 Transformer 초모수 및 설정이 벤치마크 데이터셋에서 체계적 일반화 성능에 얼마나 큰 제약을 끼치는가?
  • RQ2임베딩 스케일링 및 상대적 위치 인코딩과 같은 단순한 아키텍처 수정이 기호적 구성 요소 없이도 체계적 일반화 성능을 크게 향상시킬 수 있는가?
  • RQ3모델 간 성능 격차가 IID 검증 세트에서는 드러나지 않는 이유는 무엇이며, 이는 일반화 평가에 어떤 함의를 갖는가?
  • RQ4상대적 위치 임베딩은 순서-순서 작업에서 문장 끝(EOS) 결정 문제를 어떻게 완화하는가?
  • RQ5일관된 설정 개선 조치가 SCAN, COGS, PCFG, 수학 문제 등 다양한 체계적 일반화 벤치마크에 일반화될 수 있는가?

주요 결과

  • PCFG의 생산성 분할에서, 임베딩 스케일링과 상대적 위치 인코딩을 사용해 정확도를 50%에서 85%로 향상시켰다.
  • COGS 데이터셋에서 동일한 설정 개선 조치로 정확도가 35%에서 81%로 상승하여 강력한 일반화 성과를 입증했다.
  • SCAN의 길이 분할(26자 기준)에서는 상대적 위치 임베딩 덕분에 정확도가 100%에 도달했으며, 이는 EOS 결정 문제를 효과적으로 해결했다.
  • PCFG의 체계성 분할에서는 기본 모델의 72%에서 96%로 정확도가 향상되어 복합적 추론 능력이 향상됨을 보였다.
  • 일반화 분할에서 뚜렷한 성능 격차가 존재함에도 불구하고, 모든 모델는 IID 검증 세트에서 동일한 성능를 보였으며, 이는 전용 일반화 벤치마크가 필수적임을 시사한다.
  • 코드와 훈련된 모델을 공개하여 재현 가능성을 확보하고 향후 체계적 일반화 방법의 벤치마킹을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.