Skip to main content
QUICK REVIEW

[논문 리뷰] CAPE: Encoding Relative Positions with Continuous Augmented Positional Embeddings

Tatiana Likhomanenko, Qiantong Xu|arXiv (Cornell University)|2021. 06. 06.
Advanced Neural Network Applications인용 수 10
한 줄 요약

CAPE는 데이터 증강을 통해 상대적 위치 정보를 인코딩하는 연속적이고 보완된 절대적 위치 임베딩 방법을 제안하여 기계 번역, 음성 인식 및 이미지 작업 전반에서 표준 절대적 또는 상대적 위치 임베딩보다 더 뛰어난 성능과 안정성을 달성함으로써 트랜스포머의 일반화 능력을 향상시킨다. 이 방법은 계산 효율성을 유지한다.

ABSTRACT

Without positional information, attention-based Transformer neural networks are permutation-invariant. Absolute or relative positional embeddings are the most popular ways to feed Transformer models with positional information. Absolute positional embeddings are simple to implement, but suffer from generalization issues when evaluating on sequences longer than seen at training time. Relative positions are more robust to input length change, but are more complex to implement and yield inferior model throughput due to extra computational and memory costs. In this paper, we propose an augmentation-based approach (CAPE) for absolute positional embeddings, which keeps the advantages of both absolute (simplicity and speed) and relative positional embeddings (better generalization). In addition, our empirical evaluation on state-of-the-art models in machine translation, image and speech recognition demonstrates that CAPE leads to better generalization performance as well as increased stability with respect to training hyper-parameters.

연구 동기 및 목표

  • 학습 중에 더 긴 시퀀스를 평가할 때 절대적 위치 임베딩의 일반화 한계를 해결하기 위해.
  • 상대적 위치 임베딩의 계산 및 메모리 오버헤드를 극복하면서도 그 시퀀스 길이 변화에 대한 강건성을 유지하기 위해.
  • 아키텍처 수정 없이 기계 번역, 음성 인식 및 이미지 인식 등 다양한 도메인에서 모델의 안정성과 성능을 향상시키기 위해.
  • 패딩 없이 자동 음성 인식에서 엔드 투 엔드 학습을 가능하게 하기 위해 CAPE 기반의 새로운 적응형 학습 기반을 도입하기 위해.
  • 학습 가능한 절대적 위치 임베딩이 연속적 증강을 통해 크게 향상될 수 있으며, 복잡성은 줄어들지만 상대적 위치 인코딩 수준의 성능를 달성할 수 있음을 보여주기 위해.

제안 방법

  • CAPE는 이산적인 절대적 위치 임베딩을 연속적인 것으로 대체하여 시각, 음성 및 비디오 데이터의 연속적 성격과 더 잘 부합시킨다.
  • 학습 중에 CAPE는 위치 임베딩을 통제적으로 이동시키는 데이터 증강 전략을 적용하여 상대적 위치 정보를 암묵적으로 유지한다.
  • 이 방법은 글로벌 이동과 로컬 이동 증강을 사용한다: 글로벌 이동은 모든 위치에 일정한 오프셋을 도입하고, 로컬 이동은 상대적 순서를 유지하기 위해 작은 무작위 편향을 적용한다.
  • 증강은 학습 중에만 적용되며 추론 시에는 적용되지 않아 런타임 오버헤드가 없다.
  • 주의 메커니즘을 수정하지 않아 표준 트랜스포머의 단순성과 속도를 유지한다.
  • 기계 번역에서 원천 및 대상 시퀀스 위치를 정렬하기 위해 통계적 문장 길이 기반으로 스케일링 인자 α를 적용한다.

실험 결과

연구 질문

  • RQ1데이터 증강을 통한 연속적 위치 임베딩이 표준 절대적 위치 인코딩을 초월해 트랜스포머의 일반화 능력을 향상시킬 수 있는가?
  • RQ2CAPE는 정확도와 계산 효율성 측면에서 상대적 위치 임베딩을 능가하는가?
  • RQ3CAPE는 아키텍처 변경 없이 다중모odal 작업, 예를 들어 이미지 및 음성 인식에 효과적으로 적용될 수 있는가?
  • RQ4CAPE는 자동 음성 인식에서 패딩 없는 학습을 가능하게 하는가? 그리고 표준 CTC나 seq2seq 학습과 비교해 어떻게 되는가?
  • RQ5CAPE는 하이퍼파rameter 설정에 따라 모델 안정성에 어떤 영향을 미치는가?

주요 결과

  • CAPE는 표준 절대적 및 상대적 위치 임베딩보다 기계 번역, 이미지 인식 및 음성 인식 작업 전반에서 일반화 성능을 향상시킨다.
  • 기계 번역에서 CAPE는 기준 모델보다 낮은 WER(단어 오류율)을 달성하며, CTC 기반 모델에서 TED-LIUM v3에서 최대 1.5% 상대적 향상이 있었다.
  • 이미지 인식에서 CAPE로 훈련된 단일 UniViT 모델은 미리보지 않은 이미지 해상도에 더 잘 일반화되며, 단일 해상도 기반 모델보다 성능이 뛰어나다.
  • ASR에서 CAPE 기반 훈련은 패딩이 필요 없게 하여 성능 저하 없이 더 효율적인 엔드 투 엔드 훈련을 가능하게 한다.
  • CAPE의 계산 비용은 무시할 만큼 낮으며, 순방향 및 역방향 전파에 속도 저하가 없다. 반면 상대적 위치 임베딩은 V100 GPU에서 2배의 속도 저하를 초래한다.
  • CAPE는 하이퍼파rameter 설정, 특히 학습률과 가중치 감쇠에 대해 더 뛰어난 안정성을 보이며, 표준 절대 임베딩보다 강건성을 뛰어나게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.