[논문 리뷰] Fast Interleaved Bidirectional Sequence Generation
이 논문은 순서를 번갈아 배치하고 수정된 자기주의 마스크를 사용하여 동시에 좌에서 우로 및 우에서 좌로의 방향에서 토큰을 생성함으로써 신경 시퀀스 생성을 가속화하는 Interleaved Bidirectional Decoder (IBDecoder)를 제안한다. 이 방법은 자동회귀적 디코딩 대비 최대 11배의 속도 향상을 이룩하며 번역 및 요약 품질은 유사하거나 더 뛰어나며, 먼 거리에 있는 인접하지 않은 토큰 간의 독립성 가정이 더 유리하기 때문에 좌에서 우로의 반자기회귀적 디코딩보다 뛰어난 성능을 발휘한다.
Independence assumptions during sequence generation can speed up inference, but parallel generation of highly inter-dependent tokens comes at a cost in quality. Instead of assuming independence between neighbouring tokens (semi-autoregressive decoding, SA), we take inspiration from bidirectional sequence generation and introduce a decoder that generates target words from the left-to-right and right-to-left directions simultaneously. We show that we can easily convert a standard architecture for unidirectional decoding into a bidirectional decoder by simply interleaving the two directions and adapting the word positions and self-attention masks. Our interleaved bidirectional decoder (IBDecoder) retains the model simplicity and training efficiency of the standard Transformer, and on five machine translation tasks and two document summarization tasks, achieves a decoding speedup of ~2X compared to autoregressive decoding with comparable quality. Notably, it outperforms left-to-right SA because the independence assumptions in IBDecoder are more felicitous. To achieve even higher speedups, we explore hybrid models where we either simultaneously predict multiple neighbouring tokens per direction, or perform multi-directional decoding by partitioning the target sequence. These methods achieve speedups to 4X-11X across different tasks at the cost of <1 BLEU or <0.5 ROUGE (on average). Source code is released at https://github.com/bzhangGo/zero.
연구 동기 및 목표
- 신경 모델에서 자동회귀적 시퀀스 생성의 느린 추론 속도 문제를 해결하기 위해.
- 반자기회귀적 디코딩에서 발생하는 독립성 가정으로 인한 품질 저하를 줄이기 위해.
- 단방향 또는 반자기회귀적 접근 방식에 비해 더 효과적인 대안으로 이중방향 생성을 탐색하기 위해.
- 모델 파rameter를 추가하거나 훈련 오버헤드를 크게 증가시키지 않고도 효율적이고 고속의 디코딩을 가능하게 하기 위해.
- 기존 방법보다 더 높은 속도 향상을 달성하면서도 경쟁 가능한 생성 품질을 유지하기 위해.
제안 방법
- IBDecoder는 좌에서 우로와 우에서 좌로의 생성 방향에서 나온 토큰들을 하나의 시퀀스로 번갈아 배치하여 타겟 시퀀스를 재구성한다.
- 표준 트랜스포머 디코더 호환성을 유지하면서도 내부 및 상호 방향 간의 주의를 가능하게 하기 위해 단어 위치와 자기주의 마스크를 수정한다.
- 두 방향의 대응 위치 간에 독립성을 가정한다 (예: y₁과 yₙ). 이로 인해 병렬 생성이 가능해진다.
- 표준 단방향 디코더(예: 트랜스포머)와 호환되며, 시퀀스 재정렬과 마스크 조정만으로도 구현 가능하다.
- 하이브리드 변종은 IBDecoder에 다중어절 예측(SA) 또는 다중방향 분할(IMDecoder)을 통합하여 더 높은 속도 향상을 달성한다.
- 이 방법은 추가적인 파rameter 없이도 종단 간 훈련이 가능하며, 복잡한 데이터 구성도 필요로 하지 않는다.
실험 결과
연구 질문
- RQ1표준 트랜스포머 디코더에 아키텍처 변경 없이 이중방향 시퀀스 생성을 효율적으로 통합할 수 있는가?
- RQ2좌에서 우로와 우에서 좌로의 생성을 번갈아 배치하는 방식이 좌에서 우로의 반자기회귀적 방법에 비해 품질 저하를 줄이는가?
- RQ3이중방향 생성에서의 독립성 가정이 단방향 반자기회귀적 디코딩보다 해로운 영향을 덜 미치는가?
- RQ4이러한 접근 방식을 다양한 시퀀스 생성 작업에 적용했을 때 최소한의 품질 손실로 어떤 정도의 속도 향상을 달성할 수 있는가?
- RQ5다중어절 예측 또는 다중방향 분할 전략을 적용했을 때 이 방법은 어떻게 스케일링되는가?
주요 결과
- IBDecoder는 다섯 개의 기계 번역 및 두 개의 요약 작업에서 자동회귀적 디코딩 대비 2배의 속도 향상을 기록했으며, BLEU 및 ROUGE 점수는 유사한 수준을 유지했다.
- 평균적으로 IBDecoder에 반자기회귀적 확장(IA-Decoder+SA)을 적용했을 경우, 작업 간 평균 4.2배에서 11.15배의 속도 향상을 기록했으며, BLEU 점수는 1점 이하, ROUGE 점수는 0.5점 이하의 감소만을 보였다.
- 모델는 품질 측면에서 좌에서 우로의 반자기회귀적 디코딩을 능가했으며, 이는 이중방향 독립성 가정이 단방향 가정보다 해로운 영향이 덜하다는 것을 보여준다.
- 지식 증류를 적용한 결과, IBDecoder는 BLEU 및 ROUGE 점수 측면에서 여섯 개 작업 중 다섯 개에서 표준 트랜스포머 기준선을 초월했다.
- CDMail 요약 작업(긴 시퀀스 벤치마크)에서는 3.02배의 속도 향상을 기록했으며, 이는 일반적으로 비자기회귀 모델이 성능을 발휘하기 어려운 분야였다.
- 이 방법은 모델 압축과 같은 다른 속도 향상 기법과 수직적으로 결합 가능하며, 추가적인 성능 향상에 기여할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.