[논문 리뷰] Transformer with Bidirectional Decoder for Speech Recognition
이 논문은 공유 인코더와 이중 단방향 디코더를 사용하여 좌에서 우로 및 우에서 좌로 모두 음성 토큰을 동시 예측하는 양방향 디코더를 갖춘 음성 트랜스포머(STBD)를 제안한다. 추론 시 이중 방향 빔 서치를 적용하고 양 방향에서 가장 높은 점수를 받은 가설을 선택함으로써, STBD는 언어 모델 재평가나 데이터 증강 없이도 AISHELL-1에서 3.6% 상대적인 CER 감소를 달성하며, STBD-Big 모델은 6.64% CER에 도달한다.
Attention-based models have made tremendous progress on end-to-end automatic speech recognition(ASR) recently. However, the conventional transformer-based approaches usually generate the sequence results token by token from left to right, leaving the right-to-left contexts unexploited. In this work, we introduce a bidirectional speech transformer to utilize the different directional contexts simultaneously. Specifically, the outputs of our proposed transformer include a left-to-right target, and a right-to-left target. In inference stage, we use the introduced bidirectional beam search method, which can not only generate left-to-right candidates but also generate right-to-left candidates, and determine the best hypothesis by the score. To demonstrate our proposed speech transformer with a bidirectional decoder(STBD), we conduct extensive experiments on the AISHELL-1 dataset. The results of experiments show that STBD achieves a 3.6\% relative CER reduction(CERR) over the unidirectional speech transformer baseline. Besides, the strongest model in this paper called STBD-Big can achieve 6.64\% CER on the test set, without language model rescoring and any extra data augmentation strategies.
연구 동기 및 목표
- 기존의 좌에서 우로 순차적 생성만을 고려하는 자동회귀적 음성 트랜스포머의 한계를 해결하기 위해 우에서 좌로의 맥락을 무시하는 문제를 해결한다.
- 학습 및 추론 모두에서 양방향 맥락을 통합함으로써 자동회귀적 디코딩에서 발생하는 노출 오차를 완화한다.
- 외부 언어 모델이나 데이터 증강에 의존하지 않고도 자동 음성 인식 성능을 향상시키는 것을 목표로 한다.
- 엔드 투 엔드 ASR에서 이중 목표와 이중 빔 서치의 효과성을 조사한다.
제안 방법
- 모델은 공유 인코더와 두 개의 단방향 디코더(좌에서 우로, 우에서 좌로)를 사용하여 양 방향에서 동시에 예측이 가능하도록 한다.
- 학습 시, 교차 엔트로피 손실를 사용하여 좌에서 우로 및 우에서 좌로의 목표를 동시에 최적화함으로써 네트워크가 이중 맥락에서 학습하도록 한다.
- 추론 시, 좌에서 우로 및 우에서 좌로 디코딩을 위한 별도의 빔을 유지하는 이중 방향 빔 서치를 적용하며, 양 방향에서의 후보를 동적으로 갱신한다.
- 최종 가설은 모든 좌에서 우로 및 우에서 좌로 후보 중에서 가장 높은 총점수를 가진 것을 선택함으로써 정확도 향상과 오류 전파 감소를 달성한다.
- 두 디코더 간에 가중치를 공유함으로써 효율성을 유지하면서도 이중 맥락 학습이 가능하도록 한다.
- 모델은 문자 수준의 ASR을 위해 AISHELL-1 데이터셋에서 평가되었으며, 빔 크기와 디코딩 전략에 대한 분석 실험도 수행되었다.

실험 결과
연구 질문
- RQ1좌에서 우로 및 우에서 좌로의 동시 예측이 자동 음성 인식 성능 향상에 기여하는가?
- RQ2일반적인 단방향 빔 서치에 비해 이중 방향 빔 서치가 더 나은 가설 선택을 이끌어내는가?
- RQ3학습 시 이중 목표를 사용함으로써 추론 중 누적 오류가 얼마나 감소하는가?
- RQ4언어 모델이나 데이터 증강 없이도 이중 방향 디코딩이 얼마나 유연성과 내성적 안정성 향상에 기여하는가?
주요 결과
- STBD 모델은 AISHELL-1 테스트 세트에서 단방향 음성 트랜스포머 기준보다 3.6% 상대적인 CER 감소를 달성한다.
- STBD-Big 모델은 언어 모델 재평가나 데이터 증강 없이도 AISHELL-1 테스트 세트에서 6.64% CER에 도달한다.
- 이중 빔 서치 방법은 동일한 모델을 사용하더라도 표준 단방향 빔 서치보다 성능 향상을 이룬다.
- 테스트 문장의 49.4%가 오른쪽에서 왼쪽으로 디코딩이 더 정확하게 수행되었으며, 이는 양 방향 간의 상호 보완적 강점이 있음을 시사한다.
- 분석 실험 결과, 빔 크기를 증가시키면 성능 향상이 이루어지나, 빔 크기가 2를 초과하면 성능 향상이 포화 상태에 도달함을 확인하였다.
- 어텐션 정렬 시각화 결과, 좌에서 우로 디코더는 왼쪽 아래에서 오른쪽 위로 대각선 방향으로 어텐션을 집중하는 반면, 우에서 좌로 디코더는 오른쪽 아래에서 왼쪽 위로 어텐션을 집중함을 확인하여, 방향성에 따른 정상적인 행동이 유지됨을 검증하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.