[논문 리뷰] WeNet: Production oriented Streaming and Non-streaming End-to-End Speech Recognition Toolkit
WeNet는 스트리밍 및 비스트리밍 ASR를 하나의 U2 아키텍처를 통해 통합하는 프로덕션 준비 완료된 오픈소스 엔드 투 엔드 음성 인식 툴킷입니다. 이는 CTC와 어텐션 디코딩을 결합한 새로운 이중패스 U2 아키텍처를 기반으로 하며, AISHELL-1에서 상대적 CER 감소율 5.03%를 달성하고, PyTorch 및 TorchScript를 통해 서버 및 엣지 디바이스에서 최적화된 런타임을 통해 저지연 시간 추론을 지원합니다.
In this paper, we propose an open source, production first, and production ready speech recognition toolkit called WeNet in which a new two-pass approach is implemented to unify streaming and non-streaming end-to-end (E2E) speech recognition in a single model. The main motivation of WeNet is to close the gap between the research and the production of E2E speechrecognition models. WeNet provides an efficient way to ship ASR applications in several real-world scenarios, which is the main difference and advantage to other open source E2E speech recognition toolkits. In our toolkit, a new two-pass method is implemented. Our method propose a dynamic chunk-based attention strategy of the the transformer layers to allow arbitrary right context length modifies in hybrid CTC/attention architecture. The inference latency could be easily controlled by only changing the chunk size. The CTC hypotheses are then rescored by the attention decoder to get the final result. Our experiments on the AISHELL-1 dataset using WeNet show that, our model achieves 5.03\% relative character error rate (CER) reduction in non-streaming ASR compared to a standard non-streaming transformer. After model quantification, our model perform reasonable RTF and latency.
연구 동기 및 목표
- 엔드 투 엔드(End-to-End, E2E) 음성 인식 모델의 연구와 프로덕션 배포 사이의 격차를 해소하기 위해.
- 개발, 훈련, 배포 비용을 줄이기 위해 스트리밍 및 비스트리밍 ASR를 하나의 모델에서 통합하기 위해.
- 서버 및 엣지 디바이스를 포함한 다양한 하드웨어 플랫폼에서 효율적이고 저지연 시간 추론을 가능하게 하기 위해.
- PyTorch 및 TorchScript를 사용해 연구 훈련에서 프로덕션 추론으로의 원활한 전환을 제공하기 위해.
- 정량화, 동적 청크 기반 기법, 플랫폼 간 이식성 향상된 런타임 최적화를 통해 모델 효율성을 극대화하기 위해.
제안 방법
- U2 프레임워크 제안: 공유 인코더(Transformer 또는 Conformer), CTC 디코더, 어텐션 디코더를 갖춘 이중패스 공동 CTC/어텐션 모델.
- 동적 청크 기반 자기어텐션을 사용해 가변 길이의 수신 영역을 허용함으로써 스트리밍 추론을 가능하게 함.
- 이중패스 디코딩 전략 적용: 첫 번째 패스는 스트리밍 가설 생성을 위한 CTC 디코딩, 두 번째 패스는 재평가 및 정확도 향상을 위한 어텐션 디코딩.
- 공유 인코더가 제한된 오른쪽 컨텍스트로 입력을 처리하는 하이브리드 CTC/어텐션 아키텍처를 활용해 지연 시간과 성능의 균형을 확보함.
- Caual Convolution을 사용한 동적 청크 훈련을 통해 스트리밍을 지원하면서도 전역 컨텍스트 모델링 능력을 유지함.
- TorchScript를 통한 모델 내보내기 및 여러 런타임(예: LibTorch, ONNX, OpenVINO, MNN, NCNN)에서의 배포를 지원해 플랫폼 간 호환성을 확보함.

실험 결과
연구 질문
- RQ1통합된 E2E 모델이 별도의 모델 훈련 없이도 스트리밍 및 비스트리밍 ASR 시나리오에서 높은 정확도를 달성할 수 있는가?
- RQ2동적 청크 기반 기법과 어텐션 메커니즘을 어떻게 조합하여 저지연 시간을 유지하면서도 정확도를 보존할 수 있는가?
- RQ3CTC와 어텐션 디코딩을 갖춘 단일 모델이 실세계 배포 환경에서 지연 시간을 줄이고 추론 효율성을 향상시키는 데 얼마나 기여하는가?
- RQ4이중패스 재평가 메커니즘이 표준 비스트리밍 모델 대비 문자 오류율(CER)에 어떤 영향을 미치는가?
- RQ5정량화 및 런타임 최적화가 실시간 요인(RTF)과 엔드 투 엔드 지연 시간에 실환경에서 어떤 영향을 미치는가?
주요 결과
- U2 모델은 표준 비스트리밍 Transformer 모델 대비 AISHELL-1 데이터셋에서 상대적 CER 감소율 5.03%를 달성함.
- 15,000시간의 중국어 데이터셋에서 U2 모델은 AISHELL-1에서 3.70% CER를 기록했으며, 전체 어텐션 디코딩을 사용할 경우 기준 모델인 전체 어텐션 기반 Conformer의 3.96%보다 우수한 성능을 보임.
- x86 서버 플랫폼에서 최종 지연 시간(L3)은 청크 크기 4일 때 130ms이며, 주로 재평가 비용(L2)인 약 114ms에 의해 지배됨.
- 다양한 청크 크기에서 재평가 비용은 거의 일정하게 유지되며, 이는 지연 시간 감소 전략이 두 번째 패스 어텐션 디코딩 최적화에 초점을 맞춰야 함을 시사함.
- 16프레임 청크 크기에서도 높은 성능 유지가 가능하며, CER에 대한 유의미한 저하 없이 저지연 시간 환경에서의 실용적 배포를 지원함.
- 툴킷은 훈련된 모델을 직접 TorchScript를 통해 내보내고, x86 및 ARM 플랫폼에서의 배포를 지원함으로써 프로덕션 준비 상태를 입증함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.