[논문 리뷰] FunASR: A Fundamental End-to-End Speech Recognition Toolkit
FunASR는 학술 연구와 산업 적용 간 격차를 메우기 위해 고정확도, 대규모 사전 훈련 모델—특히 60,000시간의 중국어 음성 데이터로 훈련된 비자기적 모델인 Paraformer—를 제공하는 오픈소스 엔드 투 엔드 음성 인식 툴킷입니다. 또한 최적화된 추론 파이프라인, VAD, 문장 부호 모델을 함께 제공합니다. AISHELL에서 1.95% CER를 기록하며 최신 기술 수준의 성능을 달성했고, 자기적 모델 대비 12배 빠른 추론 속도를 확보하여 CPU 및 GPU 플랫폼에서 효율적이고 정밀한 구현이 가능합니다.
This paper introduces FunASR, an open-source speech recognition toolkit designed to bridge the gap between academic research and industrial applications. FunASR offers models trained on large-scale industrial corpora and the ability to deploy them in applications. The toolkit's flagship model, Paraformer, is a non-autoregressive end-to-end speech recognition model that has been trained on a manually annotated Mandarin speech recognition dataset that contains 60,000 hours of speech. To improve the performance of Paraformer, we have added timestamp prediction and hotword customization capabilities to the standard Paraformer backbone. In addition, to facilitate model deployment, we have open-sourced a voice activity detection model based on the Feedforward Sequential Memory Network (FSMN-VAD) and a text post-processing punctuation model based on the controllable time-delay Transformer (CT-Transformer), both of which were trained on industrial corpora. These functional modules provide a solid foundation for building high-precision long audio speech recognition services. Compared to other models trained on open datasets, Paraformer demonstrates superior performance.
연구 동기 및 목표
- 엔드 투 엔드 음성 인식 분야에서 학술 연구와 산업 적용 간 격차를 해소하기 위해.
- 특히 중국어를 위해 대규모 산업 데이터 코퍼스로 훈련된 고정밀도, 대규모 사전 훈련 모델을 제공하기 위해.
- AMP 양자화 및 최적화된 추론 백엔드(ONNX, TensorRT, libtorch)를 통해 효율적이고 실용적인 구현을 가능하게 하기 위해.
- 소규모 도메인 특화 데이터로 쉽게 최적화를 통해 도메인 적응을 지원하기 위해.
- 완전한 ASR 파이프라인 구현을 위해 VAD 및 문장 부호 복원과 같은 보조 모듈을 통합하기 위해.
제안 방법
- 핵심 모델인 Paraformer는 수작업으로 타이핑된 중국어 음성 데이터 60,000시간에 대해 훈련된 비자기적 엔드 투 엔드 ASR 모델입니다.
- 특정 용어의 정확도 향상과 시간적 정렬을 향상시키기 위해 Paraformer 기반 아키텍처에 타임스탬프 예측 및 핫워드 커스터마이제이션 기능을 추가했습니다.
- 산업 데이터 기반으로 훈련된 FSMN-VAD 기반 음성 활동 검출(VAD) 모델을 오픈소스로 제공하여 강력한 음성 탐지 성능을 확보했습니다.
- CT-Transformer를 사용한 텍스트 후처리 모델을 제공하여 문장 부호 예측 및 불순화 제거 기능을 수행합니다.
- PyTorch 기반의 레시피 기반 파이프라인을 통해 초기 훈련 및 최적화 훈련을 지원하며, AISHELL, LibriSpeech, WenetSpeech 데이터셋을 모두 지원합니다.
- AMP 양자화 및 여러 백엔드(ONNX, libtorch, TensorRT)를 통해 추론 속도를 가속화하여 CPU 및 GPU 플랫폼에서의 구현을 가능하게 했습니다.
실험 결과
연구 질문
- RQ1대규모 산업 음성 데이터로 훈련된 비자기적 엔드 투 엔드 모델이 중국어 ASR 벤치마크에서 기존 모델을 초월할 수 있는가?
- RQ2소규모 도메인 특화 데이터로 대규모 사전 훈련 모델을 최적화할 경우, 정확도 향상과 핵심어 검색률 향상에 얼마나 효과적인가?
- RQ3VAD 및 문장 부호 복원과 같은 보조 모듈이 실생활 응용에서 엔드 투 엔드 ASR 시스템의 강건성과 사용성에 크게 기여하는가?
- RQ4실제 구현 환경에서 자기적 모델 대비 비자기적 모델인 Paraformer의 추론 효율성 향상 수준은 어느 정도인가?
- RQ5자동 혼합 정밀도(AMP) 양자화가 정확도 손실 없이 추론 속도를 얼마나 향상시킬 수 있는가?
주요 결과
- Paraformer-large는 AISHELL 테스트 세트에서 1.95% CER를 기록하여 Conformer를 능가하며, 대규모 산업 데이터 훈련의 이점을 입증했습니다.
- V100 GPU에서 자동적 모델 대비 12배 빠른 추론 속도를 확보했으며, INT8 양자화 시 RTF는 0.1026에서 0.0446으로 감소했습니다.
- 물류 분야의 200시간 도메인 특화 데이터로 최적화한 결과, CER는 13.1%에서 12.6%로 개선되었고, 장기간 테스트 세트에서 도메인 핵심어 검색률은 74.0%에서 96.0%로 상승했습니다.
- CT-Transformer 모델은 문장 부호 및 불순화 제거에서 F1 점수 70.5를 기록했으며, 전체 Transformer 기반 모델 대비 1.9배 빠른 추론 속도를 확보했습니다.
- AMP 양자화로 추론 시간이 40% 감소했고(RTF 0.1026 → 0.0446), 정확도 손실 없이 효율적인 CPU 구현이 가능해졌습니다.
- ONNX, libtorch, TensorRT 백엔드를 통해 CPU, GPU, 모바일 플랫폼 전반에서 고정밀도, 저지연 구현이 가능한 툴킷을 제공합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.