[논문 리뷰] A Compact End-to-End Model with Local and Global Context for Spoken Language Identification
TitaNet-LID는 국소적이고 전반적인 맥락을 포착하기 위해 1차원 깊이 분리형 합성곱과 스queeze-엑스큐이즈 모듈을 결합한 컴act한 엔드 투 엔드 신경망으로, 말하는 언어 식별을 위한 것이다. 최신의 SSL 모델보다 10배 작음에도 불구하고 FLEURS 벤치마크에서 88.2%의 최신 기술 수준 정확도를 달성하며, 간단한 파인튜닝을 통해 짧은 발화(<5초)에서도 강인하게 작동한다.
We introduce TitaNet-LID, a compact end-to-end neural network for Spoken Language Identification (LID) that is based on the ContextNet architecture. TitaNet-LID employs 1D depth-wise separable convolutions and Squeeze-and-Excitation layers to effectively capture local and global context within an utterance. Despite its small size, TitaNet-LID achieves performance similar to state-of-the-art models on the VoxLingua107 dataset while being 10 times smaller. Furthermore, it can be easily adapted to new acoustic conditions and unseen languages through simple fine-tuning, achieving a state-of-the-art accuracy of 88.2% on the FLEURS benchmark. Our model is scalable and can achieve a better trade-off between accuracy and speed. TitaNet-LID performs well even on short utterances less than 5s in length, indicating its robustness to input length.
연구 동기 및 목표
- 모델 크기를 최소화하면서도 높은 정확도를 유지하는 컴팩트한 엔드 투 엔드 신경망을 개발하여 말하는 언어 식별(LID)을 수행한다.
- 간단한 파인튜닝을 통해 새로운 언어와 새로운 음성 조건에 효과적으로 적응할 수 있도록 한다.
- 실제 응용에서 흔한 짧은 음성 세그먼트(<5초)에서도 강력한 성능을 발휘하도록 한다.
- 계산 자원이 제한된 환경에서 배포에 적합한 정확도와 추론 속도의 균형을 이룰 수 있는 확장 가능한 아키텍처를 제공한다.
- 자기지도 학습 전훈 없이도 훨씬 큰 SSL 기반 모델의 성능을 따라하거나 능가할 수 있는 경량 모델이 LID 벤치마크에서 우수한 성능을 낼 수 있음을 입증한다.
제안 방법
- 국소적 특징을 효율적으로 추출하기 위해 1차원 깊이 분리형 합성곱을 사용한 ContextNet 기반 인코더를 사용한다.
- 채널별 특징 반응을 재조정하여 전반적 맥락을 모델링하기 위해 스queeze-엑스큐이즈(SE) 레이어를 통합한다.
- 인코더 이후에 통계 풀링 레이어와 두 개의 완전 연결 레이어를 배치하여 고정 길이의 발화 수준 표현을 생성한다.
- 아키텍처는 확장 가능하다: 모델의 깊이(깊이)는 반복 블록 수(R)로 조절되고, 너비는 필터 수(C)로 조절된다.
- 모델은 VoxLingua107에서 끝내기 전에 엔드 투 엔드로 훈련되며, FLEURS에서 파인튜닝되어 알려지지 않은 언어로의 제로샷 일반화를 가능하게 한다.
- 구현은 NVIDIA NeMo를 통해 공개되어 있어 쉽게 배포 및 적응이 가능하다.
![Figure 1: TitaNet-LID- $B$ x $R$ x $C$ Encoder is based on ContextNet architecture [ 20 ] , where $B$ is the number of blocks, $R$ is the number of repeated ``basic” blocks and $C$ is the number of filters in the convolution layers of each block.](https://ar5iv.labs.arxiv.org/html/2210.15781/assets/titanet-lid_arch.png)
실험 결과
연구 질문
- RQ1자기지도 학습 전훈 없이 국소적 및 전반적 맥락 메커니즘을 갖춘 컴팩트한 엔드 투 엔드 모델이 말하는 언어 식별에서 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ2제한된 데이터로 파인튜닝했을 때, 모델은 알려지지 않은 언어와 새로운 음성 조건으로의 일반화 능력이 얼마나 뛰어나게 되는가?
- RQ3입력 세그먼트 길이의 영향, 특히 짧은 발화(<5초)에서의 정확도에 대해 어떤가?
- RQ4다양한 배포 환경에 맞게 정확도와 추론 속도의 균형을 이루기 위해 모델 크기를 효과적으로 확장할 수 있는가?
- RQ5정확도와 파rameter 효율성 측면에서 경량 모델은 큰 SSL 기반 모델과 비교해 어떻게 성능을 낼 수 있는가?
주요 결과
- TitaNet-LID-3x5x1024(29M 파라미터)는 FLEURS 벤치마크에서 88.2%의 매크로 정확도를 기록하며 이전 최신 기술 수준 모델보다 16.8% 높은 성능을 보였다.
- VoxLingua107에서는 28.9M 파라미터로 95.0%의 매크로 정확도를 달성했으며, 21M 파라미터 기반의 ECAPA-TDNN-LID 베이스라인을 능가했다.
- 짧은 발화(<5초)에서도 TitaNet-LID는 강력한 성능을 유지하며, 입력 길이 변화에 대한 강인함을 입증했다.
- FLEURS와 VoxLingua107의 결합 데이터로 파인튜닝하면 모델이 127개 언어를 93.8%의 매크로 정확도로 예측할 수 있었다.
- XLS-R(0.3B) 모델보다 10배 작으면서도 VoxLingua107에서 유사한 성능을 내었고, w2v-bert-51(0.6B)보다 20배 작으면서도 FLEURS에서 그를 능가했다.
- 필터 수(C)와 블록 반복 수(R)를 늘려 모델을 확장하면 정확도가 향상되었으며, TitaNet-LID-3x5x2048는 95.9%의 매크로 정확도를 기록했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.