Skip to main content
QUICK REVIEW

[논문 리뷰] Multiclass Language Identification using Deep Learning on Spectral Images of Audio Signals

Shauna Revay, Matthew Teschke|arXiv (Cornell University)|2019. 05. 10.
Speech Recognition and Synthesis참고 문헌 7인용 수 38
한 줄 요약

이 논문은 LIFAS를 제안하는데, CNN 기반 접근으로 원시 오디오의 즉석 멜-스펙트로그램을 사용해 언어를 식별하며 6개 언어에서 짧은 4초 클립으로 이진 정확도 97%, 다중 클래스 정확도 89%를 달성한다.

ABSTRACT

The first step in any voice recognition software is to determine what language a speaker is using, and ideally this process would be automated. The technique described in this paper, language identification for audio spectrograms (LIFAS), uses spectrograms generated from audio signals as inputs to a convolutional neural network (CNN) to be used for language identification. LIFAS requires minimal pre-processing on the audio signals as the spectrograms are generated during each batch as they are input to the network during training. LIFAS utilizes deep learning tools that are shown to be successful on image processing tasks and applies it to audio signal classification. LIFAS performs binary language classification with an accuracy of 97\%, and multi-class classification with six languages at an accuracy of 89\% on 3.75 second audio clips.

연구 동기 및 목표

  • 자동 언어 식별의 동기를 음성 비서 및 전사 시스템의 한 단계로 제시합니다.
  • 외부 특징 추출 없이 원시 오디오로 생성된 스펙트로그램에서 작동하는 엔드-투-엔드 CNN 기반 파이프라인을 제안합니다.
  • 짧은 오디오 세그먼트와 VoxForge 데이터를 활용해 여섯 가지 언어에서 거동 가능성을 보여줍니다.

제안 방법

  • 원시 오디오로부터 즉시 생성된 멜-스케일 스펙트로그램을 CNN 입력으로 사용합니다.
  • 잔차 연결을 갖춘 사전 학습된 ResNet-50 백본을 사용하여 강건한 특징 학습을 달성합니다.
  • 8 에포크 동안 수렴을 최적화하기 위해 1-cycle 학습률 정책으로 학습합니다.
  • 구현 및 데이터 처리를 위해 fast.ai/PyTorch 생태계를 활용합니다.
  • 이진 및 다중 클래스 언어 식별 성능을 평가합니다.

실험 결과

연구 질문

  • RQ1원시 오디오의 즉석 스펙트로그램 표현에서 작동하는 CNN이 다수의 언어에 걸쳐 정확하게 언어를 식별할 수 있는가?
  • RQ2이진 및 다중 클래스 작업에서 오디오 클립 길이가 언어 식별 정확도에 미치는 영향은 무엇인가?
  • RQ3ResNet 기반 아키텍처가 스펙트로그램 입력에서 언어 인식에 대해 기존의 특징 추출 방식과 비교하여 어떤 성능을 보이는가?

주요 결과

  • 영어와 러시아어의 이진 언어 식별은 60k 샘플 클립(3.75초)에서 97% 정확도를 달성합니다.
  • 더 긴 클립(100k 샘플)에서 이진 식별은 97% 정확도에 도달하여 이 설정에서 60k 샘플을 넘는 이점이 제한적임을 시사합니다.
  • 여섯 가지 언어에 대한 다중 클래스 식별은 60k 샘플 클립에서 89% 정확도에 도달합니다.
  • 이진 결과는 영어와 러시아어에서 강건한 성능을 보여주며 다른 언어로의 오분류가 거의 없습니다.
  • 이 연구는 교차 오염을 피하기 위해 주의 깊은 학습/검증 분리를 가진 VoxForge 데이터를 사용합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.