Skip to main content
QUICK REVIEW

[논문 리뷰] Towards audio language modeling -- an overview

Haibin Wu, Xuanjun Chen|arXiv (Cornell University)|2024. 02. 20.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

이 논문은 신경 음성 코덱과 코덱 기반 음성 언어모델(LM)에 대한 종합적이고 체계적인 리뷰를 제공하며, 아키텍처, 학습 방법, 응용 분야를 분석한다. 여섯 개의 오픈소스 코덱과 열한 개의 코덱 기반 LM을 비교하여 다중모odal 음성 생성, 음성 합성, 제로샷 전이에 대한 이산 토큰화의 활용을 강조하며, 모델 설계, 비트레이트 효율성, 음성, 음악, 일반 음성 작업 전반에서의 성능에 대한 핵심 통찰을 제공한다.

ABSTRACT

Neural audio codecs are initially introduced to compress audio data into compact codes to reduce transmission latency. Researchers recently discovered the potential of codecs as suitable tokenizers for converting continuous audio into discrete codes, which can be employed to develop audio language models (LMs). Numerous high-performance neural audio codecs and codec-based LMs have been developed. The paper aims to provide a thorough and systematic overview of the neural audio codec models and codec-based LMs.

연구 동기 및 목표

  • 음성 표현 학습 분야에서 급속도로 변화하는 분야에서 신경 음성 코덱과 코덱 기반 언어모델을 체계적으로 비교한 리뷰가 부족한 점을 보완하기 위해.
  • 여섯 가지 대표적인 오픈소스 신경 코덱 모델의 학습 방법론, 구현 설정, 사용된 데이터를 분석하기 위해.
  • 열한 가지의 다양한 코덱 기반 언어모델이 이산 음성 토큰을 어떻게 활용하여 텍스트-음성 합성, 음성-음성 번역, 음악 생성과 같은 다중모달 작업을 수행하는지 분석하기 위해.
  • 통합 음성 언어모델과 효율적이고 고해상도의 신경 코덱 개발을 위한 향후 연구 방향과 실질적인 통찰을 제공하기 위해.

제안 방법

  • SoundStream, SoundStorm, Encodec, AudioDec, AcademiCodec, SpeechTokenizer의 여섯 개의 오픈소스 신경 코덱 모델을 깊이 있게 비교 분석하여 아키텍처, 학습 목표, 데이터에 중점을 둔다.
  • 각 코덱 기반 LM이 이산 토큰을 어떻게 처리하여 후행 작업을 수행하는지 분석함으로써 이러한 코덱의 언어모델 통합을 평가한다.
  • 입력 모odal(텍스트, 음성, 음소, MIDI), 출력 유형, TTS, ASR, S2ST, 음악 생성, 음성 편집과 같은 지원 작업을 기준으로 코덱 기반 언어모델을 분류하고 비교한다.
  • 잔차 벡터 양자화(RVQ)의 사용, 순차적 비순차적 복원 방식, Transformer 또는 LSTM 모듈을 통한 시퀀스 모델링 통합 여부 등을 포함한 모델 구성 요소를 체계적인 프레임워크로 비교한다.
  • 사전 학습된 음성 표현(Hubert, wav2vec 2.0 등)과 이산 단위가 텍스트 없는 음성 언어모델링 및 제로샷 전이를 가능하게 하는 역할을 분석한다.
  • 문맥 기반 학습, 지시 테이닝 등 프롬프팅 기법이 음성 LM의 능력을 생성을 넘어서 음성 번역, 편집 등의 작업으로 확장하는 데 어떻게 활용되는지 검토한다.
Figure 1: Timeline of current neural codec models and codec-based language models.
Figure 1: Timeline of current neural codec models and codec-based language models.

실험 결과

연구 질문

  • RQ1다양한 신경 코덱 아키텍처는 음성 및 음성 복원 성능 측면에서 설계, 학습 목표에서 어떻게 다릅니까?
  • RQ2고해상도 음성에 최적화된 코덱과 저비트레이트, 고효율 응용을 위한 코덱 간의 주요 아키텍처 및 학습 차이점은 무엇입니까?
  • RQ3코덱 기반 언어모델은 이산 음성 토큰을 어떻게 활용하여 텍스트-음성 합성, 음악 생성, 음성 번역과 같은 다양한 다중모달 작업을 수행합니까?
  • RQ4텍스트 없는 음성 언어모델을 구축할 때 사전 학습된 음성 표현(Hubert 등)과 종단간에 학습된 이산 단위 사이의 상호 교환 가능성은 무엇입니까?
  • RQ5생성 기능을 넘어서 음성 편집 및 번역과 같은 작업으로 기능을 확장하기 위해 코덱 기반 언어모델에 가장 효과적인 프롬프팅 및 피넷팅 전략은 무엇입니까?

주요 결과

  • AcademiCodec는 그룹 잔차 벡터 양자화를 사용하여 1초당 비트레이트(BPS)를 1.5로 낮춰 음성 언어모델링을 위한 시퀀스 길이를 크게 단축시켰다.
  • Encodec는 이산 음성 토큰 내 장거리 의존성을 더 잘 포착하기 위해 LSTM과 Transformer 모듈을 통합함으로써 시퀀스 모델링 성능을 향상시켰다.
  • SoundStorm은 신뢰도 기반 전략을 사용하여 비순차적 복원 방식을 통해 병렬 복원을 가능하게 하여 낮은 지연 시간으로 고품질 음성 생성을 달성했다.
  • VALL-E, MusicGen, AudioPaLM과 같은 코덱 기반 언어모델은 EnCodec와 SoundStream의 이산 토큰을 사용하여 TTS, S2ST, ASR 등 다양한 작업에서 강력한 제로샷 일반화 성능을 보였다.
  • UniAudio와 LauraGPT는 텍스트, 멜스펙트로그램, MIDI 등 다양한 입력을 조건으로 삼아 음성 향상, 음성 변환, 텍스트-음악 생성 등 광범위한 작업을 지원한다.
  • 자기지도 학습 모델에서 유도된 이산 단위(Hubert, wav2vec 2.0 등)의 통합은 텍스트 없는 음성 언어모델링을 가능하게 하였으며, TWIST와 pGSLM과 같은 모델은 음성 계속 작성 및 다음 토큰 예측에서 뛰어난 성능을 달성했다.
Figure 2: Codec-based Language Modeling
Figure 2: Codec-based Language Modeling

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.