Skip to main content
QUICK REVIEW

[논문 리뷰] Segmental Audio Word2Vec: Representing Utterances as Sequences of Vectors with Applications in Spoken Term Detection

Yu‐Hsuan Wang, Hung-yi Lee|arXiv (Cornell University)|2018. 08. 07.
Speech Recognition and Synthesis참고 문헌 15인용 수 6
한 줄 요약

이 논문은 단말적 순차적 인코더-디코더 아키텍처를 사용하는 순차적 시퀀스-투-시퀀스 오토인코더(SSAE)와 강화학습을 융합한 공동 비지도 학습 프레임워크인 세그멘탈 오디오 워드2벡을 제안한다. 이는 동시에 말된 단어 분할과 오디오 임베딩 학습을 수행한다. 영어, 체코어, 프랑스어, 독일어에서 말된 용어 검출 작업에서, 이 방법은 홀로 기반 DTW 및 기준 분할 방법보다 뛰어난 성능을 보이며, 학습된 임베딩이 의미 있는 음소적 구조 정보를 담고 있음을 입증한다.

ABSTRACT

While Word2Vec represents words (in text) as vectors carrying semantic information, audio Word2Vec was shown to be able to represent signal segments of spoken words as vectors carrying phonetic structure information. Audio Word2Vec can be trained in an unsupervised way from an unlabeled corpus, except the word boundaries are needed. In this paper, we extend audio Word2Vec from word-level to utterance-level by proposing a new segmental audio Word2Vec, in which unsupervised spoken word boundary segmentation and audio Word2Vec are jointly learned and mutually enhanced, so an utterance can be directly represented as a sequence of vectors carrying phonetic structure information. This is achieved by a segmental sequence-to-sequence autoencoder (SSAE), in which a segmentation gate trained with reinforcement learning is inserted in the encoder. Experiments on English, Czech, French and German show very good performance in both unsupervised spoken word segmentation and spoken term detection applications (significantly better than frame-based DTW).

연구 동기 및 목표

  • 오디오 워드2벡이 사전에 분할된 단어 경계가 필요로 하는 한계를 해결하기 위해, 분할과 임베딩을 동시에 엔드 투 엔드 비지도 학습할 수 있도록 하는 것.
  • 전체 문장을 고정 차원의 벡터 시퀀스로 모델링하여 오디오 워드2벡을 단어 수준에서 문장 수준 표현으로 확장하는 것.
  • 분할과 표현의 공동 최적화를 통해 음소적 구조를 반영하는 임베딩을 학습하여 말된 용어 검출 성능을 향상시키는 것.
  • 이산적 분할 결정의 비가역성 문제를 해결하기 위해 정책 기반 강화학습을 적용하는 것.

제안 방법

  • 모델는 강화학습 에이전트에 의해 제어되는 인코더에 삽입된 세그멘탈 분할 게이트를 갖춘 세그멘탈 순차적-시퀀스 오토인코더(SSAE)를 사용한다.
  • 세그멘탈 게이트는 현재 음성 특징, 게이팅 활성 신호(GAS), 이전 동작을 조합한 상태 벡터를 사용하여 각 시간 단계에서 분할할지 여부를 결정한다.
  • RNN 기반 정책 네트워크가 상태를 처리하고 '분할' 또는 '통과' 동작의 확률을 출력하며, 학습 중에는 탐색을 장려하기 위해 동작를 샘플링한다.
  • 인코더 RNN은 분할 지점에서만 임베딩을 생성하고, 각 세그먼트 후에 은닉 상태를 초기화하여 각 임베딩 간의 독립성을 확보한다.
  • 재구성 오차를 최소화하고 문장당 합리적인 수의 세그먼트를 유도하기 위해 정책 기반 강화학습을 통해 모델을 훈련한다.
  • 세그먼트 수와 문장 길이 비율(r_{N/T})을 기반으로 한 정규화 항을 사용하여 세그먼트 수를 유도하고 과다 분할을 방지한다.
Fig. 1 : The segmental sequence-to-sequence autoencoder (SSAE). In addition to the encoder RNN (ER) and decoder RNN (DR), a segmentation gate (blocks S ) is included in the encoder for estimating the word boundaries. During transitions across the segment boundaries, encoder RNN and decoder RNN are r
Fig. 1 : The segmental sequence-to-sequence autoencoder (SSAE). In addition to the encoder RNN (ER) and decoder RNN (DR), a segmentation gate (blocks S ) is included in the encoder for estimating the word boundaries. During transitions across the segment boundaries, encoder RNN and decoder RNN are r

실험 결과

연구 질문

  • RQ1말된 단어 분할과 오디오 임베딩 학습을 동시에 최적화하여 말된 용어 검출과 같은 후행 작업의 성능을 향상시킬 수 있는가?
  • RQ2강화학습과 순차적-시퀀스 오토인코더를 융합함으로써, 세그먼트 경계와 음소 임베딩의 엔드 투 엔드 학습이 어떻게 가능해지는가?
  • RQ3휴리스틱 또는 기준 분할 방법에서 유도된 임베딩과 비교해 볼 때, 학습된 임베딩이 얼마나 많은 음소적 구조 정보를 담고 있는가?
  • RQ4다양한 언어에서 홀로 기반 동적 시간 왜곡(DTW)보다 제안된 방법이 말된 용어 검출 성능에서 뛰어나게 되는가?
  • RQ5세그멘탈 분할 성능 기준보다는 다소 낮은 F1 점수를 보였음에도 불구하고, 독일어에서 SSAE가 더 높은 STD 성능(13.82 MAP 대 0.27 MAP)을 달성한 이유는 무엇인가?

주요 결과

  • 말된 용어 검출에서 SSAE는 영어(23.27), 체코어(19.41), 프랑스어(21.70), 독일어(13.82)에서 평균 정밀도(MAP)를 기록했으며, 홀로 기반 DTW 기준보다 유의미하게 뛰어난 성능을 보였다.
  • 체코어에서는 SSAE가 분할 F1 점수 37.78을 기록하여 HAC(30.84)와 GAS(29.53)를 모두 앞서며, 무작위 기준(25.41)을 초월했다.
  • 영어에서는 재현율 51.55%와 정밀도 37.06%를 기록하여 많은 단어 경계를 성공적으로 식별했지만, 일부는 하위단위로 분할된 것으로 나타났다.
  • 독일어에서는 분할 F1 점수(31.69)가 GAS(32.89)보다 약간 낮았음에도 불구하고, SSAE는 더 높은 STD 성능(13.82 MAP 대 0.27 MAP)을 기록하여 더 우수한 임베딩 품질을 가짐을 시사했다.
  • 오라클 조건(정답 경계)은 영어에서 최고의 MAP(30.28)를 기록하여, SSAE 임베딩가 음소적 구조를 최적에 가깝게 반영하고 있음을 확인했다.
  • 결과는 말된 단어 분할의 품질이 일정 수준 이상을 초과해야만 오디오 워드2벡이 유의미한 임베딩을 생성할 수 있음을 보여주며, 열악한 분할 성능은 거의 무작위 성능에 가까워진다.
Fig. 2 : An illustration of unsupervised spoken term detection performed with segment-based subsequence matching using SSAE.
Fig. 2 : An illustration of unsupervised spoken term detection performed with segment-based subsequence matching using SSAE.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.