[논문 리뷰] One-Shot Speaker Identification for a Service Robot using a CNN-based Generic Verifier
이 논문은 재훈련 없이 음성 임베딩을 비교하는 Siamese CNN 기반 일반화 검증기를 사용하여 서비스 로봇를 위한 one-shot 발화자 식별 시스템을 제안한다. 청소된 데이터에서는 97%의 정확도를 달성하고, 실제 생활 기록에서는 81.2%의 정확도를 기록하며, 외부 음성 데이터베이스에 새로운 발화자를 동적으로 추가함으로써 실시간, 확장성 있고 적응 가능한 발화자 인식이 가능하다.
In service robotics, there is an interest to identify the user by voice alone. However, in application scenarios where a service robot acts as a waiter or a store clerk, new users are expected to enter the environment frequently. Typically, speaker identification models need to be retrained when this occurs, which can take an impractical amount of time. In this paper, a new approach for speaker identification through verification has been developed using a Siamese Convolutional Neural Network architecture (SCNN), where it learns to generically verify if two audio signals are from the same speaker. By having an external database of recorded audio of the users, identification is carried out by verifying the speech input with each of its entries. If new users are encountered, it is only required to add their recorded audio to the external database to be able to be identified, without retraining. The system was evaluated in four different aspects: the performance of the verifier, the performance of the system as a classifier using clean audio, its speed, and its accuracy in real-life settings. Its performance in conjunction with its one-shot-learning capabilities, makes the proposed system a viable alternative for speaker identification for service robots.
연구 동기 및 목표
- 새로운 사용자가 환경에 진입할 때 모델을 재훈련하지 않고도 실시간으로 적응 가능한 발화자 식별을 가능하게 한다.
- 새로운 발화자를 추가할 때마다 재훈련이 필요한 전통적인 발화자 식별 시스템의 한계를 해결한다.
- 두 음성 샘플이 같은 발화자로부터 유래되었는지 여부를 판단하는 일반화된 검증 모델을 개발하여 데이터베이스 확장을 동적으로 가능하게 한다.
- 소음이 많고 변수가 많은 음성 환경에서도 높은 정확도와 낮은 지연 시간을 확보하여 실제 생활 환경에서의 인간-로봇 상호작용을 원활하게 한다.
- 레스토랑이나 집과 같은 빈번한 새로운 사용자가 등장하는 환경에서 서비스 로봇에 적합한 확장 가능한 솔루션을 제공한다.
제안 방법
- 두 음성 임베딩 간의 유사도 함수를 학습하기 위해 Siamese 컨volutional 신경망(SCNN) 아키텍처를 사용한다.
- 대조 손실을 사용하여 동일 발화자 쌍과 다른 발화자 쌍을 구분할 수 있도록 음성 클립 쌍으로 검증기를 훈련시킨다.
- 음성 입력을 스펙트로그램으로 표현하고, 데이터베이스 저장을 위해 에너지가 충분한 세그먼트를 추출하기 위해 음성 활동 검출(VAD)을 적용한다.
- 기존의 외부 데이터베이스를 사용하여 알려진 발화자의 기준 음성 클립을 저장하며, 모델 재훈련 없이도 새로운 사용자를 추가할 수 있도록 한다.
- 훈련된 검증기를 사용하여 입력 음성과 데이터베이스의 모든 항목을 비교하여 발화자를 식별하거나 미등록으로 분류한다.
- 청소된 코퍼스와 실제 생활 기록을 모두 사용하여 성능을 평가하며, VGG16 및 ResNet50 아키텍처 기반의 모델 변종을 사용한다.
실험 결과
연구 질문
- RQ1새로운 사용자가 추가될 때 재훈련이 필요 없이 one-shot 발화자 식별을 가능하게 하는 일반화된 발화자 검증 모델을 훈련시킬 수 있는가?
- RQ2청소된 테스트 데이터와 비교하여, 소음이 많고 변수가 많은 실제 생활 환경에서의 입력 음성에 대해 시스템의 성능은 어떻게 되는가?
- RQ3발화자당 음성 항목 수가 증가할 경우 시스템의 식별 정확도에 어떤 영향을 미치는가?
- RQ4시스템의 추론 속도는 인터랙티브 서비스 로봇 응용 프로그램의 실시간 요구 조건을 충족하는가?
- RQ5입력 음성이 배경 소음이 있거나 비표준 기록 조건을 포함할 경우, 시스템의 강인성은 어느 정도 유지되는가?
주요 결과
- 가장 성능이 뛰어난 SCNN 모델(VGG7 32)을 사용하여 청소된 테스트 코퍼스에서 평균 97%의 정확도를 달성했다.
- 실제 생활 기록에서는 평균 81.2%의 정확도를 기록하여 실용적 구현을 위한 목표 기준인 80%를 초과했다.
- VGG7 32 모델은 가장 빠르며, 100개의 데이터베이스 항목과 한 번의 입력 음성 비교에 대해 0.17초의 검증 시간을 기록했다.
- 발화자당 음성 항목 수를 늘일수록 대부분의 사용자에 대해 성능 향상이 있었지만, 일부는 향상 없음 또는 약간의 저하를 보였으며, 이는 최적의 VAD 선택이 아니었을 가능성이 있다.
- 노이즈가 있는 데이터베이스로 훈련된 모델은 다양한 발화자 수와 음성 항목 조합에서도 실제 환경 조건에서 높은 정확도를 유지하여 강인성을 입증했다.
- 혼동 행렬에서 미등록 발화자를 18개의 경우 모두 정확히 식별하여 강력한 zero-shot 탐지 능력을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.