[논문 리뷰] Affectron: Emotional Speech Synthesis with Affective and Contextually Aligned Nonverbal Vocalizations
Affectron은 언어-구화 사전학습된 신경 코드언어 모델을 미세조정하여 정서와 맥락에 맞춰 표현적인 비언어적 음성(NV)을 생성하고, 감정 주도 NV 매칭, 감정 인식적 NV 라우팅, NV 마스킹, 그리고 소규모 열린 코퍼스에서의 NV 강화 학습을 사용한다.
Nonverbal vocalizations (NVs), such as laughter and sighs, are central to the expression of affective cues in emotional speech synthesis. However, learning diverse and contextually aligned NVs remains challenging in open settings due to limited NV data and the lack of explicit supervision. Motivated by this challenge, we propose Affectron as a framework for affective and contextually aligned NV generation. Built on a small-scale open and decoupled corpus, Affectron introduces an NV-augmented training strategy that expands the distribution of NV types and insertion locations. We further incorporate NV structural masking into a speech backbone pre-trained on purely verbal speech to enable diverse and natural NV synthesis. Experimental results demonstrate that Affectron produces more expressive and diverse NVs than baseline systems while preserving the naturalness of the verbal speech stream.
연구 동기 및 목표
- 감정 기반 TTS를 위한 맥락에 적합한 비언어적 음성(NV)을 생성할 때 데이터 부족과 편향 문제를 해결한다.
- 명시적 정합 주석 없이 NV 다양성을 확대하기 위해 소규모 열린 코퍼스를 활용한다.
- 감정 인식 NV 합성을 가능하게 하기 위해 학습 시 NV 증강과 NV-구조적 마스킹을 개발한다.
- 언어 음성 사전학습된 신경 코드언어 모델을 미세조정하여 NV와 음성 발화를 공동으로 모델링한다.
제안 방법
- 음성 발화와 NV가 별도로 녹음된 소규모 분리된 열린 코퍼스를 사용하여 NV 유형과 삽입 위치를 확장한다.
- 각 발화에 정서적으로 맞는 NV를 선택하기 위해 감정 주도 상위-K NV 매칭을 도입한다.
- 정서 인식적 상위-K 라우팅을 도입하여 감정적 동향에 따라 선택된 NV를 맥락상 적절한 위치에 배치한다.
- 주변의 음성적 정서 맥락에 조건화하기 위해 NV 구조 마스킹을 음성 백본에 통합한다.
- NV-강화 토큰 시퀀스 재배열과 NV태그가 달린 전사를 사용하여 VoiceCraft/Neural Codec Language Model(NCLM)을 미세조정한다.
- 추론 중에는 NV태그가 달린 전사와 정서적 참조 발화를 기반으로 정렬이나 라우팅 단계 없이 NV를 생성한다.
실험 결과
연구 질문
- RQ1작은 규모의 열린 코퍼스를 사용하여 NV 유형과 위치를 현실적으로 확장하고 정서적 맥락에 맞추어 정렬할 수 있는가?
- RQ2감정 주도 NV 매칭과 감정 인식적 라우팅이 기본 시스템과 비교해 NV 표현력과 맥락적 일관성을 향상시키는가?
- RQ3NV 구조 마스킹이 생성 과정에서 NV의 자연스러움과 음성 발화와의 통합을 향상시키는가?
- RQ4제로샷 및 본 발화자 사례에서 NV-강화 학습이 음성 및 NV 데이터를 별도로 직접 학습하는 것보다 효과적인가?
주요 결과
- Affectron은 베이스라인 NCLM 기반 TTS 모델에 비해 음성 자연성을 유지하면서 더 표현력 있고 다양한 NV 합성을 제공한다.
- 감정 주도 NV 매칭과 감정 인식적 라우팅이 NV 유형과 위치 분포를 경쟁적 방법들보다 경험적 데이터에 더 가깝게 만든다.
- NV 구조 마스킹은 주변의 언어적 정서 맥락에 조건화하여 경계 자연성과 일관성을 향상시킨다.
- 소거 연구는 각 구성요소(NV 마스킹, 라우팅, 매칭, 증강)가 NV 현실성과 다양성 향상에 기여한다.
- 제로샷 및 보이지 않는 화자 평가에서 Affectron은 화자에 걸쳐 NV 품질과 맥락적 정합성을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.