[论文解读] Interactive Text-to-Speech System via Joint Style Analysis
本文提出了一种交互式文本到语音(TTS)系统,通过联合训练风格提取模型与多风格TTS系统,使生成的回应能够匹配用户输入查询的说话风格。该系统采用半监督方法在不相交的数据集之间对齐风格标签,实现了用户对风格化回应的偏好,72%的听者更倾向于风格化TTS而非默认模型。
While modern TTS technologies have made significant advancements in audio quality, there is still a lack of behavior naturalness compared to conversing with people. We propose a style-embedded TTS system that generates styled responses based on the speech query style. To achieve this, the system includes a style extraction model that extracts a style embedding from the speech query, which is then used by the TTS to produce a matching response. We faced two main challenges: 1) only a small portion of the TTS training dataset has style labels, which is needed to train a multi-style TTS that respects different style embeddings during inference. 2) The TTS system and the style extraction model have disjoint training datasets. We need consistent style labels across these two datasets so that the TTS can learn to respect the labels produced by the style extraction model during inference. To solve these, we adopted a semi-supervised approach that uses the style extraction model to create style labels for the TTS dataset and applied transfer learning to learn the style embedding jointly. Our experiment results show user preference for the styled TTS responses and demonstrate the style-embedded TTS system's capability of mimicking the speech query style.
研究动机与目标
- 开发一种更自然、更具交互性的TTS系统,使其能够根据输入查询的风格调整说话风格,从而增强人机对话的真实感。
- 解决TTS训练数据集与风格提取模型训练数据之间风格标签不一致的问题(例如,IEMOCAP与专业TTS数据集之间的差异)。
- 通过学习真实语音查询中提取的风格嵌入,使TTS系统能够生成富有表现力且符合语境的回应。
- 通过主观评估提升用户体验,证明风格化回应相较于默认TTS输出更受用户青睐。
提出的方法
- 在IEMOCAP数据集上使用深度神经网络架构训练一个多模态风格分类器,以从语音输入中提取软风格嵌入。
- 将训练好的风格分类器以半监督方式应用于未标注的TTS训练数据,实现在不同数据集之间的一致性风格嵌入。
- 使用生成的风格嵌入作为辅助控制特征,训练多风格TTS模型,从而实现基于输入风格的条件合成。
- 风格嵌入源自风格分类器的Softmax层,表示多种风格(如高兴、悲伤、中性)的概率分布。
- 系统在闭环流程中集成风格提取与TTS合成:输入语音被分析风格,TTS则生成匹配该风格的回应。
- 采用迁移学习与联合优化,对齐风格表示空间,使风格提取模型与TTS模型之间的表示保持一致。
实验结果
研究问题
- RQ1TTS系统能否实时生成与用户输入查询说话风格一致的回应,从而提升对话的自然度?
- RQ2如何在具有不同风格标注方案的两个不相交数据集之间,一致地预测并利用风格嵌入?
- RQ3半监督方法在将资源丰富的数据集(IEMOCAP)中的风格标签迁移到较小的、专业录制的TTS数据集方面,其效果在多大程度上成立?
- RQ4与默认的中性风格TTS相比,风格化TTS回应是否能带来更高的用户偏好?
主要发现
- 在主观偏好测试中,多风格TTS系统在72%的测试中优于基线TTS模型,表明用户对风格化回应有强烈偏好。
- 听者最常偏好中性风格,这与测试语句内容最适合以平静、中性的方式表达相一致。
- 该系统展现出良好的泛化能力,在对真实、未见过的语音查询生成回应时,超过40%的测试对被判断为良好匹配。
- 高兴风格与合成语音中显著更高的基频(F0)均值相关,与训练数据的统计特征一致,表明风格表示有效。
- 悲伤和愤怒风格的音频质量相对较低,可能是因为TTS数据集中这些情绪的训练样本不足。
- ABX测试证实,多风格TTS能够生成可感知区分的不同风格,其在风格辨别任务中的准确率达到82.42%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。