[论文解读] Expressivity in TTS from Semantics and Pragmatics
本文提出 SPARSAR,一种通过整合语义、句法和语用分析来增强表现力的文本转语音(TTS)系统。通过将文本建模为类似诗歌的结构(包含呼吸短语和诗节),并对语用标记的表达应用专门的语调轮廓,该系统实现了适用于诗歌、寓言和一般文本的细腻语调,其结果已在英语短篇故事和寓言中得到验证,采用的是受 ToBI 启发但参数数量加倍的系统。
In this paper we present ongoing work to produce an expressive TTS reader that can be used both in text and dialogue applications. The system called SPARSAR has been used to read (English) poetry so far but it can now be applied to any text. The text is fully analyzed both at phonetic and phonological level, and at syntactic and semantic level. In addition, the system has access to a restricted list of typical pragmatically marked phrases and expressions that are used to convey specific discourse function and speech acts and need specialized intonational contours. The text is transformed into a poem-like structures, where each line corresponds to a Breath Group, semantically and syntactically consistent. Stanzas correspond to paragraph boundaries. Analogical parameters are related to ToBI theoretical indices but their number is doubled. In this paper, we concentrate on short stories and fables.
研究动机与目标
- 开发一种能够生成超越基本文本渲染的、具有表现力且符合上下文的语音的 TTS 系统。
- 通过整合语义和语用线索,解决传统 TTS 中语调变化不足的问题。
- 通过在语音输出中应用专门的语调轮廓,对话语功能和言语行为进行建模。
- 将系统的适用范围从诗歌扩展到一般叙事文本,如寓言和短篇故事。
- 基于 ToBI 的双参数系统,形式化语调结构,以适应表现性语音。
提出的方法
- 系统对输入文本执行完整的音位、音系、句法和语义分析。
- 基于语义和句法连贯性,将文本划分为呼吸短语(行)和诗节(段落边界)。
- 使用一个受限的语用标记短语词典,以识别需要特定语调轮廓的话语功能。
- 模拟参数源自 ToBI 理论指标,但数量加倍,以实现更精细的语调控制。
- 通过将语义和语用特征映射到语音实现,采用定制的音高和时序模式生成语调。
- 系统对文本应用分层结构,使语调单位与句法和语义边界对齐。
实验结果
研究问题
- RQ1如何系统地将语义和语用特征映射到 TTS 中的语调模式?
- RQ2结构化、类似诗歌的表示在非诗歌叙事文本中在多大程度上能提升表现力?
- RQ3在 TTS 中,能否可靠检测出语用标记的表达,并为其分配适当的语调轮廓?
- RQ4与 ToBI 相比,使用加倍的模拟参数在多大程度上增强了语调表现力?
- RQ5将面向诗歌的 TTS 框架应用于一般叙事和对话文本是否可行?
主要发现
- SPARSAR 系统成功为诗歌和叙事文本(包括寓言和短篇故事)生成了富有表现力的语音。
- 语义和语用分析的整合使系统能够为话语功能分配上下文适当的语调轮廓。
- 基于语义和句法边界的呼吸短语和诗节结构,提升了语调连贯性和自然度。
- 与标准 ToBI 基础系统相比,该系统采用的双倍参数集实现了更细腻的语调表达。
- 该框架在从诗歌向非诗歌文本的迁移中表现出可行性,扩展了表现性 TTS 的应用范围。
- 通过在英语寓言和短篇故事上的应用,验证了该方法在叙事语境中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。