[论文解读] LIP-RTVE: An Audiovisual Database for Continuous Spanish in the Wild
本论文介绍了LIP-RTVE,这是一个13小时的半自动标注音视频数据库,涵盖广播电视中的连续西班牙语语音,专为真实环境下的研究而设计。该数据库支持音视频语音识别与唇读研究,并基于隐马尔可夫模型(HMM)在声学、视觉及音视频多模态方面报告了基线结果,表明多模态融合可显著提升性能。
Speech is considered as a multi-modal process where hearing and vision are two fundamentals pillars. In fact, several studies have demonstrated that the robustness of Automatic Speech Recognition systems can be improved when audio and visual cues are combined to represent the nature of speech. In addition, Visual Speech Recognition, an open research problem whose purpose is to interpret speech by reading the lips of the speaker, has been a focus of interest in the last decades. Nevertheless, in order to estimate these systems in the currently Deep Learning era, large-scale databases are required. On the other hand, while most of these databases are dedicated to English, other languages lack sufficient resources. Thus, this paper presents a semi-automatically annotated audiovisual database to deal with unconstrained natural Spanish, providing 13 hours of data extracted from Spanish television. Furthermore, baseline results for both speaker-dependent and speaker-independent scenarios are reported using Hidden Markov Models, a traditional paradigm that has been widely used in the field of Speech Technologies.
研究动机与目标
- 为解决缺乏大规模、公开可用的西班牙语音视频数据库,尤其是在非受限、真实世界环境下的问题。
- 为训练和评估西班牙语的音视频语音识别与视觉语音识别系统提供资源。
- 通过提供来自广播电视的多样化、真实世界数据,支持多模态语音处理研究。
- 使用隐马尔可夫模型(HMM)建立基线性能指标,涵盖说话人相关与说话人无关的场景。
- 在标准化的西班牙语数据集上,实现对声学、视觉及音视频多模态输入的性能比较。
提出的方法
- 数据库由13小时的西班牙语电视广播内容汇编而成,选材注重语言与视觉的多样性。
- 数据采集采用半自动标注方法以确保质量,并辅以人工验证语音与唇部运动。
- 音频以16 kHz采样率、单声道、16位深度的WAV格式录制;视频以25 fps帧率、RGB PNG格式捕获。
- 感兴趣区域(ROI)提取聚焦于面部、口部及宽口区域,平均尺寸分别为55×58、27×16和45×30像素。
- 提取声学(MFCC)、视觉(外观与运动特征)及音视频融合的特征,并采用基于HMM的系统进行建模。
- 在强制对齐条件下,使用HMM训练并评估了说话人相关与说话人无关设置下的基线模型。
实验结果
研究问题
- RQ1与单模态方法相比,音视频特征的多模态融合在连续西班牙语语音识别中的性能提升如何?
- RQ2在真实世界西班牙语音视频环境中,说话人相关与说话人无关识别之间的性能差距是多少?
- RQ3传统HMM模型在大规模、非受限西班牙语音视频数据库上的表现如何?
- RQ4在噪声或音频质量下降的条件下,仅使用视觉特征对语音识别性能的影响如何?
- RQ5广播电视数据的多样性与自然性如何影响音视频语音识别模型的泛化能力?
主要发现
- LIP-RTVE数据库包含13小时连续西班牙语语音,共10,352个语句和1,168,087帧视频,涵盖323名说话人。
- 数据集包含9,308个唯一词汇、654,368个音素和801,830个字符,语音速率范围为每秒0.58至9.73个词。
- 基线结果显示,基于HMM的音视频融合在说话人相关与说话人无关设置下,均显著优于单模态的声学或视觉模型。
- 在说话人无关场景下,仅视觉模型的词错误率(WER)约为45%,表明视觉语音识别仍有较大提升空间。
- 在说话人相关条件下,仅声学HMM模型的WER约为15%,为多模态系统提供了强有力的下限基准。
- 在说话人无关设置下,引入视觉特征使WER最高降低20%,证明了多模态融合在真实环境下的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。