[论文解读] LRWR: Large-Scale Benchmark for Lip Reading in Russian language
本论文提出了LRWR,这是首个大规模、自然分布的俄语唇读基准数据集,包含235个类别和135位说话者,样本数量超过117,500个。该研究在LRWR上评估了当前最先进(SOTA)的唇读模型,识别出最优的训练技术——包括标签平滑、Mixup和余弦学习率调度,并提出了AttentionLipreadingNet(ALN),在LRW基准上实现了89.1%的新SOTA准确率,在LRWR上实现了61.1%的准确率。
Lipreading, also known as visual speech recognition, aims to identify the speech content from videos by analyzing the visual deformations of lips and nearby areas. One of the significant obstacles for research in this field is the lack of proper datasets for a wide variety of languages: so far, these methods have been focused only on English or Chinese. In this paper, we introduce a naturally distributed large-scale benchmark for lipreading in Russian language, named LRWR, which contains 235 classes and 135 speakers. We provide a detailed description of the dataset collection pipeline and dataset statistics. We also present a comprehensive comparison of the current popular lipreading methods on LRWR and conduct a detailed analysis of their performance. The results demonstrate the differences between the benchmarked languages and provide several promising directions for lipreading models finetuning. Thanks to our findings, we also achieved new state-of-the-art results on the LRW benchmark.
研究动机与目标
- 为解决俄语及其他斯拉夫语言缺乏大规模、自然分布的唇读数据集的问题。
- 在低资源、非英语语言环境下建立用于评估唇读模型的基准。
- 研究各种深度学习技术(如数据增强、正则化和学习率调度)对俄语唇读性能的影响。
- 开发一种新网络架构AttentionLipreadingNet(ALN),使其在多个数据集上具备良好的泛化能力,并在LRW上提升SOTA性能。
- 提供关于唇读性能在跨语言差异方面的见解,特别是俄语与英语之间的差异。
提出的方法
- 从YouTube视频中收集LRWR,确保光照、姿态和背景具有自然多样性,涵盖235个词汇和135位说话者,共117,500个样本。
- 实施数据处理流程,包括自动语音识别(ASR)对齐、人脸与唇部检测以及人工验证,以确保高质量且均衡的数据。
- 在LRWR上对多种最先进唇读架构(包括D3D、基于流的双流模型和ResNeSt基模型)进行基准测试。
- 系统性地评估正则化技术(标签平滑、Mixup、Cutout)、数据采样策略以及优化调度(余弦学习率衰减)。
- 通过结合3D卷积、带分割注意力的2D ResNeSt模块以及双向GRU进行时序建模,设计了AttentionLipreadingNet(ALN)。
- 使用数据增强(随机裁剪、水平翻转、Mixup、标签平滑、DropBlock)、带有余弦调度的Adam优化器,以及在视频长度上进行log-Softmax池化的交叉熵损失函数训练ALN。
实验结果
研究问题
- RQ1现有唇读模型在新提出的、大规模、自然分布的俄语唇读基准(LRWR)上的表现如何?
- RQ2哪些数据增强、正则化和优化技术在LRWR数据集上能带来最高的性能提升?
- RQ3俄语与英语在语言和语音上的差异在多大程度上影响唇读模型的泛化能力和性能?
- RQ4通过LRWR获得的见解训练出的统一架构,是否能同时提升在LRWR和已建立的LRW基准上的性能?
- RQ5输入分辨率和数据平衡(如每个类别上采样至750个样本)在低资源设置下对模型准确率有何影响?
主要发现
- 结合标签平滑、Mixup和余弦学习率调度,并增加RNN隐藏层大小,显著提升了模型在LRWR上的准确率。
- 将每个类别上采样至750个样本可提升性能,但进一步上采样会导致性能下降,表明存在最优的数据平衡点。
- 预训练模型权重始终带来更好的性能,表明在俄语唇读中迁移学习具有巨大潜力。
- D3D在LRWR上取得了最高准确率(54%),但在LRW上表现较差(78.0%),凸显了语言特异性导致的性能差异。
- AttentionLipreadingNet(ALN)在LRW基准上实现了89.1%的新SOTA准确率,超越了此前SOTA的88.4%。
- ALN在LRWR上取得了61.1%的准确率,表明性能对输入分辨率(112×112 vs. 256×256)和语言复杂性高度敏感,与LRW结果存在显著差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。