Skip to main content
QUICK REVIEW

[论文解读] BBC-Oxford British Sign Language Dataset

Samuel Albanie, Gül Varol|arXiv (Cornell University)|Nov 5, 2021
Hand Gesture Recognition Systems被引用 13
一句话总结

本文介绍了BBC-Oxford英国手语(BOBSL)数据集,这是一个大规模的1,962个BBC广播节目视频集合,包含英国手语(BSL)翻译及对应的英文字幕。该数据集支持手语识别、对齐与翻译研究,提供了基准基线,并揭示了在手语技术模型开发中需注意的关键偏差与局限性。

ABSTRACT

In this work, we introduce the BBC-Oxford British Sign Language (BOBSL) dataset, a large-scale video collection of British Sign Language (BSL). BOBSL is an extended and publicly released dataset based on the BSL-1K dataset introduced in previous work. We describe the motivation for the dataset, together with statistics and available annotations. We conduct experiments to provide baselines for the tasks of sign recognition, sign language alignment, and sign language translation. Finally, we describe several strengths and limitations of the data from the perspectives of machine learning and linguistics, note sources of bias present in the dataset, and discuss potential applications of BOBSL in the context of sign language technology. The dataset is available at https://www.robots.ox.ac.uk/~vgg/data/bobsl/.

研究动机与目标

  • 为解决当前缺乏大规模公开数据集以用于训练和评估手语处理模型的问题。
  • 提供一个全面、公开可获取的英国手语(BSL)视频数据集,源自BBC广播节目,并与英文字幕对齐。
  • 为手语识别、手语对齐与手语翻译任务建立基线模型与评估协议。
  • 识别并记录数据中偏差的来源,以指导负责任的研究与模型开发。
  • 支持实用应用的开发,如手语虚拟助手和手语词典搜索界面。

提出的方法

  • 数据集源自BBC广播节目视频片段,由专业BSL翻译员参与,视频分辨率为444×444,帧率为25 fps。
  • 采用自动手语检测与定位技术识别手语边界,随后通过人工验证并完成句子级别的字幕对齐。
  • 基于手语者对数据集进行划分,以确保手语者独立的评估,包括训练集、验证集与测试集。
  • 通过字幕进行句子提取,辅以人工标注以纠正缺失或错位的手语。
  • 在三个任务上训练并评估基线模型:手语识别、手语句子对齐与手语翻译。
  • 采用半自动的“提出并验证”流程构建测试集,提高了标注效率,但可能引入分布偏差。

实验结果

研究问题

  • RQ1当前模型在大规模BSL视频数据集中识别孤立手语的效率如何?
  • RQ2自动对齐方法在将BSL手语序列与对应英文字幕对齐方面能达到多大程度的准确性?
  • RQ3神经机器翻译模型从BSL视频输入生成准确英文翻译的能力如何?
  • RQ4基于广播内容的数据与自动标注流程在手语数据集中引入了哪些偏差?
  • RQ5人口统计不平衡以及广播内容中非自然手语表达如何影响模型泛化能力与实际应用表现?

主要发现

  • BOBSL数据集包含426档电视节目中的1,962个视频片段,总计约1,467小时的BSL视频,包含120万个对齐句子与39名手语者。
  • 已建立手语者独立的评估划分,确保训练、验证与测试集之间无手语者重叠,以支持稳健的基准测试。
  • 基线模型在手语识别、对齐与翻译任务上均取得了可测量的性能表现,为未来研究奠定了基础。
  • 人工标注发现,并非所有字幕中的词汇都被手语表达,且部分过时或不合适的符号存在,尤其在测试集中更为明显。
  • 数据集存在显著偏差:内容局限于广播风格手语,而非日常对话中的手语;自动标注更偏好具有明显口部动作与高可见度表达风格的手语。
  • 半自动标注流程提升了效率,但引入了分布偏差,意味着测试集表现可能无法真实反映实际应用中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。