Skip to main content
QUICK REVIEW

[论文解读] BosphorusSign22k Sign Language Recognition Dataset

Oğulcan Özdemir, Ahmet Alp Kındıroğlu|arXiv (Cornell University)|Apr 2, 2020
Hand Gesture Recognition Systems参考文献 48被引用 33
一句话总结

引入 BosphorusSign22k 大规模土耳其手语数据集,增加 OpenPose 和 Kinect v2 模态,定义评估协议,并提供使用 IDT 和 3D ResNets (MC3) 的基线结果。

ABSTRACT

Sign Language Recognition is a challenging research domain. It has recently seen several advancements with the increased availability of data. In this paper, we introduce the BosphorusSign22k, a publicly available large scale sign language dataset aimed at computer vision, video recognition and deep learning research communities. The primary objective of this dataset is to serve as a new benchmark in Turkish Sign Language Recognition for its vast lexicon, the high number of repetitions by native signers, high recording quality, and the unique syntactic properties of the signs it encompasses. We also provide state-of-the-art human pose estimates to encourage other tasks such as Sign Language Production. We survey other publicly available datasets and expand on how BosphorusSign22k can contribute to future research that is being made possible through the widespread availability of similar Sign Language resources. We have conducted extensive experiments and present baseline results to underpin future research on our dataset.

研究动机与目标

  • 为土耳其手语提供一个 signer-independent 的孤立式手语识别基准。
  • 用更丰富的模态(OpenPose、Kinect v2)清理并扩展 BosphorusSign 数据集,并引入可行的标注方案。
  • 定义评估协议并在新数据集上建立基线性能。
  • 通过提供手工特征和深度学习方法的基线结果,促成未来的研究。

提出的方法

  • 合并并清理 BosphorusSign 数据集,删除错误记录并合并在手动特征上相似的签名。
  • 为所有视频提供 RGB、深度、OpenPose 关节(身体、脸部、手部)和 Kinect v2 骨架数据。
  • 建立一个 signer-independent 的评估协议,采用训练/测试分割(一个签名者用于测试,其他用于训练)。
  • 使用 Improved Dense Trajectories (IDT) 搭配 Fisher Vector 编码,以及带混合 2D-3D 卷积的 3D ResNet MC3 模型,对基线进行基准测试。
  • 比较从头训练与在 Kinetics-400 上微调预训练网络的效果,并评估各种块微调策略。
  • 报道基线结果,显示 IDT 具有强劲的性能,并分析失败模式以指导未来改进。

实验结果

研究问题

  • RQ1在 BosphorusSign22k 上,最先进的手工视频特征(IDT)在土耳其手语孤立识别中的性能如何?
  • RQ2现代深度学习架构(MC3 3D ResNets)在与 IDT 相比的 signer-independent 土耳其手语 gloss 识别中的表现如何?
  • RQ3数据模态(RGB、深度、OpenPose 关节、Kinect 骨架)对识别性能有何影响?
  • RQ4是否可以建立一个具有清晰评估协议的 signer-independent 基线,以便未来的基准测试?
  • RQ5在区分视觉上相似的土耳其手语 gloss 时,主要的错误模式和挑战是什么?

主要发现

  • 带有 HOF 和 MBH 特征的 IDT 在单独运动成分上达到 86.63% 的 Top-1 准确率,合并 HOG、HOF、MBH 时为 88.53%。
  • 当微调最后三个块时,3D ResNet MC3 基线达到 78.85% Top-1 准确率(Top-5 为 94.76%)。
  • 从头训练 MC3 在此任务上优于对预训练的 Kinetics-400 模型进行微调。
  • 外观特征(HOG)与运动特征的融合在所有基线上提高了性能,而增加轨迹信息可能略微降低准确率。
  • 数据集提供 744 个 sign gloss,覆盖 Health、Finance 和 Common signs,共有 22,542 条视频,来自 6 位签名者(约 19 小时)。
  • 作者指出,精细手形与更长范围的时序建模仍是 signer-independent SLR 的关键瓶颈。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。