Skip to main content
QUICK REVIEW

[論文レビュー] BBC-Oxford British Sign Language Dataset

Samuel Albanie, Gül Varol|arXiv (Cornell University)|Nov 5, 2021
Hand Gesture Recognition Systems被引用数 13
ひとこと要約

本論文では、BBC放送の1,962本の番組エピソードに、英国手話(BSL)の解説と対応する英語字幕が付された大規模なデータセット、BBC-Oxford英国手話(BOBSL)データセットを紹介する。このデータセットは、手話認識、同期、翻訳に関する研究を可能にし、ベンチマークのベースラインを提供するとともに、手話技術分野における強固なモデル開発のための主なバイアスと制限を浮き彫りにする。

ABSTRACT

In this work, we introduce the BBC-Oxford British Sign Language (BOBSL) dataset, a large-scale video collection of British Sign Language (BSL). BOBSL is an extended and publicly released dataset based on the BSL-1K dataset introduced in previous work. We describe the motivation for the dataset, together with statistics and available annotations. We conduct experiments to provide baselines for the tasks of sign recognition, sign language alignment, and sign language translation. Finally, we describe several strengths and limitations of the data from the perspectives of machine learning and linguistics, note sources of bias present in the dataset, and discuss potential applications of BOBSL in the context of sign language technology. The dataset is available at https://www.robots.ox.ac.uk/~vgg/data/bobsl/.

研究の動機と目的

  • 手話処理モデルの学習および評価に用いることのできる大規模な公開データセットが不足しているという問題に対処すること。
  • BBC放送の映像から得た、英国手話(BSL)の動画と対応する英語字幕を併記した包括的かつ公開可能なデータセットを提供すること。
  • 手話認識、手話文の同期、手話翻訳の各タスクにおけるベースラインモデルおよび評価プロトコルを確立すること。
  • データ内に生じるバイアスの原因を特定し、記録することで、責任ある研究およびモデル開発を促進すること。
  • 手話バーチャルアシスタントや手話辞書用の検索インターフェースといった実用的アプリケーションの開発を支援すること。

提案手法

  • データセットは、プロのBSL通訳者が登場するBBC放送の映像から構築され、解像度444×444、25fpsで収集された。
  • 自動的手話スポットティングおよび局所化技術を用いて手話の境界を特定し、その後手動による検証と文単位での英語字幕との同期を実施した。
  • 被験者(通訳者)を基準に訓練・検証・テスト分割を実施し、被験者に依存しない評価を可能にした。
  • 字幕を用いた文抽出を実施し、欠落または不一致のある手話を補正するための手動アノテーションを実施した。
  • 3つのタスク(手話認識、手話文の同期、手話翻訳)において、ベースラインモデルを学習および評価した。
  • テストセット構築には、半自動的な「提案と検証」パイプラインを用い、アノテーション効率を向上させたが、分布バイアスの発生の可能性を伴った。

実験結果

リサーチクエスチョン

  • RQ1現在のモデルは、大規模なBSL動画データセット内における孤立した手話の認識において、どの程度効果的か?
  • RQ2自動同期手法は、BSLの手話シーケンスと対応する英語字幕をどの程度正確に同期できるか?
  • RQ3ニューラル機械翻訳モデルは、BSL動画入力から正確な英語翻訳をどの程度生成できるか?
  • RQ4放送ベースのデータと自動アノテーションパイプラインを用いることで、手話データセットにどのようなバイアスが生じるか?
  • RQ5人種的・文化的な不均衡や、放送コンテンツにおける自然でない(非自発的)手話のスタイルが、モデルの汎化性能および実世界でのパフォーマンスに与える影響はいかほどか?

主な発見

  • BOBSLデータセットは、426本のテレビ番組にまたがる1,962本のエピソードから構成され、合計で約1,467時間のBSL動画を含み、120万件の同期済み文と39人の通訳者が含まれる。
  • 被験者に依存しない評価分割が作成され、訓練・検証・テストセット間で被験者の重複がないようにしたことで、堅牢なベンチマーク評価が可能になった。
  • ベースラインモデルは、手話認識、同期、翻訳の各タスクで測定可能なパフォーマンスを達成し、今後の研究の基盤を提供した。
  • 手動アノテーションの結果、字幕に含まれるすべての語が手話で表現されているわけではないことが判明し、特にテストセットでは古くさびれたまたは不適切な手話も確認された。
  • データセットには顕著なバイアスが存在する:内容が会話的でない放送スタイルの手話に限定されており、自動アノテーションは明確な口の動きや可視性の高い手話スタイルを好む傾向がある。
  • 半自動アノテーションパイプラインは効率を向上させたが、分布バイアスを引き起こした。その結果、テストセットのパフォーマンスは、実世界の耐性性能を正確に反映していない可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。