Skip to main content
QUICK REVIEW

[論文レビュー] A Data Augmentation Approach for Sign-Language-To-Text Translation In-The-Wild

Xiujun Li, Xi Yin|arXiv (Cornell University)|Apr 13, 2020
Multimodal Machine Learning Applications参考文献 48被引用数 134
ひとこと要約

本稿では、画像内のオブジェクトタグを意味的アンカー点として用いることで、視覚言語の事前学習手法Oscarを提案する。オブジェクトタグと領域特徴、テキスト埋め込みを統合した一貫したTransformerフレームワークにより、VQA、画像キャプション、NLVR2を含む6つの視覚言語タスクで最先端の性能を達成し、先行手法と顕著な差を示した。

ABSTRACT

In this paper, we describe the current main approaches to sign language translation which use deep neural networks with videos as input and text as output. We highlight that, under our point of view, their main weakness is the lack of generalization in daily life contexts. Our goal is to build a state-of-the-art system for the automatic interpretation of sign language in unpredictable video framing conditions. Our main contribution is the shift from image features to landmark positions in order to diminish the size of the input data and facilitate the combination of data augmentation techniques for landmarks. We describe the set of hypotheses to build such a system and the list of experiments that will lead us to their verification.

研究の動機と目的

  • 画像領域とテキストトークンに明示的なグランドイングがない弱教師付きクロスモーダル整合性の課題に対処する。
  • 現代のオブジェクト検出器の高い精度を活用し、顕著で意味的に重要なオブジェクトを、整合性のためのアンカー点として特定する。
  • オブジェクトタグを通じて明示的かつ接地された監視を提供することにより、画像-テキスト意味的整合性の学習の効率性と有効性を向上させる。
  • 改善された事前学習により、多様な視覚言語理解および生成タスクで最先端の性能を達成する。
  • 表現学習における役割を分析することで、オブジェクトタグが直接的な視覚特徴よりも整合性アンカーとして優れていることを示す。

提案手法

  • 各画像-テキストペアを、語トークン、オブジェクトタグ(オブジェクト検出器で検出されたもの)、画像領域特徴の3つ組として表現する。
  • テキストおよびオブジェクトタグの両方のための事前学習済み語埋め込みを用い、辞書照合により共通の意味的空間に統合する。
  • 2つの目的を用いてモデルを事前学習する:語とタグにおけるマスクトークン予測、およびオブジェクトタグとその対応する画像領域間の対照的損失。
  • オブジェクトタグをアンカー点として活用し、Transformerエンコーダー内の自己注意メカニズムをガイドすることで、視覚的領域と言語的単位の整合性を向上させる。
  • 言語的意味的空間(例:BERT埋め込み)を活用して、オブジェクトタグの表現品質を向上させ、生の領域特徴よりも識別性の高いものにする。
  • 標準的な微調整プロトコルに従い、VQA、画像キャプション、画像-テキスト検索などの下流タスクで事前学習済みOscarモデルを微調整する。

実験結果

リサーチクエスチョン

  • RQ1画像に検出されたオブジェクトタグは、視覚言語の事前学習におけるクロスモーダル整合性を向上させる有効なアンカー点として機能するか?
  • RQ2生の領域特徴とテキストトークンの自己注意に依存するのと比較して、オブジェクトタグを意味的アンカーとして使用する場合の効果は何か?
  • RQ3オブジェクトタグを用いた事前学習は、視覚言語理解および生成タスクの両方で性能向上をもたらすか?
  • RQ4異なるオブジェクトタグソース(例:Visual Genome対 Open Images)が下流性能に与える影響は何か?
  • RQ5オブジェクトタグは、新しいオブジェクトキャプションなどのゼロショットまたはフェイントショット設定での一般化を向上させるか?

主な発見

  • Oscarは、VQA、画像キャプション、NLVR2を含む6つの確立済みの視覚言語ベンチマークで、新たな最先端の結果を達成した。
  • VQA開発セットでは、オブジェクトタグを含まないベースラインの70.93と比較して、Oscarは正答率71.70に向上し、相対的な向上率は1.1%であった。
  • 画像キャプションでは、OscarはBLEU-4スコア36.4、ROUGE-Lスコア30.3、CIDErスコア123.4を達成し、それぞれベースラインより1.9、1.2、7.8ポイント高いスコアを記録した。
  • 同じ領域特徴を使用しても、オブジェクトタグをアンカー点として使用することで、ベースラインと比較して性能が顕著に向上した。
  • Visual Genome(VG)のオブジェクトタグを用いた事前学習モデルは、Open Images(OI)タグを用いたモデルよりも優れた性能を示した。これは、VGデータセットにオブジェクトの多様性がより高いからだと考えられる。
  • アブレーションスタディの結果、オブジェクトタグは直接的な視覚特徴として使用するよりも、整合性アンカーとして使用する場合に最も効果的であることが確認された。これは、特徴の冗長性を増加させることなく、整合性を向上させるためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。