Skip to main content
QUICK REVIEW

[論文レビュー] TVLT: Textless Vision-Language Transformer

Zineng Tang, Jaemin Cho|arXiv (Cornell University)|Sep 28, 2022
Multimodal Machine Learning Applications被引用数 16
ひとこと要約

TVLTは、テキスト固有のモジュール(トークン化やASRなど)に依存せずに、均質なトランスフォーマー・アーキテクチャを用いて、生のビデオフレームと音声スペクトログ램から直接視覚的・言語的表現を学習するテキストレスなビジョン・ランゲージ・トランスフォーマーを提案する。テキストベースのモデルと同等のパフォーマンスを達成すると同時に、パrameterを3分の1に削減し、推論速度を28倍に高速化する。

ABSTRACT

In this work, we present the Textless Vision-Language Transformer (TVLT), where homogeneous transformer blocks take raw visual and audio inputs for vision-and-language representation learning with minimal modality-specific design, and do not use text-specific modules such as tokenization or automatic speech recognition (ASR). TVLT is trained by reconstructing masked patches of continuous video frames and audio spectrograms (masked autoencoding) and contrastive modeling to align video and audio. TVLT attains performance comparable to its text-based counterpart on various multimodal tasks, such as visual question answering, image retrieval, video retrieval, and multimodal sentiment analysis, with 28x faster inference speed and only 1/3 of the parameters. Our findings suggest the possibility of learning compact and efficient visual-linguistic representations from low-level visual and audio signals without assuming the prior existence of text. Our code and checkpoints are available at: https://github.com/zinengtang/TVLT

研究の動機と目的

  • 書かれた言語の存在を前提としない、生の視覚的および音声的信号から学習するビジョンアンドランゲージモデルの開発。
  • ビジョン・ランゲージ表現学習において、自動音声認識(ASR)やトークン化などのテキスト固有のコンponentsを排除すること。
  • 統一的かつモalityに依存しないトランスフォーマー・アーキテクチャを用いることで、計算効率の向上とモデルのコンactnessの向上。
  • ビデオや音声などの低レベルの知覚的信号から、効果的な視覚的・言語的表現を直接学習できるかどうかの調査。
  • テキストの監視なしに、視覚的質問応答(VQA)、リtrieval、感情分析などのマルチモーダルタスクにおけるパフォーマンスの評価。

提案手法

  • TVLTは、モダリティ固有の設計を一切用いずに、生のビデオフレームと音声スペクトログラムを処理する均質なトランスフォーマー・エンコーダーとデコーダーを採用する。
  • モデルは、視覚的および音声的パッチの両方に対してマスクド自己符号化(MAE)を用いて事前学習を行い、連続するビデオフレームおよびスペクトログラムのマスク領域を再構築する。
  • 事前学習段階で対照的モデリングを適用し、ビデオと音声の表現を整列させることで、クロスモーダル理解を強化する。
  • 学習された音声検出ヘッドを用いて、検出された発話領域にのみ音声マスキングを適用し、最小限の計算コストでパフォーマンスを向上させる。
  • 共通のトランスフォーマー空間で視覚と音声の入力を処理するジョイントエンコーダーを用い、クロスモーダル特徴の学習を可能にする。
  • ビデオと音声の再構築に共通の重みを持つ別々のデコーダーを用いることで、精度と効率の両面でジョイントデコーダーを上回る性能を達成する。

実験結果

リサーチクエスチョン

  • RQ1統一的かつモダリティに依存しないトランスフォーマーは、テキストの監視なしに、生のビデオと音声から効果的な視覚的・言語的表現を直接学習できるか?
  • RQ2ASR やトークン化などのテキスト固有のコンponentsを排除することで、計算上の冗長性が低下し、パフォーマンスを損なわず推論速度が向上するか?
  • RQ3VQA やリtrieval などの下流のマルチモーダルタスクにおいて、テキストレスモデルのパフォーマンスはテキストベースのモデルと比べてどうか?
  • RQ4異なる音声マスキング戦略と事前学習目的が、下流タスクの精度に与える影響は何か?
  • RQ5モデルは、特に感情分類タスクにおいて、言語的でない音声的ヒントを効果的に捉えることができるか?

主な発見

  • TVLTは、ビデオリtrieval(MSR-VTTにおけるR@1: 22.3)およびVQA(VQAv2における正解率: 58.6%)において、最先端のテキストベースのモデルと同等のパフォーマンスを達成した。
  • モデルのパrameter数をテキストベースの対応モデルの3分の1に削減し、同じハードウェア環境下で推論速度を28倍に高速化した。
  • 検出された発話領域に限定した音声マスキングは、すべてのベンチマークでパフォーマンスを向上させ、MSR-VTTではR@1が22.3、VQAv2では正解率58.6%を達成した。
  • ジョイントエンコーダーはモダリティ固有のエンコーダーを上回り、MSR-VTTではR@1が10.2、VQAv2では正解率54.6%を記録し、効果的なクロスモーダル表現学習を示した。
  • 共通の重みを持つ別々のデコーダーは、ジョイントデコーダーを上回る性能(R@1: 22.3、正解率58.6%)を示し、マルチモーダル再構築のための最適化がより効果的であることを示した。
  • マスクド自己符号化(MAE)とボイス・アウェア・マスキング(VAM)の事前学習目的の組み合わせが、下流タスクで最も優れたパフォーマンスを発揮し、それぞれの目的を個別に用いる場合を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。