Skip to main content
QUICK REVIEW

[論文レビュー] Gaining Extra Supervision via Multi-task learning for Multi-Modal Video Question Answering

Jun-Yeong Kim, Minuk Ma|arXiv (Cornell University)|May 28, 2019
Multimodal Machine Learning Applications参考文献 40被引用数 4
ひとこと要約

本論文は、時間的局所化とモダリティアライメントの2つの補助的タスクを同時に学習することで、追加の教師信号を獲得するマルチタスク学習フレームワークを提案する。階層的な特徴共有とカリキュラム学習にインspiredされたマルチタスクレートスケジューリングを用いることで、TVQAベンチマークで67.05%の最先端性能を達成し、相乗的な学習信号による顕著な向上を示した。

ABSTRACT

This paper proposes a method to gain extra supervision via multi-task learning for multi-modal video question answering. Multi-modal video question answering is an important task that aims at the joint understanding of vision and language. However, establishing large scale dataset for multi-modal video question answering is expensive and the existing benchmarks are relatively small to provide sufficient supervision. To overcome this challenge, this paper proposes a multi-task learning method which is composed of three main components: (1) multi-modal video question answering network that answers the question based on the both video and subtitle feature, (2) temporal retrieval network that predicts the time in the video clip where the question was generated from and (3) modality alignment network that solves metric learning problem to find correct association of video and subtitle modalities. By simultaneously solving related auxiliary tasks with hierarchically shared intermediate layers, the extra synergistic supervisions are provided. Motivated by curriculum learning, multi task ratio scheduling is proposed to learn easier task earlier to set inductive bias at the beginning of the training. The experiments on publicly available dataset TVQA shows state-of-the-art results, and ablation studies are conducted to prove the statistical validity.

研究の動機と目的

  • 既存のマルチモーダル動画質問応答ベンチマークにおける限られた教師信号の問題に対処すること。これらのデータセットは、有効なディープラーニングに十分でない。
  • 追加の教師信号を提供する補助タスクを活用することで、動画質問応答の性能を向上させること。
  • 主なQAタスクと2つの補助タスク(モダリティアライメントと時間的局所化)の間で階層的に特徴を共有するマルチタスク学習フレームワークを設計すること。
  • カリキュラム学習にインspiredされたマルチタスクレートスケジューリングを導入し、学習初期に容易なタスクを優先することで、誘導的バイアスを確立すること。
  • TVQAデータセットにおけるアブレーションスタディと最先端の結果を通じて、提案手法の有効性を実証的に検証すること。

提案手法

  • 本手法は、動画と字幕の特徴を統合して質問に回答するマルチモーダル動画質問応答ネットワークを採用する。
  • 質問に対応する動画クリップ内の関連する瞬間を予測する時間的リtrievalネットワークを導入し、QAネットワークと高レベル特徴を共有する。
  • モダリティアライメントネットワークを用いて、メトリック学習問題を解き、動画と字幕の特徴の正しいペアリングを保証する。このネットワークは、QAネットワークと低レベル特徴を共有する。
  • モデルは階層的パラメータ共有を採用する:モダリティアライメントは初期層を共有し、時間的局所化はより深い層をQAネットワークと共有する。
  • 訓練の目的比率を制御するためのマルチタスクレートスケジューリングを適用し、学習初期に容易なタスク(モダリティアライメント)を優先することで学習をガイドする。
  • 主なQAタスクと2つの補助タスクをバランスさせる統合損失関数を用いて、エンドツーエンドでフレームワークを訓練する。

実験結果

リサーチクエスチョン

  • RQ1時間的局所化やモダリティアライメントといった補助タスクは、マルチモーダル動画質問応答の性能向上に寄与するか?
  • RQ2階層的特徴共有を伴うマルチタスク学習は、主なQAタスクに相乗的な教師信号を提供するか?
  • RQ3カリキュラムにインspiredされたマルチタスクレートスケジューリングは、初期に容易なタスクを優先することで、学習の安定性と性能を向上させるか?
  • RQ4提案手法は、TVQAベンチマークにおいて既存の最先端モデルと比較してどのように性能を発揮するか?
  • RQ5各補助タスク(モダリティアライメント対時間的局所化)が全体の性能向上に果たす相対的寄与度はどの程度か?

主な発見

  • 提案手法は、視覚的コンセプト特徴を用いてTVQAデータセットで67.05%の最先端のテスト精度を達成し、以前の最良モデルを1.59ポイント上回った。
  • 字幕のみのモデル(S+Q)は64.63%の精度を達成し、ImageNet特徴を用いたTVQAのS+V+Qベースライン(63.57%)を上回り、追加の教師信号の有効性を示した。
  • アブレーションスタディの結果、時間的局所化とモダリティアライメントの両方が肯定的な寄与を示したが、モダリティアライメントの性能向上寄与度が時間的局所化よりも大きかった。
  • 視覚的コンセプト特徴と両方の補助タスクを備えた完全なモデルは、バリデーション精度66.22%を達成し、ベースラインQAモデルより0.85ポイント高い。
  • マルチタスクレートスケジューリングは、初期に誘導的バイアスを確立することで、アブレーション設定のあらゆる場面で一貫した性能向上を示し、学習ダイナミクスの改善を実証した。
  • 結果から、適切に設計された補助タスクを用いたマルチタスク学習は、低教師信号環境下でも性能を顕著に向上させられることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。