Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Compose Topic-Aware Mixture of Experts for Zero-Shot Video Captioning

Xin Wang, Jiawei Wu|arXiv (Cornell University)|Nov 7, 2018
Multimodal Machine Learning Applications参考文献 41被引用数 5
ひとこと要約

本稿では、外部のテキストコーパスから得られるトピック埋め込みに基づいて、特化したキャプション生成エキスパートを動的に構成するトピック認識混合エキスパート(TAMoE)モデルを提案する。この手法により、トピック間で意味的知識を転送することで、未学習のアクティビティに対しても最先端の性能を達成し、『包丁を研ぐ』タスクで43.63のCIDErスコアを記録した(ベースラインの24.77点より顕著な向上)。

ABSTRACT

Although promising results have been achieved in video captioning, existing models are limited to the fixed inventory of activities in the training corpus, and do not generalize to open vocabulary scenarios. Here we introduce a novel task, zero-shot video captioning, that aims at describing out-of-domain videos of unseen activities. Videos of different activities usually require different captioning strategies in many aspects, i.e. word selection, semantic construction, and style expression etc, which poses a great challenge to depict novel activities without paired training data. But meanwhile, similar activities share some of those aspects in common. Therefore, We propose a principled Topic-Aware Mixture of Experts (TAMoE) model for zero-shot video captioning, which learns to compose different experts based on different topic embeddings, implicitly transferring the knowledge learned from seen activities to unseen ones. Besides, we leverage external topic-related text corpus to construct the topic embedding for each activity, which embodies the most relevant semantic vectors within the topic. Empirical results not only validate the effectiveness of our method in utilizing semantic knowledge for video captioning, but also show its strong generalization ability when describing novel activities.

研究の動機と目的

  • 既存の動画キャプションモデルが、ペairedトレーニングデータに依存しているため、新しい未学習のアクティビティに一般化できないという制限に対処すること。
  • 新しいアクティビティのペアドトレーニング例が一切ない状況でも、ドメイン外の動画を正確にキャプション化できること。
  • 外部テキスト知識を活用し、トピック認識型エキスパートの動的構成によって、未学習のアクティビティのキャプション生成を支援すること。
  • 類似アクティビティ間の共通する意味的パターンをモデル化することで、オープンボリューム動画キャプションにおける一般化性能を向上させること。
  • 標準化されたベンチマーク設定において、ゼロショット動画キャプションのタスクを形式化し、評価すること。

提案手法

  • モデルは、潜在的特徴から異なるキャプション生成戦略を学ぶ、原始的でタスク固有のエキスパートを有する混合エキスパート(MoE)アーキテクチャを採用する。
  • トピック認識ゲーティングネットワークが、学習済みのトピック埋め込みに基づいてエキスパートを選択・結合し、動画アクティビティごとに動的モデル構成を可能にする。
  • トピック埋め込みは、各アクティビティに関連する単語をTF-IDF重みで処理した外部テキストコーパスから得られ、未学習の行動に対する意味的事前知識を捉える。
  • ゲーティング関数はエンドツーエンドで学習され、トピック埋め込みに条件づけられたエキスパート重みを予測することで、暗黙の知識転送を実現する。
  • モデルはアテンションを備えたシーケンス・ツー・シーケンスフレームワークを採用し、MoE層が標準的なデコーダーヘッドに置き換わることで、多様で文脈に適したキャプションを生成する。
  • モデル容量のバランスを保つために、エキスパート数と次元数を調整し、公平な比較を実現する。

実験結果

リサーチクエスチョン

  • RQ1トレーニング時に一度も見られなかったアクティビティに対しても、動画キャプションモデルは正確な記述を生成できるか?
  • RQ2外部テキストコーパスからの意味的知識を、ゼロショット一般化性能の向上に効果的に統合する方法は何か?
  • RQ3固定モデルと比較して、動的エキスパート構成メカニズムは、新しいアクティビティのキャプション品質をどの程度向上させられるか?
  • RQ4トピック認識ゲーティングの使用は、学習済みのアクティビティでも高い性能を維持しながら、ドメイン外アクティビティでの性能を向上させるか?
  • RQ5エキスパート数と次元数の変更は、未学習のアクティビティへの一般化能力にどのような影響を与えるか?

主な発見

  • TAMoEモデルは『包丁を研ぐ』タスクでCIDErスコア43.63を達成し、ベースラインモデル(24.77)より18.86ポイントも向上し、顕著なゼロショット一般化性能を示した。
  • 平均して、TAMoEは15の未学習アクティビティのうち12つでベースラインを上回り、特に『うがい液をうがいする』(52.03 vs. 11.09)および『ドラムを叩く』(39.44 vs. 31.70)で顕著な向上を示した。
  • エキスパート数8、次元256(n8_d256)のモデルが最良の性能を示し、単にモデルサイズを大きくするのではなく、最適な容量バランスが重要であることを示唆した。
  • エキスパート数256、次元128のモデル(約27.2Mパラメータ)は、エキスパート数8、次元256のモデル(約17.9Mパラメータ)よりも性能が悪く、エキスパート数の増加による利得が減少していることを示した。
  • 定性的な結果から、TAMoEは『フェンス』『うがい』『包丁を研ぐ』といった新しい概念を正しく同定・記述できており、ベースラインモデルが認識できない点を確認した。
  • 外部コーパスから得たトピック埋め込みが、関連語(例:『包丁』『石』『うがい液』)のTF-IDF重みが高く、トップ4の関連語に顕著に現れていることから、モデルが適切なキャプションを生成するのを効果的に導くことが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。