Skip to main content
QUICK REVIEW

[論文レビュー] One Model, Multiple Modalities: A Sparsely Activated Approach for Text, Sound, Image, Video and Code

Yong Dai, Duyu Tang|arXiv (Cornell University)|May 12, 2022
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

この論文では、テキスト、画像、音声、動画、コードの各タスクに特化したパラメータヘッドをすくい的に活性化する、1つのマルチモーダルモデルであるSkillNetを提案する。各モダリティごとにパラメータを特化させ、推論時には関連する部分のみを活性化することで、SkillNetはモダリティ特化モデルと同等の性能を達成するとともに、効率的な自己教師付き事前学習を可能にし、画像、動画、コードのタスクでモダリティ特化ベースラインを上回り、中国語テキストから画像への検索タスクで最先端の正確性を達成しながら、活性化パラメータ数を少なくした。

ABSTRACT

People perceive the world with multiple senses (e.g., through hearing sounds, reading words and seeing objects). However, most existing AI systems only process an individual modality. This paper presents an approach that excels at handling multiple modalities of information with a single model. In our "{SkillNet}" model, different parts of the parameters are specialized for processing different modalities. Unlike traditional dense models that always activate all the model parameters, our model sparsely activates parts of the parameters whose skills are relevant to the task. Such model design enables SkillNet to learn skills in a more interpretable way. We develop our model for five modalities including text, image, sound, video and code. Results show that, SkillNet performs comparably to five modality-specific fine-tuned models. Moreover, our model supports self-supervised pretraining with the same sparsely activated way, resulting in better initialized parameters for different modalities. We find that pretraining significantly improves the performance of SkillNet on five modalities, on par with or even better than baselines with modality-specific pretraining. On the task of Chinese text-to-image retrieval, our final system achieves higher accuracy than existing leading systems including Wukong{ViT-B} and Wenlan 2.0 while using less number of activated parameters.

研究の動機と目的

  • 複数のモダリティを別々のモデルを必要とせずに処理できる統合モデルの開発。
  • タスクごとに関連するモデル部分のみを活性化する、効率的で解釈可能なパラメータ特化の実現。
  • すくい的パラメータ活性化が、さまざまなモダリティにわたる事前学習の効率性と下流タスクの性能を向上させるかの調査。
  • 1つのモデルが計算コストを削減しながら、モダリティ特化モデルと同等またはそれ以上の正確性を達成できるかの評価。

提案手法

  • SkillNetは、異なるモダリティ(例:テキスト、画像、音声、動画、コード)に特化したパラメータヘッドをもつ、すくい的パラメータ活性化機構を用いる。
  • 推論時には、入力のモダリティに関連するパラメータヘッドのみが活性化され、他のヘッドは非活性化されるため、計算負荷が低減される。
  • 変換器アーキテクチャを拡張し、マルチヘッドアテンションの前に、モダリティ固有のクエリ、キー、値ベクトルを特化ヘッドで生成する。
  • 同じすくい的活性化パターンを用いて自己教師付き事前学習が可能であり、複数のモダリティにわたる初期化の質が向上する。
  • 事前学習はすべてのモダリティで同時に実施され、知識の共有が可能な共通の目的関数を用いる。
  • アーキテクチャはモダリティに依存せず、タスクに依存せず、新しいモダリティへの拡張が最小限の再設定で可能である。

実験結果

リサーチクエスチョン

  • RQ11つのモデルが、テキスト、画像、音声、動画、コードの各タスクにおいて、5つのモダリティ特化モデルと同等の性能を達成できるか?
  • RQ2密度的モデルと比較して、すくい的パラメータルーティングがモデルの効率性と性能を向上させるか?
  • RQ3すくい的活性化を用いた自己教師付き事前学習は、モダリティ特化事前学習よりも優れた初期化をもたらすか?
  • RQ4モデルは、テキストから動画への検索のような低リソースタスクを含め、多様なモダリティにうまく一般化できるか?

主な発見

  • SkillNetは、テキスト分類、音声認識、テキストから画像への検索、テキストから動画への検索、テキストからコードへの検索の5つのタスクすべてで、5つのモダリティ特化ファインチューニングモデルと同等の性能を達成した。
  • 事前学習後、SkillNetは画像、動画、コードのタスクでモダリティ特化事前学習ベースラインを上回り、テキストから画像への検索で73.59%の正確度、テキストから動画への検索でRecall@10が81.77%を達成した。
  • 中国語テキストから画像への検索では、テストセットで37.0%のRecall@1を達成し、活性化パラメータ数が124Mのわずかで、Wukong ${}_{\text{ViT-B}}$(36.7% R@1、197Mパラメータ)とWenlan 2.0(34.1% R@1、445Mパラメータ)を上回った。
  • 事前学習はすべてのモダリティで性能を著しく向上させ、5つのタスクのうち3つでモダリティ特化事前学習よりも高い向上を示した。
  • すくい的活性化機構により、推論が効率化され、タスクごとにパラメータのわずかな部分しか使用されないため、計算コストが削減されつつ正確性に影響を与えない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。