Skip to main content
QUICK REVIEW

[論文レビュー] Meta Module Network for Compositional Visual Reasoning

Wenhu Chen, Zhe Gan|arXiv (Cornell University)|Oct 8, 2019
Multimodal Machine Learning Applications参考文献 47被引用数 11
ひとこと要約

本論文は、関数レシピからタスク固有のモジュールを動的に生成する共有メタモジュールを用いる、新しいニューラルモジュールネットワークアーキテクチャであるメタモジュールネットワーク(MMN)を提案する。これにより、スケーラブルで一般化可能な視覚的推論が可能になる。関数を埋め込み空間に符号化することで、未学習の関数にも一般化可能であり、モデルの複雑性は一定を保ち、GQAおよびCLEVRにおいて先行するNMNを上回る性能を示し、未学習関数においても強力なゼロショット一般化性能を発揮する。

ABSTRACT

Neural Module Network (NMN) exhibits strong interpretability and compositionality thanks to its handcrafted neural modules with explicit multi-hop reasoning capability. However, most NMNs suffer from two critical drawbacks: 1) scalability: customized module for specific function renders it impractical when scaling up to a larger set of functions in complex tasks; 2) generalizability: rigid pre-defined module inventory makes it difficult to generalize to unseen functions in new tasks/domains. To design a more powerful NMN architecture for practical use, we propose Meta Module Network (MMN) centered on a novel meta module, which can take in function recipes and morph into diverse instance modules dynamically. The instance modules are then woven into an execution graph for complex visual reasoning, inheriting the strong explainability and compositionality of NMN. With such a flexible instantiation mechanism, the parameters of instance modules are inherited from the central meta module, retaining the same model complexity as the function set grows, which promises better scalability. Meanwhile, as functions are encoded into the embedding space, unseen functions can be readily represented based on its structural similarity with previously observed ones, which ensures better generalizability. Experiments on GQA and CLEVR datasets validate the superiority of MMN over state-of-the-art NMN designs. Synthetic experiments on held-out unseen functions from GQA dataset also demonstrate the strong generalizability of MMN. Our code and model are released in Github https://github.com/wenhuchen/Meta-Module-Network.

研究の動機と目的

  • ニューラルモジュールネットワーク(NMN)のスケーラビリティおよび一般化可能性の制限を解決すること。NMNは各関数ごとに手作業でモジュールを設計する必要があり、未学習の関数には一般化できない。
  • 関数の数が増えてもモデル複雑性が一定を保つ柔軟なアーキテクチャを設計すること。
  • 関数レシピの埋め込みにおける構造的類似性を活用して、未学習関数へのゼロショット一般化を可能にすること。
  • 標準的なNMNの解釈可能性と構成的特性を維持しつつ、現実世界の視覚的推論タスクにおける実用性を向上させること。

提案手法

  • メタモジュールは、連続的埋め込みに符号化された入力関数レシピ(キー・バリューのペア)に基づいて、動的にインスタンスモジュールを生成するように訓練される。
  • 関数レシピはベクトル空間に埋め込まれ、メタモジュールがパラメータ共有を用いて関数固有のモジュールを生成可能になる。
  • 教師-生徒トレーニングフレームワークにより中間的な監視が提供される:記号的教師が正しい中間出力を生成し、それが生徒のインスタンスモジュールをガイドする。
  • モデルは粗いから細かい段階の意味解析器を用いて質問を実行可能なプログラムに変換し、その後、インスタンス化されたモジュールの実行グラフによって実行される。
  • モジュール監視(教師信号を介して)と答えの監視を併用した共同学習により、正確な推論と一般化が保証される。
  • 未学習の関数レシピを埋め込み、学習済みのものとの類似性に基づいて新しいモジュールを生成することで、ゼロショット推論をサポートする。

実験結果

リサーチクエスチョン

  • RQ1関数の集合が拡大してもモデル複雑性が増加しないように、1つのメタモジュールが多様でタスク固有のモジュールを動的にインスタンス化できるか?
  • RQ2学習済み関数との埋め込み類似性を活用することで、未学習関数への一般化が可能か?
  • RQ3提案手法は、標準的なNMNよりもスケーラビリティと一般化性を向上させつつも、強力な解釈可能性と構成的特性を維持できるか?
  • RQ4答えの監視のみに比べて、モジュール監視が推論精度の向上にどの程度寄与するか?

主な発見

  • MMNはGQAおよびCLEVRで最先端の性能を達成し、既存のNMNベースのモデルを上回る。
  • モジュール監視(η = 0.5)を適用した場合、6層のMCANと同等のパラメータ数であるにもかかわらず、1層のMCANよりも高い精度を達成する。
  • 未学習の関数に対しては、verify_shapeで61%のゼロショット精度、choose_nameで79%を達成し、ランダムベースライン(5%)を著しく上回る。
  • 中間推論ステップのRecall@1は59%、Recall@2は73%を達成しており、記号的教師出力と強い整合性を示している。
  • アブレーションスタディでは、4エポックのブートストラップによる性能向上が確認され、モジュール監視が高精度を達成するために不可欠であることが示された。
  • 関数レシピの埋め込みにおける構造的類似性を活用することで、未学習関数への一般化が効果的に実現され、強力なゼロショット能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。