Skip to main content
QUICK REVIEW

[論文レビュー] Explainable Semantic Space by Grounding Language to Vision with Cross-Modal Contrastive Learning

Yizhen Zhang, Minkyu Choi|arXiv (Cornell University)|Nov 13, 2021
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

本論文は、視覚を用いた言語表現の地盤付けを、クロスモーダル対照的学習を用いて行う2ストリームモデルを提案する。これにより、独立した言語モデルが意味的に解釈可能な視覚的根拠を持つ埋め込みを学習可能となる。得られる意味的空間は直感的で、知覚的に明確に区別できるクラスタを示し、構成的推論とマルチモーダル画像検索を可能にし、MS COCOおよびVisual Genomeデータセットで性能が検証されている。

ABSTRACT

In natural language processing, most models try to learn semantic representations merely from texts. The learned representations encode the distributional semantics but fail to connect to any knowledge about the physical world. In contrast, humans learn language by grounding concepts in perception and action and the brain encodes grounded semantics for cognition. Inspired by this notion and recent work in vision-language learning, we design a two-stream model for grounding language learning in vision. The model includes a VGG-based visual stream and a Bert-based language stream. The two streams merge into a joint representational space. Through cross-modal contrastive learning, the model first learns to align visual and language representations with the MS COCO dataset. The model further learns to retrieve visual objects with language queries through a cross-modal attention module and to infer the visual relations between the retrieved objects through a bilinear operator with the Visual Genome dataset. After training, the language stream of this model is a stand-alone language model capable of embedding concepts in a visually grounded semantic space. This semantic space manifests principal dimensions explainable with human intuition and neurobiological knowledge. Word embeddings in this semantic space are predictive of human-defined norms of semantic features and are segregated into perceptually distinctive clusters. Furthermore, the visually grounded language model also enables compositional language understanding based on visual knowledge and multimodal image search with queries based on images, texts, or their combinations.

研究の動機と目的

  • 自然言語処理における分布的意味論の限界、すなわち物理的現実への根拠の欠如を解消するため、視覚と言語表現学習を統合すること。
  • 解釈可能で神経生物学的に妥当な意味的空間を生成する視覚的根拠を持つ言語モデルを開発すること。
  • 統一的で連続的な意味的空間を用いて、構成的言語理解とマルチモーダル画像検索を可能にすること。
  • 視覚的根拠が、語の埋め込みの知覚的属性によるクラスタリングを改善し、人間の意味的規範と予測的整合性を高めることを実証すること。

提案手法

  • MS COCOで共同学習される、VGGに基づく視覚ストリームとBERTに基づく言語ストリームを有する2ストリームアーキテクチャ。
  • クロスモーダル対照的損失は、プールド特徴量のコサイン類似度を用いて、画像とテキスト表現を共有埋め込み空間に一致させる。
  • クロスモーダルアテンションモジュールは、視覚的特徴マップと文脈的な語埋め込みの間のマッチングマップを計算することで、言語クエリの視覚的根拠を可能にする。
  • 双線形演算子は、Visual Genomeデータセットから学習された関係を用いて、抽出されたオブジェクト間の視覚的関係を推定する。
  • 最終的な言語ストリームはファインチューニングされ、意味的空間分析およびマルチモーダル検索のための独立モデルとして使用される。
  • マルチモーダルクエリは、画像とテキスト埋め込みの重み付き組み合わせ(α ∈ [0,1])として形成され、柔軟な画像検索を可能にする。

実験結果

リサーチクエスチョン

  • RQ1対照的学習による視覚的根拠が、人間の知覚的・神経生物学的知識と整合する解釈可能な語の埋め込みを持つ意味的空間を生成できるか?
  • RQ2根拠付けが、視覚的属性および意味的特徴による語の埋め込みクラスタリングをどの程度改善するか?
  • RQ3視覚的根拠を持つ言語モデルは、『斑馬』を『縞模様の馬』として認識するような構成的言語理解をサポートできるか?
  • RQ4統一的で連続的な意味的空間は、画像とテキストのクエリを組み合わせたマルチモーダル画像検索をどの程度効果的にサポートできるか?

主な発見

  • 地盤付けられた意味的空間は、人間の評価と神経生物学的発見と整合する、具体的から抽象的へと変化する主成分を示す。
  • 語の埋め込みは知覚的に明確に区別できるクラスタに整列しており、微細な視覚的属性のクラスタリング精度が高くなっている。
  • モデルの言語ストリームは、人間が定義した意味的規範と予測的に一致しており、解釈性の向上を示している。
  • αの重みを変化させたマルチモーダルクエリは論理的で一貫した画像検索結果を生み出す—例として、αが増加するにつれて『斑馬のような模様』から『通常の馬』へと段階的に変化する。
  • モデルは、視覚的および言語的特徴の双線形相互作用を通じて、『縞模様の馬』を『斑馬』として識別するような構成的推論を可能にする。
  • 本アプローチは、画像とテキストのクエリの連続的ブレンドが直感的で段階的な検索結果を生み出すことを実証しており、共有で根拠付けられた意味的空間の存在を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。