Skip to main content
QUICK REVIEW

[論文レビュー] LEWIS: Latent Embeddings for Word Images and their Semantics

Albert Gordo, Jon Almazán|arXiv (Cornell University)|Sep 21, 2015
Multimodal Machine Learning Applications参考文献 24被引用数 6
ひとこと要約

LEWISは、文字画像から転写を経由せずに意味的コンセプトを直接予測するCNNベースのモデルを提案する。重み付きランク損失を用いて、画像とコンセプトを共有の潜在空間に埋め込む。エンド・トゥ・エンドでピクセルからコンセプトへ意味を学習することで、ゼロショット一般化において高い精度(最大95% mAP)を達成し、転写ベースのベースラインを上回る。

ABSTRACT

The goal of this work is to bring semantics into the tasks of text recognition and retrieval in natural images. Although text recognition and retrieval have received a lot of attention in recent years, previous works have focused on recognizing or retrieving exactly the same word used as a query, without taking the semantics into consideration. In this paper, we ask the following question: \emph{can we predict semantic concepts directly from a word image, without explicitly trying to transcribe the word image or its characters at any point?} For this goal we propose a convolutional neural network (CNN) with a weighted ranking loss objective that ensures that the concepts relevant to the query image are ranked ahead of those that are not relevant. This can also be interpreted as learning a Euclidean space where word images and concepts are jointly embedded. This model is learned in an end-to-end manner, from image pixels to semantic concepts, using a dataset of synthetically generated word images and concepts mined from a lexical database (WordNet). Our results show that, despite the complexity of the task, word images and concepts can indeed be associated with a high degree of accuracy

研究の動機と目的

  • 正確な語彙一致を超えた意味的理解を可能にし、特に都市風景理解において有効であることを目的とする。
  • 不完全な転写や未知語の処理に依存する二段階アプローチの限界を解消することを目的とする。
  • 文字画像と意味的コンセプトが共同で表現される、コンactな共有埋め込み空間を学習することを目的とする。
  • 共有表現を通じた意味的類似性を活用することで、訓練時に見なかった語に対してもゼロショット一般化を可能とすることを目的とする。
  • 今後の研究のための、大規模で意味的にアノテートされた合成文字画像データセットを生成することを目的とする。

提案手法

  • 深層畳み込みニューラルネットワーク(CNN)を、関連する意味的コンセプトが関連のないものよりも高い順位に来るように保証する重み付きランク損失で訓練する。
  • モデルは2つの埋め込み関数を学習する:1つはFC7層による文字画像用、もう1つはFC8層による意味的コンセプト用で、両者とも共有のD次元ユークリッド空間にマップする。
  • 最終層の重みは既知のコンセプトのトランスダクティブ埋め込みとして機能し、FC7層は未学習の文字画像のインダクティブ埋め込みを提供する。
  • ネットワークは、WordNetから抽出した意味的コンセプトとペairedされた合成文字画像上でエンド・トゥ・エンドに訓練される。
  • 類似度計算のための検索タスクでは、特徴量をL2正規化し、マッチングにはドット積を用いる。
  • 本アプローチは意味的クエリや、コンセプトベクトルの加算・減算による複雑な検索を可能にする。

実験結果

リサーチクエスチョン

  • RQ1文字画像のピクセルから明示的な転写を経由せずに意味的コンセプトを予測できるか?
  • RQ2深層CNNが、文字画像と意味的コンセプトが意味的に整合する共有埋め込み空間を学習できるか?
  • RQ3学習時に見なかった語(OoV語)に対して、モデルはどの程度一般化できるか?
  • RQ4特徴空間で意味を直接学習することは、語の転写に基づく二段階アプローチを上回るか?
  • RQ5コンセプト埋め込みのベクトル算術により、複雑な意味的クエリをサポートできるか?

主な発見

  • LEWISは、意味的目的で学習した場合、画像からコンセプトへのタスクで95%の平均平均精度(mAP)を達成した。一方、CNN-Dict 7特徴量を用いた二段階ベースラインではわずか59%であった。
  • 未学習語への一般化では、mAPが56.1%(K=128, l=7)および61.9%(K=256, l=7)を示し、強力なゼロショット能力を示した。
  • 画像同士の検索では、LEWISは高い性能をKランクが高い範囲でも維持しているが、CNN-Dict 7特徴量はk=1を過ぎると急速に性能を落とす。これは正確な語の一致に依存しているためである。
  • 定性的な結果では、真のラベルにないにもかかわらず、意味的に類似したコンセプトが潜在空間の近接領域に埋め込まれていることが示された。
  • コンセプトベクトル算術(例:加算・減算)により、意味的な複雑なクエリが可能となり、例えば「レストラン」と「食事」を組み合わせることで「ピザ屋」に関連する画像を検索できる。
  • 同じ意味を持つが異なる表記を持つ画像を効果的に検索でき、視覚的変動に対して強いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。