Skip to main content
QUICK REVIEW

[論文レビュー] Don't only Feel Read: Using Scene text to understand advertisements

Arka Ujjal Dey, Suman K. Ghosh|arXiv (Cornell University)|Jun 21, 2018
Video Analysis and Summarization参考文献 17被引用数 5
ひとこと要約

本稿では、広告画像分類のためのマルチモーダルフレームワークを提案する。このフレームワークは、オフザシェルの認識モデルを用いて抽出されたシーンテキストからのテキスト特徴と、深層畳み込みニューラルネットワーク(CNN)からの視覚的特徴を統合する。特徴の連結またはマルチモーダル双一次プーリング(MCB)を用いた統合により、顕著な精度向上が達成され、MCB統合を用いることでトピック分類で58%の精度に到達した。これは、シーンテキストが視覚的コンテンツとは補完的であるが重要な意味的手がかりを提供することを示している。

ABSTRACT

We propose a framework for automated classification of Advertisement Images, using not just Visual features but also Textual cues extracted from embedded text. Our approach takes inspiration from the assumption that Ad images contain meaningful textual content, that can provide discriminative semantic interpretetion, and can thus aid in classifcation tasks. To this end, we develop a framework using off-the-shelf components, and demonstrate the effectiveness of Textual cues in semantic Classfication tasks.

研究の動機と目的

  • 広告に埋め込まれたシーンテキストが画像理解に意味のある意味的手がかりを提供するかどうかを調査すること。
  • シーンテキストから抽出されたテキスト特徴が、画像分類性能の向上にどの程度有効であるかを評価すること。
  • 視覚的特徴とテキスト特徴を統合する際の、単純な統合手法(連結)とより表現力の高い手法(MCB)を比較すること。
  • 曖昧または比喩的な広告画像において、視覚的特徴とテキスト的特徴がどのように補い合うかを分析すること。
  • たとえ文字認識に不完全さがあっても、シーンテキストが広告の意味的理解を顕著に向上させられることを示すこと。

提案手法

  • テキスト検出と認識は、Textboxes [12] および Jaderberg [6] のパイプラインを用いて実施され、広告画像からシーンテキストを抽出する。
  • 信頼度に基づいて上位k個の重要な語を抽出し、300次元のword2vecベクトルに埋め込み、それらを合算してグローバルなテキスト特徴表現を形成する。
  • 視覚的特徴は、事前学習済みのGoogLeNetネットワークを用いて抽出され、最後の全結合層(1024次元)の活性化出力をグローバルな画像特徴として用いる。
  • 2つの統合戦略を評価する:(1) 特徴の連結、(2) マルチモーダル双一次プーリング(MCB)、これは画像特徴とテキスト特徴の非線形的相互作用をモデル化する。
  • MCB計算の効率化とスケーラビリティを向上させるために、カウントスケッチによる低ランク近似が用いられる。
  • フレームワークは、信頼度が70%以上であるとされる正確な文字起こしが行われた、47,000枚の広告画像から構成される洗練されたデータセットで評価される。

実験結果

リサーチクエスチョン

  • RQ1広告内のシーンテキストが、視覚的特徴のみに依存する場合よりも、画像分類の精度向上に寄与する判別的な意味的情報を提供できるか?
  • RQ2視覚的特徴とテキスト特徴を統合する際、連結とMCBの両方の統合戦略が分類精度に与える影響は何か?
  • RQ3曖昧または比喩的な広告画像において、シーンテキストからのテキスト特徴が視覚的手がかりを補完するか、あるいは上書きするか、その程度は何か?
  • RQ4特徴集約に用いる上位k個のテキスト語の数が、システムの性能にどのように影響するか?
  • RQ5テキスト抽出と埋め込みに単純なオフザシェルパイプラインを用いることで、広告画像の意味的理解に有意義な向上が得られるか?

主な発見

  • 上位5つの信頼度の高い語のテキスト特徴のみを用いる場合、40クラスのトピック分類タスクで45%の精度を達成した。これは、シーンテキストそのものが顕著な意味的情報を保持していることを示している。
  • 画像特徴とテキスト特徴を連結により統合することで、精度が53%に向上した。これは、両モダリティが分類に有意義に寄与していることを示している。
  • MCB統合手法は連結よりも優れた性能を示し、k=5のとき58%の精度に到達した。これは、モダリティ間の乗法的相互作用が、より豊かな意味的関係を捉えられることを示している。
  • MCB統合の性能は、kの値(5, 35, 100)にかかわらず安定しており、k=35およびk=100のときもそれぞれ57%の精度を示した。これは、使用する語の数に依存しない堅牢性があることを示している。
  • 視覚的質問応答(VQA)タスクにおいて、画像、テキスト、質問特徴をMCBで統合することで、精度が12.44%に向上した。これは、本フレームワークが分類を越えた汎用性を有していることを示している。
  • 本研究は、文字認識の誤りと語彙の制限が依然として主なボトルネックであることを強調しており、中間の認識段階を経ない、エンドツーエンドのピクセルから埋め込みへの学習の今後の研究を促進している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。