Skip to main content
QUICK REVIEW

[論文レビュー] DeepSeek: Content Based Image Search & Retrieval.

Tanya Piplani, David Bamman|arXiv (Cornell University)|Jan 9, 2018
Multimodal Machine Learning Applications参考文献 7被引用数 3
ひとこと要約

本稿では、自然言語クエリを用いて意味的に関連する画像を検索するコンテンツベースの画像検索システムDeepSeekを提案する。2つの手法を採用する:微調整されたResNet-101とスキップ・スコール・ベクトルを用いたキャプションベース検索、および学習された画像・テキスト埋め込みを用いたエンド・ツー・エンドの埋め込み空間検索。後者ではトップ5検索における精度が91.2%に達するが、トップ1精度は68.3%と低く抑えられる。これは、意味的画像検索における共同埋め込み学習の有効性を示している。

ABSTRACT

Most of the internet today is composed of digital media that includes videos and images. With pixels becoming the currency in which most transactions happen on the internet, it is becoming increasingly important to have a way of browsing through this ocean of information with relative ease. YouTube has 400 hours of video uploaded every minute and many million images are browsed on Instagram, Facebook, etc. Inspired by recent advances in the field of deep learning and success that it has gained on various problems like image captioning and, machine translation , word2vec , skip thoughts, etc, we present DeepSeek a natural language processing based deep learning model that allows users to enter a description of the kind of images that they want to search, and in response the system retrieves all the images that semantically and contextually relate to the query. Two approaches are described in the following sections.

研究の動機と目的

  • 画像ベースのクエリやキーワードマッチング、メタデータに依存する従来の画像検索システムの限界を解消し、意味的意味を的確に捉えることを目的とする。
  • 自然言語記述を入力クエリとして用いて、正確かつ効率的なコンテンツベースの画像検索を可能にする。
  • 画像ベース検索の根本的欠陥を是正し、類似画像を必要とせず、記述的テキストで検索できるようにする。
  • 画像とテキストの特徴が意味的に整合する統一された埋め込み空間を構築し、検索パフォーマンスを向上させる。

提案手法

  • MS-COCOのオブジェクト検出で事前学習された微調整済みResNet-101バックボーンを用い、画像からディープ畳み込み特徴を抽出する。
  • MS-COCOデータセットで学習されたLSTMベースの言語モデルを用いて、画像キャプションを生成し、意味的に豊かなテキスト記述を生成する。
  • スキップ・スコール・モデルを用いて生成されたキャプションとユーザークエリを密なベクトル表現に符号化し、意味的類似度の計算を可能にする。
  • クエリ埋め込みとデータセット内画像のキャプション埋め込みとの間のL2距離を最小化することで、画像検索を実行する。
  • 画像とその対応するキャプションを、シアン型アーキテクチャを用いて共有された意味的空間に共同で埋め込むエンド・ツー・エンドの埋め込み空間検索手法を実装する。
  • 対照的損失目的関数を最適化し、埋め込み空間内で正例ペアを近づけ、負例ペアを遠ざけることで、検索を最適化する。

実験結果

リサーチクエスチョン

  • RQ1テキストベースのクエリシステムは、従来の画像ベースまたはキーワードベースの画像検索に比べ、意味的関連性とユーザーの表現力の面で優れていると言えるか?
  • RQ2スキップ・スコール・ベクトルモデルは、画像キャプションからの意味的意味を、下流の検索タスクに適切に捉えられるか?
  • RQ3画像とキャプションを共有された空間に共同で埋め込むことで、キャプションベース検索に比べて検索精度が向上するか?
  • RQ4検索指標の選択(例:精度@1 対 精度@5)は、意味的画像検索モデルの真のパフォーマンスをどれだけ的確に反映しているか?

主な発見

  • 埋め込み空間検索(ESR)手法は、トップ1精度が低いにもかかわらず、トップ5精度で91.2%を達成し、キャプションベース検索(CBR)を上回った。
  • キャプションベース検索は、埋め込みベース検索よりも高い精度@1(72.9%)を達成しており、トップ1結果の初期ランク付け精度が優れていることを示している。
  • スキップ・スコール・モデルは、意味的に関連するクエリと画像の間で高い意味的類似度を実現するように、画像キャプションを意味のあるベクトル表現に効果的に符号化した。
  • 本システムは優れた定性的なパフォーマンスを示し、物体の存在や意味的関係(例:「犬がテレビを見ている」)を両方とも正確に満たす画像を正しく検索した。
  • 検索パイプラインはGPU最適化がなされておらず、1クエリあたり1.7~2.1秒のタイミング結果から、ハードウェアアクセラレーションにより顕著なパフォーマンス向上が見込まれる。
  • モデルの性能は、MS-COCOデータセットを用いて標準指標(BLEU、METEOR、ROUGE-L、CIDEr)で定量的に評価され、最先端のキャプション生成モデルと比較して競争力のある結果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。