Skip to main content
QUICK REVIEW

[論文レビュー] ImageNet MPEG-7 Visual Descriptors - Technical Report

Frédéric Rayar|arXiv (Cornell University)|Feb 1, 2017
Advanced Image and Video Retrieval Techniques参考文献 9被引用数 3
ひとこと要約

この技術報告書では、1419万7060枚の画像を含むImageNetデータセット全体に対して、MPEG-7の視覚的記述子であるカラーレイアウト記述子(CLD)およびエッジヒストグラム記述子(EHD)の抽出と公開が行われた。CLDは8×8画素ブロックのDCTベースの量子化により空間的色分布を捉え、EHDは4×4ブロックのヒストグラムによりエッジパターンを符号化する。両記述子は研究用途のコンテンツベース画像検索および視覚認識を支援するため、構造化されたファイル形式で公開されている。

ABSTRACT

ImageNet is a large scale and publicly available image database. It currently offers more than 14 millions of images, organised according to the WordNet hierarchy. One of the main objective of the creators is to provide to the research community a relevant database for visual recognition applications such as object recognition, image classification or object localisation. However, only a few visual descriptors of the images are available to be used by the researchers. Only SIFT-based features have been extracted from a subset of the collection. This technical report presents the extraction of some MPEG-7 visual descriptors from the ImageNet database. These descriptors are made publicly available in an effort towards open research.

研究の動機と目的

  • 既存のSIFT特徴量に加えて、標準化されたMPEG-7視覚的記述子を提供することで、ImageNetデータベースの有用性を拡張すること。
  • 現在、SIFTや属性の小規模なサブセットのみを提供しているImageNetにおいて、包括的な低レベル視覚的記述子の欠如を是正すること。
  • 高速かつ標準化された特徴抽出を可能にすることで、大規模なコンテンツベース画像検索および視覚認識研究を支援すること。
  • 標準化されたMPEG-7記述子を用いることで、視覚認識分野における相互運用性と再現可能性を確保すること。
  • CLDおよびEHD特徴量を、ImageNetデータセット全体にわたり公開し、コンピュータビジョン分野におけるオープンサイエンスを促進すること。

提案手法

  • ImageNetが完全に処理され、21,841のシンセットと14,197,060枚の画像が解析され、62件の破損ファイルは除外された。
  • CLDについては、各画像が64個の8×8ピクセルブロックに分割され、各ブロックごとに代表色が計算された後、2次元DCTと低周波数係数のジグザグ順序に並べ替えられた。
  • CLD記述子は、最初の192係数(3チャンネル × 64係数)を量子化することで形成され、1つの画像あたり192次元のベクトルが得られた。
  • EHDについては、各画像が16個の4×4ピクセルブロックに分割され、各ブロックで5種類のエッジタイプ(水平、垂直、対角線など)のヒストグラムが計算された。
  • EHD記述子は、16ブロック × 5エッジタイプの合計80値を連結することで構築され、1つの画像あたり80次元のベクトルが得られた。
  • 記述子は1行に1画像分のデータが記録されたテキストファイルに保存され、フォーマットは image_id;value_1;...;value_d であり、CLDではd=192、EHDではd=80である。

実験結果

リサーチクエスチョン

  • RQ1全ImageNetデータセットにわたり、標準化されたMPEG-7視覚的記述子をスケールに応じて効率的かつ一貫して抽出できるか?
  • RQ2大規模画像認識タスクにおいて、CLDとEHD記述子は空間的色分布とエッジパターンをどの程度適切に捉えられるか?
  • RQ3SIFTなどの既存のImageNet特徴量と組み合わせた場合、CLDおよびEHDはコンテンツベース画像検索の性能をどの程度向上できるか?
  • RQ41400万枚を超える画像をMPEG-7記述子で処理する際、再現可能かつ公開可能な方法で実行可能で信頼性があるか?
  • RQ5特にエッジまたは色の特徴に関して、ImageNetのシンセットごとに記述子の可用性や品質に体系的な差異が生じるか?

主な発見

  • 処理済みの全14,197,060枚の画像について、CLD記述子が正常に計算され、1画像あたり192次元の特徴ベクトルが得られた。
  • 処理済みの全14,197,060枚の画像について、EHD記述子が正常に計算され、1画像あたり80次元の特徴ベクトルが得られた。
  • 合計21,841のシンセット固有の記述子ファイルが生成され、1シンセットあたり1つのファイルが作成され、ファイル名は synset_id.ext(拡張子はcldまたはehd)の形式であった。
  • 完全なデータセットは2つのアーカイブとして公開された:ImageNet_MPEG-7_CLD_whole.zip(約1GB)およびImageNet_MPEG-7_EHD_whole.zip(約2GB)。
  • 処理パイプラインにより、CLDでは解像度不変性が確保され、EHDでは一貫したブロックベースのヒストグラム計算が実現され、効率的かつ標準化された特徴抽出が可能になった。
  • 著者によると、ほとんどの画像にCLDおよびEHDの両方の記述子が存在するが、すべての画像についてその整合性を確認する検証は実施されていない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。