Skip to main content
QUICK REVIEW

[論文レビュー] Wide-Slice Residual Networks for Food Recognition

Niki Martinel, Gian Luca Foresti|arXiv (Cornell University)|Dec 20, 2016
Advanced Chemical Sensor TechnologiesEngineering被引用数 19
ひとこと要約

本論文では、垂直方向の食品層構造を捉えるためにスライス畳み込み層を統合し、一般特徴抽出のためのリーマン学習ブランチを備えた、食品認識のための新しい深層残差ネットワークであるWISeRを提案する。これらのブランチを統合することで、WISeRはFood-101データセットでトップ-1精度90.27%を達成し、食品構成に特化したアーキテクチャ設計により、既存手法を上回る性能を発揮する。

ABSTRACT

Food diary applications represent a tantalizing market. Such applications, based on image food recognition, opened to new challenges for computer vision and pattern recognition algorithms. Recent works in the field are focusing either on hand-crafted representations or on learning these by exploiting deep neural networks. Despite the success of such a last family of works, these generally exploit off-the shelf deep architectures to classify food dishes. Thus, the architectures are not cast to the specific problem. We believe that better results can be obtained if the deep architecture is defined with respect to an analysis of the food composition. Following such an intuition, this work introduces a new deep scheme that is designed to handle the food structure. Specifically, inspired by the recent success of residual deep network, we exploit such a learning scheme and introduce a slice convolution block to capture the vertical food layers. Outputs of the deep residual blocks are combined with the sliced convolution to produce the classification score for specific food categories. To evaluate our proposed architecture we have conducted experimental results on three benchmark datasets. Results demonstrate that our solution shows better performance with respect to existing approaches (e.g., a top-1 accuracy of 90.27% on the Food-101 challenging dataset).

研究の動機と目的

  • 同じ料理が材料、調理法、盛り付け方の違いにより外見が著しく異なるため、食品画像におけるクラス内変動の高い問題に対処すること。
  • 食品固有の構造的特性を考慮しないでオフ・ザ・シェルフの深層アーキテクチャを適用する既存手法の限界を克服すること。
  • 特に多くの料理に見られる垂直方向の積層構造に注目し、食品構成に特化した深層学習アーキテクチャを設計すること。
  • スライス畳み込みによる構造的特徴学習と、一般深層表現学習(リーマンブロックを用いて)を組み合わせることで分類性能を向上させること。

提案手法

  • 食品画像の垂直スライスから特徴を抽出する、新しいスライス畳み込み層を導入し、多くの料理に見られる積層構造をモデル化する。
  • スライス畳み込みブランチをワイドリーマンネットワーク(WRN)と組み合わせ、複雑で多様な食品の外見から一般視覚特徴を学習する。
  • 層間の特徴マップを豊かにすることで、深層リーマンネットワークにおける特徴再利用劣化を緩和し、表現能力を向上させる。
  • 最終分類の前に両ブランチからの特徴を連結して統合し、構造的特徴と一般視覚的手がかりの両方を活用できるようにする。
  • リーマンブランチにImageNetで事前学習した重みを活用し、強いインダクティブバイアスを注入することで、特徴の区別能を向上させる。
  • 分類時のモデルの注目領域を解釈・検証するために、ガイドド・グレード・カム(Guided Grad-CAM)を用いた視覚的注目分析を実施する。

実験結果

リサーチクエスチョン

  • RQ1食品構造、特に垂直方向の積層構造に特化した深層学習アーキテクチャが、食品認識性能を向上させることができるか?
  • RQ2スライス畳み込みによる構造的特徴学習と一般リーマン学習を組み合わせることで、標準アーキテクチャと比較して分類精度がどのように向上するか?
  • RQ3ImageNetでリーマンブランチを事前学習することで、微調整なしに食品認識性能がどの程度向上するか?
  • RQ4視覚的注目分析によって示されるように、提案アーキテクチャは分類時に関連のある画像領域を自ら同定・注目することができるか?

主な発見

  • WISeRはFood-101ベンチマークでトップ-1精度90.27%を達成し、最先端手法を上回る性能を発揮する。
  • リーマン学習ブランチが性能向上に大きく寄与しており、スライス畳み込みブランチは統合された際のみわずかな向上をもたらす。
  • WISeRアーキテクチャを完全にスクラッチから訓練した場合、Food-101でのトップ-1精度はたった78.12%にとどまり、ImageNet事前学習の重要性が確認される。
  • ガイドド・グレード・カムによる視覚的注目分析から、WISeRがプレートやスプーン、背景など不要な物体を無視し、関連のある食品領域にのみ注目していることが確認される。
  • スライス特徴とリーマン特徴の統合により優れた性能が得られ、構造的特徴と一般特徴が食品認識において補完的であることが示される。
  • データセット(Food-101、UECFood100、UECFood256)にわたる一般化性能が高く、ドメインシフトや多様な食品構成に対してもロバストであることが示される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。