Skip to main content
QUICK REVIEW

[論文レビュー] Large Scale Visual Food Recognition

Weiqing Min, Zhiling Wang|arXiv (Cornell University)|Mar 30, 2021
Advanced Chemical Sensor TechnologiesEngineering参考文献 97被引用数 17
ひとこと要約

本稿では、2,000カテゴリ、100万枚以上の画像を有する、現在最大規模の食品認識データセットであるFood2Kを紹介する。従来のデータセットと比べて規模が著しく上回っており、プログレッシブトレーニングと自己注意機構を用いた深層プログレッシブリージョン強化ネットワークを提案し、多様な局所特徴を学習するとともに、マルチスケールの文脈情報を統合して特徴を強化することで、食品認識、検索、検出、セグメンテーション、クロスモーダルレシピタスクにおいて最先端の性能と優れた一般化能力を達成した。

ABSTRACT

Food recognition plays an important role in food choice and intake, which is essential to the health and well-being of humans. It is thus of importance to the computer vision community, and can further support many food-oriented vision and multimodal tasks. Unfortunately, we have witnessed remarkable advancements in generic visual recognition for released large-scale datasets, yet largely lags in the food domain. In this paper, we introduce Food2K, which is the largest food recognition dataset with 2,000 categories and over 1 million images.Compared with existing food recognition datasets, Food2K bypasses them in both categories and images by one order of magnitude, and thus establishes a new challenging benchmark to develop advanced models for food visual representation learning. Furthermore, we propose a deep progressive region enhancement network for food recognition, which mainly consists of two components, namely progressive local feature learning and region feature enhancement. The former adopts improved progressive training to learn diverse and complementary local features, while the latter utilizes self-attention to incorporate richer context with multiple scales into local features for further local feature enhancement. Extensive experiments on Food2K demonstrate the effectiveness of our proposed method. More importantly, we have verified better generalization ability of Food2K in various tasks, including food recognition, food image retrieval, cross-modal recipe retrieval, food detection and segmentation. Food2K can be further explored to benefit more food-relevant tasks including emerging and more complex ones (e.g., nutritional understanding of food), and the trained models on Food2K can be expected as backbones to improve the performance of more food-relevant tasks. We also hope Food2K can serve as a large scale fine-grained visual recognition benchmark.

研究の動機と目的

  • 食品ビジョン認識分野における大規模かつ高品質なデータセットの不足が、食品コンピューティングや細分化視覚分析分野の進展を制限しているという問題に対処すること。
  • 食品認識および関連ビジョンタスクにおける高度なモデルのトレーニングと評価のためのスケーラブルなベンチマークを確立すること。
  • プログレッシブトレーニングと注目機構を活用することで、細分化された多様で文脈豊かな特徴を捉えることにより、食品の視覚的表現学習を向上させること。
  • Food2Kが、画像認識、検索、検出、セグメンテーション、クロスモーダルレシピ検索といった複数の下流タスクにおいて、優れた一般化能力を示すことを実証すること。
  • 少数の例での食品認識、異なる料理やスーパークラス間での転移学習、食品画像生成といった新規応用を支援すること。

提案手法

  • 食品画像から多様で補完的な視覚的パターンを捉えるために、プログレッシブトレーニング戦略を用いる深層プログレッシブリージョン強化ネットワーク(DPREN)を提案する。
  • 局所特徴に文脈的情報を統合することで特徴の識別力を向上させるため、マルチスケール自己注意を用いたリージョン特徴強化モジュールを導入する。
  • 反復的なデータクリーニング、専門家によるアノテーション、品質管理を実施し、Food2Kデータセットの信頼性と多様性を確保する。
  • 野菜、肉、揚げ物など、スーパークラスに分類された2,000カテゴリの階層的食品オントロジーを活用し、意味的カバレッジとスケーラビリティを確保する。
  • Food2Kでモデルをトレーニングし、ゼロショットおよび少数ショット評価プロトコルを用いて下流タスクへの転移性を評価する。
  • 料理間、スーパークラス間、状況間の転移学習を支援し、クロスドメイン一般化分析を可能にする。

実験結果

リサーチクエスチョン

  • RQ1大規模かつ高品質な食品データセットは、食品ビジョン認識モデルの性能と一般化能力を著しく向上させることができるか?
  • RQ2プログレッシブトレーニングは、細分化された食品認識に適した多様で補完的な局所特徴を学習するために効果的か?
  • RQ3自己注意機構を用いてマルチスケールの文脈情報を局所特徴に統合することで、認識精度がどの程度向上するか?
  • RQ4Food2Kで事前学習したモデルは、食品検出、セグメンテーション、クロスモーダルレシピ検索といった下流タスクに効果的に一般化できるか?
  • RQ5Food2Kは、少数ショット食品認識やクロスキュイジン転移学習といった新規タスクのベンチマークとしての可能性をどの程度持つか?

主な発見

  • Food2Kには、2,000カテゴリにわたり1,036,564枚の画像が含まれており、カテゴリ数と画像数の両面で、既存のデータセットを1桁以上上回っている。
  • 提案された深層プログレッシブリージョン強化ネットワークは、Food2Kで最先端の性能を達成し、プログレッシブトレーニングと自己注意機構による優れた特徴学習を実証した。
  • Food2Kで事前学習したモデルは優れた一般化能力を示し、食品画像認識、検索、検出、セグメンテーション、クロスモーダルレシピ検索といった複数のタスクで性能向上を達成した。
  • Food2Kは、ゼロショットおよび少数ショットの転移学習を効果的に可能にし、異なる料理やスーパークラス間での転移学習においても有望な結果を示した。
  • GANを用いた食品画像生成という新規応用をサポートし、現実的で意味的に整合性のある食品画像の生成に成功した。
  • データセットおよびモデルは http://123.57.42.89/FoodProject.html にて公開されており、食品ビジョンおよびマルチモーダル学習分野の広範な研究を促進している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。