Skip to main content
QUICK REVIEW

[論文レビュー] Combining Weakly and Webly Supervised Learning for Classifying Food Images

Parneet Kaur, Karan Sikka|arXiv (Cornell University)|Dec 23, 2017
Image Retrieval and Classification Techniques参考文献 20被引用数 3
ひとこと要約

本稿では、最小限の手動クリーニングを伴うウェブリー監視学習と弱教師付き学習(WSL)を組み合わせたハイブリッドアプローチを提案し、食品画像分類の精度を向上させることを目的としている。大規模でノイズの多いウェブデータに少しずつ手動でクリーニングされたデータを段階的に統合し、WSLを用いて判別能の高い領域を局所化することで、トップ1の正確度が76.2%に達し、クリーニング済みデータのみで学習したモデル(63.3%)やウェブデータのみで学習したモデル(50.3%)を著しく上回った。

ABSTRACT

Food classification from images is a fine-grained classification problem. Manual curation of food images is cost, time and scalability prohibitive. On the other hand, web data is available freely but contains noise. In this paper, we address the problem of classifying food images with minimal data curation. We also tackle a key problems with food images from the web where they often have multiple cooccuring food types but are weakly labeled with a single label. We first demonstrate that by sequentially adding a few manually curated samples to a larger uncurated dataset from two web sources, the top-1 classification accuracy increases from 50.3% to 72.8%. To tackle the issue of weak labels, we augment the deep model with Weakly Supervised learning (WSL) that results in an increase in performance to 76.2%. Finally, we show some qualitative results to provide insights into the performance improvements using the proposed ideas.

研究の動機と目的

  • 細分化された分類のための手動でクリーニングされた食品画像データセットの高コストとスケーラビリティの制限を解決すること。
  • 食品画像分類におけるノイズが多い、複数の食品が混在する、弱いラベルが付与されたウェブデータの課題に取り組むこと。
  • 限定的な手動クリーニングデータと大規模なクリーニングされていないウェブデータを組み合わせることで分類の正確度を向上させること。
  • 弱教師付き学習(WSL)を用いて判別能の高い領域を局所化し、視覚的に類似した食品クラス間の混同を低減すること。
  • クリーニングデータの量が増えるに従い性能が線形に向上することを示し、WSLが一般化性能と局所化の正確度を向上させることを実証すること。

提案手法

  • 検索エンジン(例:Google Images)からクリーニングされていないウェブデータを収集し、大規模でノイズの多いトレーニングデータセットを構築する。
  • 少しずつ手動でクリーニングされた画像をウェブデータに段階的に統合し、モデル性能を段階的に向上させる。
  • 画像ラベルのみを用いて深層ニューラルネットワークにWSLを適用し、活性化マップの生成を可能にする。
  • WSLから得られるクラス活性化マップ(CAMs)を用いて、複数の食品が同時に存在する画像であっても、判別能の高い食品の領域を特定・注目する。
  • クリーニング済みデータとウェブデータの組み合わせデータセット上で、WSLの監視のもとで深層学習モデルをエンドツーエンドで訓練し、一般化性能を向上させ、カテゴリ間のノイズの影響を低減する。
  • UEC256テストセットを用いてトップ1およびトップ5の正確度を評価し、局所化マップの分析から定性的な洞察を得る。

実験結果

リサーチクエスチョン

  • RQ1限定的な手動クリーニングデータと大規模なウェブデータを組み合わせることで、単独で使用する場合と比較して、食品画像分類の正確度が向上するか?
  • RQ2ノイズが多い、複数の食品が混在する、弱いラベルが付与されたウェブデータで学習する際、弱教師付き学習(WSL)の統合がモデル性能にどのように寄与するか?
  • RQ3視覚的に類似したクラス間で、WSLが判別能の高い食品領域の局所化をどの程度向上させるか?
  • RQ4トレーニングセットとテストセットの間でデータ分布のシフト(例:異なる料理文化)が、モデルの一般化性能や誤分類率に与える影響は何か?
  • RQ5マルチオブジェクト状況下でのWSLの失敗モードは何か? また、それらはトップ1とトップ5の予測性能にどのように影響するか?

主な発見

  • ウェブデータのみで学習した場合のトップ1正確度50.3%から、少量の手動クリーニングデータを追加することで72.8%に上昇し、クリーニングによる性能向上が線形に発現することが示された。
  • さらにWSLの統合によりトップ1正確度は76.2%に向上し、クリーニング済みデータのみで学習したモデルの63.3%を上回った。
  • WSLにより、活性化マップを用いて食品の概ねの局所化が可能になり、味噌汁とチョコレートケーキのように視覚的に類似したクラスの区別に役立った。
  • トップ5正確度は90.8%に達し、トップ1の予測が誤りであった場合でも、正解ラベルがしばしばトップ5内に含まれていた。これは、部分的遮断や複数の食品が共存する状況でも有効であったことを示している。
  • モデルはしばしば共存する食品(例:チキンとライス)を一緒に局所化したり、ターゲットでないもの(例:ソースをジョウザではなく注目)に注目するなど、標準的なWSLのマルチオブジェクト状況下での限界を示した。
  • 誤分類の主な原因は、トレーニングで見られなかったテストセットの分布シフト(例:日本料理)やクラス間の類似性(例:フライドポテトとフィッシュアンドチップス)であり、WSLによる局所化がそれらの問題を緩和した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。