Skip to main content
QUICK REVIEW

[論文レビュー] Long-Tailed Continual Learning For Visual Food Recognition

Jiangpeng He, Zhang, Xiaoyan|arXiv (Cornell University)|Jul 1, 2023
Nutritional Studies and Diet被引用数 7
ひとこと要約

本論文は、視覚的食品認識における長尾継続的学習のためのエンドツーエンドフレームワークを提案する。このフレームワークは、特徴ベースの知識蒸留と二重予測ヘッドを組み合わせて、深刻な忘却を軽減し、CAM-CutMixというデータ拡張技術を用いて希少な食品クラスの一般化性能を向上させる。本手法は、Food101-LT、VFN-LT、VFN-INSULIN、VFN-T2Dベンチマークで顕著な精度向上を達成し、長尾的で継続的な学習のシナリオにおいて、既存の手法を上回る性能を示した。

ABSTRACT

Deep learning-based food recognition has made significant progress in predicting food types from eating occasion images. However, two key challenges hinder real-world deployment: (1) continuously learning new food classes without forgetting previously learned ones, and (2) handling the long-tailed distribution of food images, where a few common classes and many more rare classes. To address these, food recognition methods should focus on long-tailed continual learning. In this work, We introduce a dataset that encompasses 186 American foods along with comprehensive annotations. We also introduce three new benchmark datasets, VFN186-LT, VFN186-INSULIN and VFN186-T2D, which reflect real-world food consumption for healthy populations, insulin takers and individuals with type 2 diabetes without taking insulin. We propose a novel end-to-end framework that improves the generalization ability for instance-rare food classes using a knowledge distillation-based predictor to avoid misalignment of representation during continual learning. Additionally, we introduce an augmentation technique by integrating class-activation-map (CAM) and CutMix to improve generalization on instance-rare food classes. Our method, evaluated on Food101-LT, VFN-LT, VFN186-LT, VFN186-INSULIN, and VFN186-T2DM, shows significant improvements over existing methods. An ablation study highlights further performance enhancements, demonstrating its potential for real-world food recognition applications.

研究の動機と目的

  • 長尾データ分布下における継続的食品認識の文脈で、深刻な忘却とクラス不均衡の二重の課題に取り組む。
  • 2型糖尿病患者およびインスリン使用者の実世界の食品摂取パターンを反映した現実的なベンチマークデータセットを構築する。
  • 以前に学習した食品クラスの知識を効果的に保持しながら、新しい希少な食品カテゴリに適応できるエンドツーエンドの学習フレームワークを設計する。
  • 革新的なデータ拡張および表現蒸留技術を用いて、インスタンス希少な食品クラスの一般化性能を向上させる。
  • 新たに導入されたVFN-INSULINおよびVFN-T2Dを含む、複数の長尾データセット上で評価を行い、フレームワークの頑健性と実世界への適用可能性を示す。

提案手法

  • 継続的学習中に特徴空間の不整合を軽減するため、現在の表現を過去のクラス空間に再投影する二重予測ヘッド機構を知識蒸留に導入する。
  • 学生モデルが現在および過去のクラス表現から学ぶ特徴ベースの知識蒸留を採用する学生-教師フレームワークを適用する。
  • 希少な食品クラスの特徴を強調し、特徴学習を向上させるために、クラス活性化マップ(CAM)とCutMixを組み合わせた新しいデータ拡張戦略を提案する。
  • 知識保持のためのエクジンプラ画像を格納するメモリバッファを活用し、バッファ容量のアブレーションスタディによりスケーラビリティとプライバシーのトレードオフを評価する。
  • ImageNet-1KおよびImageNet-21Kで事前学習されたバックボーン(例:ResNet、EfficientNet、ViT)を活用し、継続的学習の前段階で初期特徴表現を向上させる。
  • 新しいクラスのみでモデルを段階的に学習させ、蒸留およびエクジンプラベースの正則化により、以前に学習済みのクラスの性能を維持する。

実験結果

リサーチクエスチョン

  • RQ1視覚的食品認識における長尾継続的学習において、深刻な忘却をどのように効果的に軽減できるか?
  • RQ2CAMベースの注目とCutMixを統合することで、長尾分布下の希少な食品クラスの一般化性能はどの程度向上するか?
  • RQ3提案された二重予測ヘッド機構は、段階的学習フェーズ間での表現アライメントをどのように改善するか?
  • RQ4長尾継続的学習におけるメモリバッファサイズの性能への影響は何か?性能の飽和点はどこに位置するか?
  • RQ5大規模データセットからの事前学習によって得られるバックボーンは、長尾継続的食品認識の下流性能にどのような影響を与えるか?

主な発見

  • 提案手法は、Food101-LT、VFN-LT、VFN-INSULIN、VFN-T2Dベンチマークにおいて、既存手法と比較して平均精度で顕著な向上を達成した。
  • メモリバッファ容量の増加に伴い性能が一貫して向上するが、50枚を超えると増加が鈍り、クラス不均衡と忘却に起因する性能の限界に達することが示された。
  • ImageNet-1KおよびImageNet-21Kでの事前学習により、学習から再開した場合と比較して平均精度が20%以上向上した。これは強力な初期表現の重要性を示している。
  • CAM-CutMix拡張技術は、特に長尾設定下で、インスタンス希少な食品クラスの一般化性能を顕著に向上させた。
  • アブレーションスタディにより、二重予測ヘッドおよびCAM-CutMix拡張の両方が必須の構成要素であることが確認され、それぞれが全体の性能向上に大きく寄与した。
  • 本フレームワークは、糖尿病患者およびインスリン依存型の個々の摂取パターンを含む多様な実世界の食品摂取パターンに対して、強い頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。