Skip to main content
QUICK REVIEW

[論文レビュー] Feature-Suppressed Contrast for Self-Supervised Food Pre-training

Xinda Liu, Yaohui Zhu|arXiv (Cornell University)|Aug 7, 2023
Advanced Chemical Sensor TechnologiesEngineering被引用数 3
ひとこと要約

本論文は、視覚的特徴が強い、高応答性を示す特徴を応答に敏感な非教師あり手法を用いて一方の視覚的変換ビューで抑制することで、食品画像の増幅ビュー間の相互情報量を低減する自己教師あり学習手法であるFeature-Suppressed Contrast (FeaSC) を提案する。この手法は、4つの食品データセットにおいてBYOLおよびSimSiamを1.70%から6.69%向上させ、下流のセグメンテーションタスクで最先端の性能を達成し、一部のベンチマークで教師ありベースラインを上回った。

ABSTRACT

Most previous approaches for analyzing food images have relied on extensively annotated datasets, resulting in significant human labeling expenses due to the varied and intricate nature of such images. Inspired by the effectiveness of contrastive self-supervised methods in utilizing unlabelled data, we explore leveraging these techniques on unlabelled food images. In contrastive self-supervised methods, two views are randomly generated from an image by data augmentations. However, regarding food images, the two views tend to contain similar informative contents, causing large mutual information, which impedes the efficacy of contrastive self-supervised learning. To address this problem, we propose Feature Suppressed Contrast (FeaSC) to reduce mutual information between views. As the similar contents of the two views are salient or highly responsive in the feature map, the proposed FeaSC uses a response-aware scheme to localize salient features in an unsupervised manner. By suppressing some salient features in one view while leaving another contrast view unchanged, the mutual information between the two views is reduced, thereby enhancing the effectiveness of contrast learning for self-supervised food pre-training. As a plug-and-play module, the proposed method consistently improves BYOL and SimSiam by 1.70\% $\sim$ 6.69\% classification accuracy on four publicly available food recognition datasets. Superior results have also been achieved on downstream segmentation tasks, demonstrating the effectiveness of the proposed method.

研究の動機と目的

  • 食品画像の対照的自己教師あり学習における増幅ビュー間の高い相互情報量という課題に対処すること。
  • ギリシャサラダのような料理に重ねて存在するきゅうりやチーズのように、視覚的に類似した材料が原因で生じるビュー間の冗長な類似性を低減すること。
  • 大規模なアノテート済みデータセットに依存せずに、食品画像の自己教師あり事前学習を向上させること。
  • BYOL や SimSiam といった既存の対照的自己教師あり手法を強化するための即挿しモジュールを構築すること。
  • ラベルなし食品データを用いて、分類およびセマンティックセグメンテーションの下流タスクの両方で有効性を実証すること。

提案手法

  • FeaSCは、教師なしで特徴マップ内の顕著で高応答性の特徴を特定する応答に敏感な局所化スキームを導入する。
  • 一方の増幅ビューにおける選択された顕著な特徴を抑制しながら、もう一方のビューは変更しないことで、ビュー間の相互情報量を低減する。
  • 特徴応答マップに基づいて学習可能なマスクを生成し、ハイパーパrameter λ を用いて対照的損失と抑制損失のバランスをとる。
  • 既存の対照的自己教師ありフレームワーク(BYOL や SimSiam など)と互換性を持つ、プラグインモジュールとして設計されている。
  • 標準的な対照的損失に加え、抑制に敏感な対照的項を組み合わせた変更された対照的目的関数を用いることで、特徴の不変性を向上させる。
  • 計算効率が良く、ベースライン手法と比較して追加パrameterがほとんどなく、MACの追加もわずか0.18%にとどまる。

実験結果

リサーチクエスチョン

  • RQ1増幅ビュー間の相互情報量を低減させることで、食品画像の自己教師あり表現学習が向上するか?
  • RQ2教師なしで、ビュー間で共有される顕著な特徴を特定し、抑制することは可能か? そのような抑制が対照的学習を向上させるか?
  • RQ3一方のビューで類似した有用なコンテンツを抑制することで、食品認識およびセグメンテーションタスクの下流性能が向上するか?
  • RQ4抑制強度を制御するハイパーパrameter λ がモデルの汎化性能および性能に与える影響は何か?
  • RQ5BYOL や SimSiam といった既存の自己教師ありフレームワークに、アーキテクチャの変更なしにFeaSCを効果的に統合できるか?

主な発見

  • DeeplabV3を組み合わせた場合、FoodSeg103データセットでBYOLが平均正答率(aAcc)で3.59%、mIoUで1.05%、mACCで1.72%向上した。
  • UEC-FoodPix Completeで、DeeplabV3を用いた場合、aAccが4.77%、mIoUが3.31%、mACCが5.93%向上した。
  • FCNを用いた場合、FoodSeg103でSimSiam+FeaSCは元のSimSiamに比べてaAccで4.22%、mIoUで1.16%、mACCで2.06%向上した。
  • UEC-FoodPix Completeで、FCNを用いた場合、SimSiam+FeaSCはaAccで1.47%、mIoUで0.92%、mACCで1.92%向上した。
  • DeeplabV3で微調整した場合、FoodSeg103ではmAccが47.32%から48.20%に上昇(+0.88%)、UEC-FoodPix Completeでは80.37%から83.70%に上昇(+3.33%)し、教師あり学習を上回った。
  • アブレーションスタディにより、応答に敏感な抑制(RS)が最良の性能を示し、Food101では81.36%の正答率を達成した。これは、ランダム抑制や低応答抑制戦略を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。