Skip to main content
QUICK REVIEW

[논문 리뷰] Feature-Suppressed Contrast for Self-Supervised Food Pre-training

Xinda Liu, Yaohui Zhu|arXiv (Cornell University)|2023. 08. 07.
Advanced Chemical Sensor TechnologiesEngineering인용 수 3
한 줄 요약

이 논문은 음식 이미지의 증강된 뷰 간 상호정보를 감소시키기 위해 한 뷰에서 선명하고 높은 반응을 보이는 특징을 반응 인식 기반 비지도 방식으로 억제함으로써 상호정보를 감소시키는 자기지도 학습 방법인 Feature-Suppressed Contrast (FeaSC)를 제안한다. 이 방법은 네 개의 음식 데이터셋에서 BYOL과 SimSiam보다 분류 정확도를 1.70%에서 6.69% 향상시키며, 후행 분류 작업에서 최신 기술 수준의 성능을 달성하여 일부 벤치마크에서 지도 학습 기반 모델을 능가한다.

ABSTRACT

Most previous approaches for analyzing food images have relied on extensively annotated datasets, resulting in significant human labeling expenses due to the varied and intricate nature of such images. Inspired by the effectiveness of contrastive self-supervised methods in utilizing unlabelled data, we explore leveraging these techniques on unlabelled food images. In contrastive self-supervised methods, two views are randomly generated from an image by data augmentations. However, regarding food images, the two views tend to contain similar informative contents, causing large mutual information, which impedes the efficacy of contrastive self-supervised learning. To address this problem, we propose Feature Suppressed Contrast (FeaSC) to reduce mutual information between views. As the similar contents of the two views are salient or highly responsive in the feature map, the proposed FeaSC uses a response-aware scheme to localize salient features in an unsupervised manner. By suppressing some salient features in one view while leaving another contrast view unchanged, the mutual information between the two views is reduced, thereby enhancing the effectiveness of contrast learning for self-supervised food pre-training. As a plug-and-play module, the proposed method consistently improves BYOL and SimSiam by 1.70\% $\sim$ 6.69\% classification accuracy on four publicly available food recognition datasets. Superior results have also been achieved on downstream segmentation tasks, demonstrating the effectiveness of the proposed method.

연구 동기 및 목표

  • 음식 이미지에 대한 대비 자기지도 학습에서 증강된 뷰 간 높은 상호정보 문제를 해결하기 위해.
  • 예를 들어 그리스 salat와 같은 요리에서 쌓인 시각적으로 유사한 재료들(🥒양상추, 치즈 등)으로 인해 발생하는 뷰 간 부족한 유사성 문제를 줄이기 위해.
  • 대규모 레이블링된 데이터셋에 의존하지 않고 음식 이미지에 대한 자기지도 사전 훈련을 향상시키기 위해.
  • 기존의 대비 자기지도 학습 방법들인 BYOL과 SimSiam에 쉽게 통합할 수 있는 플러그 앤 플레이 모듈을 개발하기 위해.
  • 레이블이 없는 음식 데이터를 사용하여 분류 및 의미 분할 후행 작업 모두에서 효과를 입증하기 위해.

제안 방법

  • FeaSC는 지도 학습 없이 특징 맵에서 선명하고 높은 반응을 보이는 특징을 식별하기 위한 반응 인식 기반 국소화 방식을 도입한다.
  • 선택된 선명한 특징을 한 증강 뷰에서 억제하면서 다른 뷰는 그대로 유지함으로써 뷰 간 상호정보를 감소시킨다.
  • 특징 반응 맵을 기반으로 학습 가능한 마스크를 생성하여 억제를 수행하며, 대비 손실과 억제 손실 간 균형을 맞추기 위해 하이퍼파rameter λ를 사용한다.
  • 기존의 대비 자기지도 학습 프레임워크인 BYOL과 SimSiam와 호환되는 플러그인 모듈로 설계되어 있다.
  • 표준 대비 손실과 억제 인식 대비 항목을 조합한 수정된 대비 목적함수를 사용하여 특징의 불변성을 향상시킨다.
  • 계산 비용이 효율적이며, 기준 방법 대비 추가 파rameter는 극히 적고, MACs는 오직 0.18%만 증가한다.

실험 결과

연구 질문

  • RQ1증강된 뷰 간 상호정보를 줄이면 음식 이미지에 대한 자기지도 표현 학습이 향상되는가?
  • RQ2비지도 방식으로 뷰 간 공유되는 선명한 특징를 식별하고 억제할 수 있는가? 이를 통해 대비 학습이 향상되는가?
  • RQ3한 뷰에서 유사한 정보성 콘텐츠를 억제하면 음식 인식 및 분할 작업의 후행 성능이 향상되는가?
  • RQ4억제 강도를 제어하는 하이퍼파rameter λ가 모델 일반화 및 성능에 어떤 영향을 미치는가?
  • RQ5BYOL과 SimSiam와 같은 기존 자기지도 학습 프레임워크에 아키텍처 변경 없이 FeaSC를 효과적으로 통합할 수 있는가?

주요 결과

  • DeeplabV3와 결합했을 때, FeaSC는 FoodSeg103 데이터셋에서 BYOL의 평균 정확도(aAcc)를 3.59% 향상시켰고, mIoU는 1.05% 향상되었으며, mACC는 1.72% 향상되었다.
  • UEC-FoodPix Complete에서 FeaSC는 aAcc를 4.77% 향상시키고, mIoU는 3.31% 향상되었으며, mACC는 5.93% 향상되었다.
  • FCN를 사용했을 때, SimSiam+FeaSC는 FoodSeg103에서 원본 SimSiam 대비 aAcc 4.22% 향상, mIoU 1.16% 향상, mACC 2.06% 향상되었다.
  • UEC-FoodPix Complete에서 FCN를 사용했을 때, SimSiam+FeaSC는 aAcc 1.47% 향상, mIoU 0.92% 향상, mACC 1.92% 향상되었다.
  • DeeplabV3로 미세조정했을 때, SimSiam+FeaSC는 FoodSeg103에서 mAcc를 0.88% 향상시켜 47.32%에서 48.20%로 상승했고, UEC-FoodPix Complete에서는 3.33% 향상(80.37%에서 83.70%)하여 지도 학습 기반 모델을 능가했다.
  • 제거 실험 결과, 반응 인식 억제(RS)가 가장 높은 성능을 보였으며, Food101에서 81.36%의 정확도를 기록하여 무작위 및 저반응 억제 전략을 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.