[논문 리뷰] Combining Weakly and Webly Supervised Learning for Classifying Food Images
이 논문은 최소한의 수동 코딩을 통해 식품 이미지 분류 성능을 향상시키기 위해 웹 기반의 감독 학습과 약한 감독 학습(WSL)을 융합한 하이브리드 접근법을 제안한다. 소량의 수동으로 코딩된 데이터를 대규모 노이즈가 많은 웹 데이터에 단계적으로 통합하고, WSL을 적용하여 분류에 기여하는 영역을 국소화함으로써, 모델은 상위 1위 정확도 76.2%를 달성하였으며, 이는 수동 코딩 전용 데이터로 학습한 모델(63.3%)이나 웹 전용 데이터로 학습한 모델(50.3%)보다 유의하게 뛰어나다.
Food classification from images is a fine-grained classification problem. Manual curation of food images is cost, time and scalability prohibitive. On the other hand, web data is available freely but contains noise. In this paper, we address the problem of classifying food images with minimal data curation. We also tackle a key problems with food images from the web where they often have multiple cooccuring food types but are weakly labeled with a single label. We first demonstrate that by sequentially adding a few manually curated samples to a larger uncurated dataset from two web sources, the top-1 classification accuracy increases from 50.3% to 72.8%. To tackle the issue of weak labels, we augment the deep model with Weakly Supervised learning (WSL) that results in an increase in performance to 76.2%. Finally, we show some qualitative results to provide insights into the performance improvements using the proposed ideas.
연구 동기 및 목표
- 정밀 분류를 위한 수동 코딩된 식품 이미지 데이터셋의 높은 비용과 확장성 한계를 해결하기 위해.
- 식품 이미지 분류에서 노이즈가 많고 다수의 식품이 혼합되어 있으며, 약한 레이블이 부여된 웹 데이터의 과제를 해결하기 위해.
- 제한된 수의 수동 코딩된 데이터를 대규모 코딩되지 않은 웹 데이터와 융합하여 분류 정확도를 향상시키기 위해.
- 약한 감독 학습(WSL)을 활용해 분류에 기여하는 영역을 국소화하고, 외관상 유사한 식품 클래스 간의 혼동을 줄이기 위해.
- 수동 코딩 데이터의 양이 증가함에 따라 성능 향상이 선형적으로 이루어지고, WSL이 일반화 및 국소화 정확도를 향상시킨다는 것을 입증하기 위해.
제안 방법
- 검색 엔진(예: Google Images)을 통해 코딩되지 않은 웹 데이터를 수집하여 대규모이고 노이즈가 많은 훈련 세트를 구성한다.
- 웹 데이터에 소량의 수동 코딩된 이미지를 단계적으로 통합하여 모델 성능을 점진적으로 향상시킨다.
- 이미지 수준의 레이블만을 사용하여 딥 네트워크에 약한 감독 학습(WSL)을 적용하여 활성화 맵 생성을 가능하게 한다.
- WSL에서 유도된 클래스 활성화 맵(CAMs)을 활용해 다수의 식품이 동시에 존재하는 이미지에서도 분류에 기여하는 영역을 식별하고 집중한다.
- 수동 코딩 데이터와 웹 데이터를 융합한 데이터셋을 기반으로 WSL 감독 하에 딥 러닝 모델을 엔드 투 엔드로 훈련시켜 일반화 능력을 향상시키고, 분류 간 간섭 효과를 줄인다.
- UEC256 테스트 세트에서 상위 1위 및 상위 5위 정확도를 측정하고, 국소화 맵 분석을 통해 정성적 인사이트를 도출한다.
실험 결과
연구 질문
- RQ1소량의 수동 코딩된 데이터를 대규모 웹 데이터와 융합함으로써, 각각의 데이터 원천을 별도로 사용하는 것보다 식품 이미지 분류 정확도를 향상시킬 수 있는가?
- RQ2노이즈가 많고 다수의 식품이 혼합되어 있으며, 약한 레이블이 부여된 웹 데이터에서 학습할 때, 약한 감독 학습(WSL)이 모델 성능을 어떻게 향상시키는가?
- RQ3특히 시각적으로 유사한 클래스 간의 혼동이 발생할 경우, WSL이 분류에 기여하는 식품 영역의 국소화 능력을 얼마나 향상시키는가?
- RQ4훈련 세트와 테스트 세트 간의 데이터 분포 이질성(예: 다른 요리 문화)이 모델의 일반화 능력과 잘못된 분류 비율에 어떤 영향을 미치는가?
- RQ5다중 객체 상황에서 WSL의 실패 모드는 무엇이며, 이는 상위 1위 예측 성능과 상위 5위 예측 성능에 어떤 영향을 미치는가?
주요 결과
- 단지 웹 데이터만을 사용할 경우 상위 1위 정확도가 50.3%였지만, 소량의 수동 코딩 데이터를 추가함으로써 72.8%로 상승하여 코딩에 따른 성능 향상이 선형적임을 입증하였다.
- 추가로 약한 감독 학습(WSL)을 통합함으로써 상위 1위 정확도는 76.2%로 향상되었으며, 이는 수동 코딩 전용 데이터로 학습한 모델의 63.3%보다 뛰어나다.
- WSL을 통해 활성화 맵을 활용해 식품 항목의 근사적인 국소화가 가능해졌으며, 미소 수프와 초콜릿 케이크처럼 외관상 유사한 클래스 간의 혼동을 해소하는 데 기여했다.
- 상위 5위 정확도는 90.8%에 도달하여, 상위 1위 예측이 잘못되었더라도 정답 레이블이 상위 5위 예측에 포함되는 경우가 많았으며, 특히 부분적으로 가려진 경우나 다수의 식품이 함께 존재하는 경우에 유용하였다.
- 모델은 종종 함께 존재하는 식품 항목들(예: 닭고기와 밥)을 함께 국소화하거나, 목표가 아닌 항목들(예: 소스는 고구마 만두가 아니라)에 집중하는 경향이 있었으며, 이는 표준 WSL이 다중 객체 상황에서의 한계를 드러냈다.
- 오류 분류의 주요 원인은 데이터 분포의 이질성(예: 훈련 데이터에 없던 일본 요리가 테스트 세트에 존재함)이나 클래스 간 유사성(예: French fries와 fish and chips)이었으며, WSL을 통해 국소화 기능을 활용함으로써 이러한 문제를 완화시킬 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.