[논문 리뷰] FooDI-ML: a large multi-language dataset of food, drinks and groceries images and descriptions
이 논문은 37개 국가에서 온 33개 언어로 280만 장의 음식, 음료 및 식료품 이미지와 950만 개의 텍스트 설명을 포함하는 대규모 다국어 시각어휘 데이터셋인 FooDI-ML을 소개한다. 6년간의 Glovo 운영 데이터에서 수집된 이 데이터셋은 텍스트-이미지 검색 및 조건부 이미지 생성에 대한 벤치마킹을 가능하게 하며, CLIP는 검색 작업에서 R@10이 5.12를 기록하여 데이터셋 규모에도 불구하고 강력한 제로샷 일반화 능력을 입증한다.
In this paper we introduce the FooDI-ML dataset. This dataset contains over 1.5M unique images and over 9.5M store names, product names descriptions, and collection sections gathered from the Glovo application. The data made available corresponds to food, drinks and groceries products from 37 countries in Europe, the Middle East, Africa and Latin America. The dataset comprehends 33 languages, including 870K samples of languages of countries from Eastern Europe and Western Asia such as Ukrainian and Kazakh, which have been so far underrepresented in publicly available visio-linguistic datasets. The dataset also includes widely spoken languages such as Spanish and English. To assist further research, we include benchmarks over two tasks: text-image retrieval and conditional image generation.
연구 동기 및 목표
- 음식, 음료 및 식료품 분야에서 대규모 다국어 시각어휘 데이터셋의 부족을 해결하기 위해.
- 우리크라이나어 및 카자흐어와 같은 저소외 언어를 포함시켜 시각어휘 모델의 편향을 줄이기 위해.
- 37개 국가와 33개 언어를 커버하는 공개 가능하고 대규모의 데이터셋을 제공하여 음식 및 식료품 품목에 대한 풍부한 애너테이션을 제공하기 위해.
- 도메인 특화 맥락에서 텍스트-이미지 검색 및 조건부 이미지 생성과 같은 교차 모odal 작업의 벤치마킹을 가능하게 하기 위해.
- 다국어 검색 엔진 개발 및 음식 관련 응용 프로그램을 위한 개선된 이미지 임베딩 개발을 지원하기 위해.
제안 방법
- 데이터셋은 Glovo의 음식 및 식료품 배달 플랫폼에서 수집되었으며, 6년간의 운영 데이터를 포함한다.
- 280만 개의 고유 이미지와 950만 개의 자연어 설명(제품명, 매장명, 수령 섹션 포함)이 포함되어 있다.
- 재현 가능한 벤치마킹을 지원하기 위해 훈련/검증/테스트 분할을 설정하였다.
- 텍스트-이미지 검색은 R@N 지표를 사용하여 CLIP(제로샷)와 재구현된 WIT 모델 간의 성능을 비교하였다.
- 조건부 이미지 생성은 자기주도 어텐션 GAN을 사용하여 현실적인 피자 이미지를 생성하였으며, Inception 스코어는 3.58이었다.
- 최근 문장 인코딩 기술의 발전을 반영하기 위해, 기존의 bag-of-words 기반 대신 트랜스포머 기반 문장 인코더를 사용해 WIT 모델을 재구현하였다.
실험 결과
연구 질문
- RQ1대규모 다국어 음식 및 식료품 데이터셋에서 제로샷 및 미세조정된 시각어휘 모델의 성능은 어떠한가?
- RQ2대규모 데이터셋을 활용할 경우, 체르노빌리아어나 카자흐어와 같은 저소외 언어가 시각어휘 작업에서 효과적으로 활용될 수 있는가?
- RQ3특정 도메인 맥락에서 데이터셋 규모가 증가함에 따라 텍스트-이미지 검색 성능은 어떻게 변화하는가?
- RQ4조건부 이미지 생성 모델이 이 데이터셋을 사용해 현실적인 음식 이미지를 얼마나 잘 생성할 수 있는가?
- RQ5이 새로운 대규모 다국어 데이터셋에서 CLIP의 성능은 재구현된 WIT 모델보다 어떻게 비교되는가?
주요 결과
- CLIP는 텍스트-이미지 검색 작업에서 R@10 점수 5.12를 기록하여 재구현된 WIT 모델(동일 지표에서 4.97)을 크게 앞서며 성능을 뛰어넘었다.
- 재구현된 WIT 모델은 이미지-텍스트 검색 작업에서 R@10 점수 0.91을 기록하여 대규모 데이터셋에서 중간 수준의 성능을 보였다.
- CLIP의 제로샷 성능는 동일한 데이터셋에 대해 미세조정된 WIT 모델보다 뚜렷이 뛰어나, CLIP의 강력한 일반화 능력을 입증한다.
- 3.58의 Inception 스코어는 GAN 모델이 현실적이고 다양한 피자 이미지를 생성함을 나타내며, 조건부 생성에 효과적임을 검증한다.
- 저소외 언어인 우리크라이나어 및 카자흐어를 포함해 총 87만 개의 샘플을 포함하는 데이터셋의 다국어 커버리지는 더 포괄적인 모델 훈련을 가능하게 한다.
- 대규모 데이터셋임에도 불구하고 검색 작업은 여전히 도전적이다. 시각적 특징이 겹치는 경우 정확한 매칭이 상위 10개 이내에 랭크되지 않는 경우가 많았으며, 이는 시각적 특징의 중복성으로 인한 문제임을 정성적 분석에서 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.