Skip to main content
QUICK REVIEW

[논문 리뷰] Recipe1M+: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images

Javier Marín, Aritro Biswas|arXiv (Cornell University)|2018. 10. 14.
Nutritional Studies and Diet인용 수 14
한 줄 요약

Recipe1M+는 100만 개 이상의 요리 레시피와 1300만 개의 음식 이미지를 포함하는 대규모 구조화된 데이터셋을 제공하여, 요리 레시피와 이미지 간의 공동 다중모달 임베딩을 학습할 수 있는 딥 네ural 네트워크의 훈련을 가능하게 한다. 고수준 분류 목표를 통한 의미론적 정규화를 통해 모델은 이미지-레시피 검색에서 인간 수준의 성능을 달성하고, 예를 들어 '타코'에서 '레모니'를 대체하여 '양상추 랩'을 생성하는 개념 치환을 포함한 의미론적 벡터 산술을 가능하게 한다.

ABSTRACT

In this paper, we introduce Recipe1M+, a new large-scale, structured corpus of over one million cooking recipes and 13 million food images. As the largest publicly available collection of recipe data, Recipe1M+ affords the ability to train high-capacity modelson aligned, multimodal data. Using these data, we train a neural network to learn a joint embedding of recipes and images that yields impressive results on an image-recipe retrieval task. Moreover, we demonstrate that regularization via the addition of a high-level classification objective both improves retrieval performance to rival that of humans and enables semantic vector arithmetic. We postulate that these embeddings will provide a basis for further exploration of the Recipe1M+ dataset and food and cooking in general. Code, data and models are publicly available.

연구 동기 및 목표

  • 요리 레시피와 음식 이미지의 공동 표현을 학습하기 위한 대규모 다중모달 데이터셋의 부족을 해결하기 위해.
  • 개선된 다중모달 이해를 위해 정렬되고 구조화된 레시피 및 이미지 데이터를 기반으로 고용량 모델 훈련을 가능하게 하기 위해.
  • 고급 작업(예: 의미론적 산술 및 검색)을 지원할 수 있는 의미론적으로 정규화된 임베딩을 학습하는 신경망 모델을 개발하기 위해.
  • 고수준 분류를 통한 정규화가 임베딩 공간 내의 검색 정확도와 의미론적 조합 가능성 향상에 기여함을 입증하기 위해.
  • 음식 이해, 레시피 생성 및 다중모달 학습 분야의 연구를 촉진하기 위해 코드, 데이터, 모델을 포함한 공개 자원을 제공하기 위해.

제안 방법

  • 저자들은 온라인 자료에서 수집한 100만 개의 레시피와 1300만 개의 음식 이미지를 포함하는 Recipe1M+ 데이터셋을 구축하였으며, 재료, 조리법, 이미지 메타데이터에 대한 구조화된 주석을 제공한다.
  • 대비 학습 목표를 사용하여 요리 레시피(텍스트)와 이미지를 공유된 의미론적 공간에 함께 임베딩하는 다중모달 신경망을 훈련한다.
  • 임베딩 공간의 정규화를 위해 고수준 분류 헤드를 모델에 추가하여 의미론적 정렬과 일반화 능력을 향상시킨다.
  • 다중모달 정렬을 위한 대비 손실과 고수준 음식 카테고리 예측을 위한 교차 엔트로피 손실을 조합하여 모델을 미세조정한다.
  • 의미론적 벡터 산술은 임베딩 공간 내의 벡터 표현을 조작하여 수행되며, 예를 들어 '타코' - '타코피' + '양상추' → '양상추 랩'과 같은 유추적 추론이 포함된다.
  • 분수 산술은 두 개념 벡터 간의 보간을 통해 적용되며(예: '부리토' × x + '샌드위치' × (1−x)), 요리 및 이미지 공간 내의 연속적 전이를 탐색한다.

실험 결과

연구 질문

  • RQ1요리 레시피와 이미지의 대규모 다중모달 데이터셋은 이미지-레시피 검색에서 인간 수준의 성능을 달성하는 딥 모델의 훈련을 가능하게 하는가?
  • RQ2학습 목표에 고수준 분류 목표를 추가하면 다중모달 임베딩의 의미론적 품질과 일반화 능력이 향상되는가?
  • RQ3학습된 임베딩은 예를 들어 개념 간의 유추적 추론과 음식 개념 간의 보간을 포함한 의미론적 벡터 산술을 의미적으로 의미 있게 지원하는가?
  • RQ4Recipe1M+의 규모와 구조는 데이터 품질과 모델 성능 측면에서 이전 데이터셋과 비교해 어떻게 다를까?
  • RQ5학습된 임베딩은 요리 수정이나 다중모달 생성과 같은 새로운 응용 분야를 얼마나 잘 지원하는가?

주요 결과

  • Recipe1M+에서 훈련된 모델은 아마존 메카니컬 터크(AMT) 평가를 통해 이미지-레시피 검색 작업에서 인간 수준의 성능을 달성한다.
  • 고수준 분류 목표의 추가로 검색 정확도가 크게 향상되었으며, '타코'에서 '타코피'를 제거하고 '양상추'를 추가하여 '양상추 랩'을 생성하는 것과 같은 더 의미론적으로 유의미한 벡터 산술이 가능해졌다.
  • Recipe1M+에서 훈련된 모델은 분수 산술 계수에 대해 명확하고 해석 가능한 결과를 생성하는 반면, 기준 모델은 계수 간에 변동이 거의 없었다.
  • 모델은 이미지 및 레시피 임베딩 공간에서 'curry'와 'soup'과 같은 음식 개념 간에 성공적으로 보간을 수행하여, 시각적이고 의미론적으로 일관된 전이를 생성했다.
  • 확장된 데이터셋(Recipe1M+)은 원본 Recipe1M 대비 노이즈 증가가 최소이며, Food-101 벤치마크에서 성능 향상을 보여, 강력한 일반화 능력을 입증했다.
  • 학습된 임베딩은 벡터 연산을 통한 새로운 요리 개념 생성과 같은 조합적 추론을 지원하며, 이는 요리 수정 및 다중모달 생성에 잠재적 응용 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.