[논문 리뷰] Learning Structural Representations for Recipe Generation and Food Retrieval
이 논문은 긴 요리 레시피의 문장 수준 트리 구조를 비지도 학습 방식으로 학습하는 방법을 제안하며, 레시피 생성 및 음식 다중모달 검색 성능을 향상시킨다. ON-LSTM를 Quick Thoughts와 결합하여 비지도 트리 구조 레이블링을 확장하고, 그래프 자기주도 신경망(GAT)을 활용해 이러한 구조를 인코딩함으로써, Recipe1M 벤치마크에서 일관성과 성능이 향상되어 두 과제에서 최신 기준 성능을 달성한다.
Food is significant to human daily life. In this paper, we are interested in learning structural representations for lengthy recipes, that can benefit the recipe generation and food cross-modal retrieval tasks. Different from the common vision-language data, here the food images contain mixed ingredients and target recipes are lengthy paragraphs, where we do not have annotations on structure information. To address the above limitations, we propose a novel method to unsupervisedly learn the sentence-level tree structures for the cooking recipes. Our approach brings together several novel ideas in a systematic framework: (1) exploiting an unsupervised learning approach to obtain the sentence-level tree structure labels before training; (2) generating trees of target recipes from images with the supervision of tree structure labels learned from (1); and (3) integrating the learned tree structures into the recipe generation and food cross-modal retrieval procedure. Our proposed model can produce good-quality sentence-level tree structures and coherent recipes. We achieve the state-of-the-art recipe generation and food cross-modal retrieval performance on the benchmark Recipe1M dataset.
연구 동기 및 목표
- 요리 이미지-텍스트 데이터셋에서 구조적 레이블링이 부족한 문제를 해결하기 위해, 레시피가 긴 단락으로 구성되어 있고 재료가 혼합되어 있어 전통적인 시각-언어 기반 방법의 성능이 떨어지는 상황을 고려한다.
- 수동적인 구조적 레이블링이 필요 없이, 레시피를 비지도 방식으로 문장 수준의 트리 구조를 학습한다.
- 텍스트 생성 과정에서 학습된 트리 구조를 구조적 가이드로 활용하여 레시피 생성 품질을 향상시킨다.
- 요리 이미지와 장문의 조리 지침 간의 매칭을 향상시키기 위해 트리 구조 표현을 레시피 특징에 융합하여 다중모달 검색 성능을 향상시킨다.
- 비지도 구조 학습이 레시피 생성 및 다중모달 검색 과제에서 성능 향상에 기여함을 입증한다.
제안 방법
- 비지도 방식으로 요리 텍스트에서 문장 수준의 트리 구조를 생성할 수 있는 새로운 recipe2tree 모듈을 제안하며, 확장된 ON-LSTM 아키텍처를 기반으로 한다.
- ON-LSTM의 변형을 사전 훈련하기 위해 Quick Thoughts 학습 목표를 사용하여, 감독 없이도 계층적인 문장 구조를 학습할 수 있도록 한다.
- 이미지에서 요리 트리 구조를 예측하는 img2tree 모듈을 활용하는 구조 인식 생성 네트워크(SGN)를 설계한다.
- 예측된 트리 구조를 문맥 임베딩으로 인코딩하기 위해 그래프 자기주도 신경망(GAT)을 활용하여 생성 및 검색 과정에서 활용한다.
- 트리 구조 임베딩을 레시피 생성 디코더에 통합하여 일관되고 장문의 레시피 생성을 유도한다.
- 원래 레시피 임베딩과 트리 구조 특징을 융합하여 다중모달 검색 성능을 향상시켜 이미지와 레시피 간의 매칭을 개선한다.
실험 결과
연구 질문
- RQ1비지도 문장 수준 트리 구조 학습이 생성된 레시피의 일관성과 품질을 향상시킬 수 있는가?
- RQ2레시피에서 유도된 구조적 표현이 음식 이미지와 장문의 조리 지침 간의 다중모달 검색 성능을 향상시킬 수 있는가?
- RQ3정답 구조적 레이블링이 전혀 없는 상황에서 제안된 비지도 트리 구조 학습 방법의 효과는 어떠한가?
- RQ4기본 모델 대비 트리 구조 임베딩이 생성 및 검색 성능 향상에 얼마나 기여하는가?
- RQ5모델은 다양한 요리 종류에 일반화되어 있으며, 이미지 입력으로부터 구조적으로 일관된 레시피를 생성할 수 있는가?
주요 결과
- 제안된 SGN 모델은 Recipe1M 벤치마크에서 자동 평가 및 인간 평가 지표 모두에서 기존 방법을 능가하는 최신 기준 성능을 달성하여 레시피 생성 과제에서 최신 기준 성능을 확보한다.
- 트리 구조 임베딩을 다중모달 검색에 통합함으로써 검색 정확도가 크게 향상되었으며, 상위 10개 검색 결과의 재현율과 mAP 점수가 이전 베이스라인을 초월한다.
- 정성적 분석 결과, 감독 없이도 생성된 레시피 트리 구조는 의미적으로 일관되며, 정답 트리와 유사한 구조적 특성을 보였다.
- 복잡한 요리인 치킨 웰링턴이나 포테이토 케이크와 같은 다양한 음식 이미지에 대해 관련 레시피를 성공적으로 검색하여 다중모달 정렬의 강력함을 입증했다.
- img2tree 모듈은 이미지 특징에서 다양한 그러나 타당한 트리 구조를 생성하여 더 길고 일관성 있는 레시피 생성을 유도했다.
- 비지도 트리 구조 학습 방식은 명시적인 구조적 레이블링 없이도 요리 과정의 순차성과 계층성을 효과적으로 포착하는 데 성공했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.