[논문 리뷰] FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
FoodLMM는 음식 인식, 성분 탐지, 조리법 생성, 영양소 추정, 다중 라운드 대화 및 분할 기능을 통합한 대규모 다중모달 모델 기반의 통합적이고 유연한 음식 보조자입니다. 분할 및 영양소 예측을 위한 작업별 특화 토큰과 헤드를 도입하고, 전용 데이터셋을 사용한 이단계 학습 전략을 통해 FoodLMM는 여러 음식 기준 평가에서 최신 기술 수준의 성능을 달성하였으며, Food-101에서 93.93%의 상위-1 정확도와 이전 방법보다 4.96% 높은 성분 탐지 F1 점수를 기록했습니다.
Large Multi-modal Models (LMMs) have made impressive progress in many vision-language tasks. Nevertheless, the performance of general LMMs in specific domains is still far from satisfactory. This paper proposes FoodLMM, a versatile food assistant based on LMMs with various capabilities, including food recognition, ingredient recognition, recipe generation, nutrition estimation, food segmentation and multi-round conversation. To facilitate FoodLMM to deal with tasks beyond pure text output, we introduce a series of novel task-specific tokens and heads, enabling the model to predict food nutritional values and multiple segmentation masks. We adopt a two-stage training strategy. In the first stage, we utilize multiple public food benchmarks for multi-task learning by leveraging the instruct-following paradigm. In the second stage, we construct a multi-round conversation dataset and a reasoning segmentation dataset to fine-tune the model, enabling it to conduct professional dialogues and generate segmentation masks based on complex reasoning in the food domain. Our fine-tuned FoodLMM achieves state-of-the-art results across several food benchmarks. We will make our code, models and datasets publicly available.
연구 동기 및 목표
- 일반적인 대규모 다중모달 모델이 음식 분야에서 환상을 일으키거나 정확한 영양소 또는 분할 출력을 제공하지 못하는 등의 한계를 해결하기 위해.
- 분류, 성분 탐지, 조리법 생성, 영양소 추정, 분할과 같은 다양한 음식 관련 작업을 하나의 통합적이고 다재다능한 모델로 통합하기 위해.
- 사용자 정의 데이터셋을 기반으로 한 최적화를 통해 복잡한 다중 라운드 대화 및 추론 기반 분할을 가능하게 하기 위해.
- 특히 하나의 참조에서 존재하지 않는 대상이나 하나의 참조에서 여러 개의 대상으로의 참조와 같은 어려운 참조 분할 케이스를 정확하게 처리할 수 있도록 하기 위해.
- 코드, 모델, 데이터셋을 공개함으로써 다중모달 음식 이해 분야의 기준을 설정하기 위해.
제안 방법
- FoodLMM는 LLaVA를 기반으로 하여 SAM의 분할 헤드를 통합하고, 분할 및 영양소 예측을 위한 작업별 특화 토큰을 도입합니다.
- 모델는 이단계 학습 프로세스를 사용합니다: 첫 번째 단계에서는 지시 수행 프롬프트를 사용한 공개 음식 기준 평가 데이터셋에서 다중 작업 학습을 수행하고, 두 번째 단계에서는 대화 및 추론을 위한 사용자 정의 데이터셋에서 최적화를 수행합니다.
- 각 작업을 위해 특화된 지시 템플릿을 설계하여, 분류, 탐지, 조리법 생성 등의 텍스트 출력을 생성할 수 있도록 합니다.
- 분할 작업의 경우, 여러 특수 토큰을 어휘에 통합하고, 이들의 은닉 상태를 한 개 이상의 분할 마스크로 디코딩합니다.
- 영양소 추정은 전용 영양소 토큰의 은닉 상태를 회귀 헤드를 통해 처리하여 정확한 탄질 및 비타민 성분 값을 예측합니다.
- 최적화를 위한 데이터셋으로는 다중 라운드 영양소 대화를 담은 FoodDialogues와 복잡한 추론 기반 분할 작업을 위한 FoodReasonSeg가 있으며, 이는 GPT-4를 활용해 고품질의 맥락 인식 상호작용을 보장하기 위해 구성되었습니다.
실험 결과
연구 질문
- RQ1통합된 대규모 다중모달 모델이 분할 및 영양소 추정을 포함한 다양한 음식 관련 작업에서 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ2분할 마스크 및 수치적 영양소 예측과 같은 다중모달 출력을 가능하게 하기 위해 작업별 특화 토큰과 헤드를 어떻게 효과적으로 설계할 수 있는가?
- RQ3다중 라운드 대화 및 추론 데이터셋에서의 최적화가 모델이 복잡하고 맥락에 의존하는 질의를 처리하는 능력을 얼마나 향상시키는가?
- RQ4특히 하나의 참조에서 존재하지 않는 참조 쿼리(예: one-to-zero)의 데이터 불균형이 모델 성능과 일반화 능력에 어떤 영향을 미치는가?
- RQ5정확도나 강건성 손실 없이 하나의 모델이 여러 음식 기준 평가에서 전용 작업 모델을 능가할 수 있는가?
주요 결과
- FoodLMM는 Food-101 기준 평가에서 상위-1 정확도 93.93%를 기록하여 이전 방법들을 능가했습니다.
- 성분 탐지에서 FoodLMM는 이전 최신 기술 수준 방법인 CACLNet보다 F1 점수에서 4.96% 높은 성능을 보였습니다.
- 조리법 생성에서 FoodLMM는 SacreBLEU 점수 6.24와 Rouge-L 점수 39.96을 기록하였으며, 이는 이전 최고 성능 방법인 FIRE보다 각각 3.65% 및 21.46% 향상된 결과입니다.
- 참조 기반 분할에서 모델는 존재하지 않는 참조 쿼리 비율이 2%일 때 73.07%의 정확도를 기록하여 강력한 성능을 보였습니다.
- 제거 실험 결과, 훈련 중 존재하지 않는 참조 쿼리 비율을 20%로 증가시키면, 하나의 참조에서 하나의 대상으로의 참조(query)와 하나의 참조에서 여러 개의 대상으로의 참조 쿼리에서 정확도가 상당히 떨어져 99.16%에서 28.57%로 감소하는 것으로 나타났습니다.
- 모델는 데이터 불균형 상황에서도 cIoU 점수(0.78–0.90)를 유지하여 마스크 품질이 뛰어나며, 응답 정확도가 떨어지는 상황에서도 강건성을 유지함을 보여주었습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.