[论文解读] FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
FoodLMM 是一个基于大规模多模态模型构建的统一、多功能食品助手,集成了食物识别、成分检测、食谱生成、营养估算以及具备分割能力的多轮对话。通过引入针对分割和营养预测的任务特定标记与头结构,并采用基于专用数据集的两阶段训练策略,FoodLMM 在多个食品基准测试中达到最先进性能,包括在 Food-101 上实现 93.93% 的 top-1 准确率,以及在成分识别 F1 指标上比先前方法高出 4.96%。
Large Multi-modal Models (LMMs) have made impressive progress in many vision-language tasks. Nevertheless, the performance of general LMMs in specific domains is still far from satisfactory. This paper proposes FoodLMM, a versatile food assistant based on LMMs with various capabilities, including food recognition, ingredient recognition, recipe generation, nutrition estimation, food segmentation and multi-round conversation. To facilitate FoodLMM to deal with tasks beyond pure text output, we introduce a series of novel task-specific tokens and heads, enabling the model to predict food nutritional values and multiple segmentation masks. We adopt a two-stage training strategy. In the first stage, we utilize multiple public food benchmarks for multi-task learning by leveraging the instruct-following paradigm. In the second stage, we construct a multi-round conversation dataset and a reasoning segmentation dataset to fine-tune the model, enabling it to conduct professional dialogues and generate segmentation masks based on complex reasoning in the food domain. Our fine-tuned FoodLMM achieves state-of-the-art results across several food benchmarks. We will make our code, models and datasets publicly available.
研究动机与目标
- 为解决通用大规模多模态模型在食品领域中常出现幻觉或无法提供精确营养或分割输出的局限性。
- 将多种食品相关任务——如分类、成分识别、食谱生成、营养估算和分割——统一到一个多功能模型中。
- 通过在自定义数据集上进行微调,实现复杂多轮对话和基于推理的分割能力。
- 开发一种能够准确处理具有挑战性的指代分割案例(包括一对一、一对多及一无对应查询)的模型。
- 通过发布代码、模型和数据集,建立多模态食品理解的基准。
提出的方法
- FoodLMM 在 LLaVA 的基础上引入了来自 SAM 的分割头,并为分割和营养预测任务设计了特定任务的标记与头结构。
- 该模型采用两阶段训练流程:第一阶段在公开食品基准数据集上使用指令跟随提示进行多任务学习;第二阶段在自定义数据集上进行微调,以支持对话和推理任务。
- 为每项任务设计了专用的指令模板,使模型能够生成分类、识别和食谱生成等文本输出。
- 在分割任务中,将多个特殊标记嵌入词汇表中,其隐藏状态被解码为一个或多个分割掩码。
- 营养估算通过将专用营养标记的隐藏状态输入回归头,以预测精确的宏量和微量营养素数值。
- 微调所用数据集——FoodDialogues(多轮营养对话)和 FoodReasonSeg(复杂推理分割)——均使用 GPT-4 构建,以确保高质量、上下文感知的交互。
实验结果
研究问题
- RQ1一个统一的大规模多模态模型是否能在包括分割和营养估算在内的多样化食品相关任务中实现最先进性能?
- RQ2如何有效设计任务特定标记与头结构,以支持分割掩码和数值营养预测等多模态输出?
- RQ3在多轮对话和推理数据集上进行微调,在多大程度上提升了模型处理复杂、上下文依赖查询的能力?
- RQ4数据不平衡(特别是针对一无对应指代查询)对模型性能和泛化能力有何影响?
- RQ5单一模型是否能在不牺牲准确性或鲁棒性的前提下,在多个食品基准上超越专用任务模型?
主要发现
- FoodLMM 在 Food-101 基准上达到 93.93% 的 top-1 准确率,优于先前方法。
- 在成分识别任务中,FoodLMM 的 F1 得分比先前最先进方法 CACLNet 高出 4.96%。
- 在食谱生成任务中,FoodLMM 的 SacreBLEU 和 Rouge-L 分别达到 6.24 和 39.96,较先前最佳方法 FIRE 分别提升 3.65% 和 21.46%。
- 模型在指代分割任务中表现优异,在 2% 非存在指代查询比例下,对一无对应查询的准确率达到 73.07%。
- 消融实验表明,在训练过程中增加非存在指代查询的比例(至 20%)会严重损害对一对一和一对多查询的性能,准确率从 99.16% 下降至 28.57%。
- 模型在不同数据集上保持较高的 cIoU 分数(0.78–0.90),表明其掩码质量稳健,即使在数据不平衡导致响应准确率下降时亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。