[论文解读] VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models
本文提出VIALM,一项新颖的任务与基准,用于评估大型模型(LMs)在视障辅助中的表现,模型需根据图像和用户请求生成与环境相关的、分步的指导。尽管在某些方面表现良好,但SOTA LMs如GPT-4仍存在显著局限——仅有25.7%的回复与环境相关,32.1%缺乏细节,凸显了提升多模态对齐与触觉整合的迫切需求。
Visually Impaired Assistance (VIA) aims to automatically help the visually impaired (VI) handle daily activities. The advancement of VIA primarily depends on developments in Computer Vision (CV) and Natural Language Processing (NLP), both of which exhibit cutting-edge paradigms with large models (LMs). Furthermore, LMs have shown exceptional multimodal abilities to tackle challenging physically-grounded tasks such as embodied robots. To investigate the potential and limitations of state-of-the-art (SOTA) LMs' capabilities in VIA applications, we present an extensive study for the task of VIA with LMs (VIALM). In this task, given an image illustrating the physical environments and a linguistic request from a VI user, VIALM aims to output step-by-step guidance to assist the VI user in fulfilling the request grounded in the environment. The study consists of a survey reviewing recent LM research and benchmark experiments examining selected LMs' capabilities in VIA. The results indicate that while LMs can potentially benefit VIA, their output cannot be well environment-grounded (i.e., 25.7% GPT-4's responses) and lacks fine-grained guidance (i.e., 32.1% GPT-4's responses).
研究动机与目标
- 探究当前最先进(SOTA)大型模型(LMs)在辅助视障(VI)用户完成日常任务方面的潜力与局限。
- 通过聚焦LMs填补视障辅助研究中的空白,这些模型此前尚未系统评估于该应用场景。
- 开发一个基准,用于零样本评估LMs生成与环境相关、细节丰富且具备触觉意识的指导能力。
- 识别当前LMs的核心缺陷,如环境对齐能力差以及缺乏详细、可操作的步骤。
提出的方法
- 提出新任务VIALM,给定物理环境图像及视障用户自然语言请求,模型生成分步、与环境相关的指导。
- 构建一个基准数据集,包含200张来自超市与家庭环境的图像,每张图像均配有一条用户请求与参考答案(指导)。
- 在零样本设置下,评估六种SOTA视觉-语言模型(VLMs)与一种大型语言模型(LLM):GPT-4、CogVLM、Qwen-VL、LLaVA、MiniGPT-v2与BLIVE。
- 设计人机协同评估协议,采用三项关键指标:正确性(对齐性)、可操作性(细节丰富度)与清晰度。
- 通过将真实答案拆分为“对齐”与“细节丰富”两部分,进行自动评估,以隔离模型在各维度上的表现。
- 将触觉指导作为关键组成部分,明确提示模型在回复中包含触觉线索,以适应视障用户需求。
实验结果
研究问题
- RQ1当前SOTA LMs在为视障用户生成与环境相关的指导方面,能力达到何种程度?
- RQ2LMs在生成细节丰富、可操作的指令方面表现如何,这些指令是否易于在真实物理环境中执行?
- RQ3哪些模型组件(如视觉编码器、语言解码器)在VIA任务中对对齐或细节丰富度贡献最大?
- RQ4在视觉或语言能力上表现优异的LMs,能否在另一模态能力不足时进行补偿,以应对VIA任务?
主要发现
- GPT-4作为评估中最强模型,仍仅有25.7%的回复实现与环境的正确对齐,表明其在对齐能力上存在重大缺陷。
- GPT-4的32.1%回复缺乏细节丰富度,表明其在真实任务中提供的指导信息不足,难以直接操作。
- 仅GPT-4提供了通用的触觉指导,其余五款模型即使在明确提示下也未能包含触觉线索。
- CogVLM在环境对齐方面表现最佳(家庭图像上RG_L为0.158),可能得益于其先进的视觉编码器与视觉专家模块。
- LLaVA在细节丰富度方面得分最高(家庭图像上行动性为0.202),归因于其强大的LLaMA-2语言模型组件。
- 自动评估结果证实,视觉能力提升对齐性能,语言能力增强细节丰富度,但当前模型在两者协同整合方面仍表现薄弱。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。