[论文解读] CogAgent: A Visual Language Model for GUI Agents
CogAgent 是一个参数量为 180 亿的视觉语言模型,专为 GUI 理解与导航而设计,采用双分支架构,结合低分辨率与高分辨率图像编码器,在 1120×1120 分辨率下实现人类水平的视觉理解能力。该模型在 Mind2Web 和 AITW 基准测试中,优于依赖提取文本的 LLM 方法,在九项 VQA 与 GUI 推理任务中取得新的 SOTA 结果,同时相比基线高分辨率模型,计算量(FLOPs)减少超过 50%。
People are spending an enormous amount of time on digital devices through graphical user interfaces (GUIs), e.g., computer or smartphone screens. Large language models (LLMs) such as ChatGPT can assist people in tasks like writing emails, but struggle to understand and interact with GUIs, thus limiting their potential to increase automation levels. In this paper, we introduce CogAgent, an 18-billion-parameter visual language model (VLM) specializing in GUI understanding and navigation. By utilizing both low-resolution and high-resolution image encoders, CogAgent supports input at a resolution of 1120*1120, enabling it to recognize tiny page elements and text. As a generalist visual language model, CogAgent achieves the state of the art on five text-rich and four general VQA benchmarks, including VQAv2, OK-VQA, Text-VQA, ST-VQA, ChartQA, infoVQA, DocVQA, MM-Vet, and POPE. CogAgent, using only screenshots as input, outperforms LLM-based methods that consume extracted HTML text on both PC and Android GUI navigation tasks -- Mind2Web and AITW, advancing the state of the art. The model and codes are available at https://github.com/THUDM/CogVLM, with a new version of CogAgent-9B-20241220 available at https://github.com/THUDM/CogAgent.
研究动机与目标
- 开发一种通用视觉语言模型,仅通过截图实现 GUI 理解与导航,无需依赖 HTML 或 OCR 等结构化文本。
- 通过构建大规模 GUI 专用预训练数据集(包含 OCR 与 GUI 标注),克服标准 VLM 在自然图像上预训练所导致的局限性。
- 实现在高达 1120×1120 分辨率下的高分辨率视觉理解,以识别微小的 GUI 元素,同时将计算成本降至最低。
- 在通用 VQA 基准与专用 GUI 代理基准(如 Mind2Web 与 AITW)上均实现 SOTA 性能。
- 设计一种高效架构,将高分辨率特征提取与主模型解耦,以减少 FLOPs 并支持可扩展推理。
提出的方法
- CogAgent 采用双分支视觉编码器结构:一个标准的低分辨率 ViT(EVA2-CLIP-E)与一个新型高分辨率跨模块,后者配备一个参数量更小、专用于 1120×1120 输入的独立图像编码器(0.30B 参数)。
- 高分辨率分支通过交叉注意力机制关注低分辨率分支的特征,实现在不增加主模型序列长度的前提下,高效融合细粒度视觉细节。
- 模型在大规模 GUI 专用数据集上进行预训练,该数据集结合了图像字幕、OCR 以及领域特定的 GUI 与定位数据,以提升 GUI 理解能力。
- 在下游任务(如 VQA 与 GUI 导航)上通过使用人工标注指令数据的监督微调进行优化。
- 消融实验以 FLOPs 和推理时间作为计算效率的评估指标,实验在 224、490、756 和 1120 分辨率下进行。
- 该架构使 CogVLM-17B 在 1120×1120 分辨率下的 FLOPs 相较于原始 CogVLM-17B 在 490×490 分辨率下的配置减少 2.5 倍,归因于高分辨率处理的分离。
实验结果
研究问题
- RQ1通用视觉语言模型是否能在 GUI 导航任务中超越依赖提取结构化文本(如 HTML 或 OCR)的 LLM 代理?
- RQ2如何在不产生过高计算成本的前提下,高效处理高达 1120×1120 的高分辨率视觉输入?
- RQ3领域特定的预训练数据(如 GUI、OCR、定位)在多大程度上能提升 GUI 推理与导航基准的表现?
- RQ4采用低分辨率与高分辨率特征之间交叉注意力的双分支架构,是否在性能与效率上优于单一高分辨率模型?
- RQ5视觉语言模型能否同时在通用 VQA 与专用 GUI 代理基准上实现 SOTA 性能?
主要发现
- CogAgent 在五项文本丰富的通用 VQA 基准与四项通用 VQA 基准上均取得 SOTA 表现,涵盖 VQAv2、OK-VQA、Text-VQA、ST-VQA、ChartQA、infoVQA、DocVQA、MM-Vet 与 POPE。
- 在 Mind2Web 基准上,CogAgent 仅使用截图即实现 41.4% 的成功率,优于依赖提取 HTML 文本的 LLM 方法。
- 在 AITW 基准上,CogAgent 在使用完整预训练数据(包含 GUI 与定位数据)时,实现 54.2% 的成功率,显著优于仅在图像字幕与 OCR 上训练的模型。
- 与原始 CogVLM-17B 架构相比,高分辨率跨模块在 1120×1120 分辨率下使 FLOPs 减少超过 50%,仅带来适度的计算开销增加。
- 消融实验证明,加入 GUI 专用与定位预训练数据,使 Mind2Web 表现提升 15.6 个百分点,相较仅在图像字幕与 OCR 上训练的模型。
- 模型保持强大泛化能力,在 1120×1120 分辨率下于 ST-VQA 上达到 78.2%,在 OCRVQA 上达到 75.9%,展现出在多样化视觉推理任务中的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。