[논문 리뷰] CogAgent: A Visual Language Model for GUI Agents
CogAgent는 180억 파라미터의 시각어휘모델(VLM)로, GUI 이해 및 탐색을 위해 설계되었으며, 저해상도 및 고해상도 이미지 인코더를 갖춘 이중 브랜치 아키텍처를 활용하여 1120×1120 해상도에서 인간 수준의 시각적 이해를 달성한다. 이 모델은 Mind2Web 및 AITW 벤치마크에서 추출된 텍스트에 기반한 LLM 기반 방법들을 능가하며, VQA 및 GUI 추론 작업 9개에서 최신 기준 성능을 달성하면서 기존 고해상도 모델 대비 FLOPs를 50% 이상 감소시킨다.
People are spending an enormous amount of time on digital devices through graphical user interfaces (GUIs), e.g., computer or smartphone screens. Large language models (LLMs) such as ChatGPT can assist people in tasks like writing emails, but struggle to understand and interact with GUIs, thus limiting their potential to increase automation levels. In this paper, we introduce CogAgent, an 18-billion-parameter visual language model (VLM) specializing in GUI understanding and navigation. By utilizing both low-resolution and high-resolution image encoders, CogAgent supports input at a resolution of 1120*1120, enabling it to recognize tiny page elements and text. As a generalist visual language model, CogAgent achieves the state of the art on five text-rich and four general VQA benchmarks, including VQAv2, OK-VQA, Text-VQA, ST-VQA, ChartQA, infoVQA, DocVQA, MM-Vet, and POPE. CogAgent, using only screenshots as input, outperforms LLM-based methods that consume extracted HTML text on both PC and Android GUI navigation tasks -- Mind2Web and AITW, advancing the state of the art. The model and codes are available at https://github.com/THUDM/CogVLM, with a new version of CogAgent-9B-20241220 available at https://github.com/THUDM/CogAgent.
연구 동기 및 목표
- 스크립트나 HTML, OCR과 같은 구조화된 텍스트에 의존하지 않고, 오직 스크린샷만을 사용하여 GUI를 이해하고 탐색할 수 있는 일반화된 시각어휘모델을 개발하는 것.
- 일반적인 VLM이 자연 이미지에서 훈련되는 데 비해, OCR 및 GUI 애너테이션을 포함한 대규모 GUI 전용 사전 훈련 데이터셋을 구축하여 표준 VLM의 한계를 극복하는 것.
- 미세한 GUI 요소를 인식할 수 있도록 최대 1120×1120 해상도에서 고해상도 시각 이해를 가능하게 하면서도 계산 비용을 최소화하는 것.
- 일반적인 VQA 벤치마크와 Mind2Web 및 AITW와 같은 전문화된 GUI 에이전트 벤치마크에서 최신 기준 성능을 달성하는 것.
- 주요 모델에서 고해상도 특징 추출을 분리하여 FLOPs를 감소시키고 확장 가능한 추론을 가능하게 하는 효율적인 아키텍처 설계
제안 방법
- CogAgent는 표준 저해상도 ViT(EVA2-CLIP-E)와 1120×1120 입력을 위한 작은 전용 이미지 인코더(0.30B 파라미터)를 갖춘 새로운 고해상도 크로스모듈을 포함한 이중 브랜치 시각 인코더를 사용한다.
- 고해상도 브랜치는 저해상도 브랜치의 특징을 참조하기 위해 크로스 어텐션을 활용하여, 주 모델의 시퀀스 길이를 늘리지 않고도 세밀한 시각적 세부 정보를 효율적으로 융합한다.
- GUI 이해를 향상시키기 위해 이미지 캡션, OCR, 도메인 특화된 GUI 및 기준 데이터를 조합한 대규모 GUI 전용 사전 훈련 데이터셋을 기반으로 사전 훈련을 수행한다.
- 인간이 애너테이션한 지시 데이터를 사용한 지도적 미세조정을 통해 VQA 및 GUI 탐색과 같은 최종 작업에 대해 미세조정을 수행한다.
- 계산 효율성을 평가하기 위해 FLOPs와 추론 시간을 메트릭으로 사용하며, 224, 490, 756, 1120 해상도에서 실험을 수행한다.
- 아키텍처는 고해상도 처리를 분리함으로써 원래 CogVLM-17B 모델(490×490) 대비 1120×1120 해상도에서 FLOPs를 2.5배 감소시킬 수 있도록 한다.
실험 결과
연구 질문
- RQ1스크립트나 HTML 또는 OCR 등 추출된 구조화된 텍스트에 의존하는 LLM 기반 에이전트보다 일반화된 시각어휘모델이 GUI 탐색 작업에서 성능을 뛰어넘을 수 있는가?
- RQ21120×1120까지의 고해상도 시각 입력을 VLM에서 처리할 때, 금방이 되는 계산 비용 없이 효율적으로 처리할 수 있는가?
- RQ3GUI, OCR, 기준 데이터 등 도메인 특화된 사전 훈련 데이터가 GUI 추론 및 탐색 벤치마크 성능에 얼마나 기여하는가?
- RQ4저해상도 및 고해상도 특징 간 크로스 어텐션을 갖춘 이중 브랜치 아키텍처가 단일 고해상도 모델보다 성능과 효율성이 뛰어나게 되는가?
- RQ5VLM가 일반적인 VQA와 전문화된 GUI 에이전트 벤치마크에서 동시에 최신 기준 성능을 달성할 수 있는가?
주요 결과
- CogAgent는 VQAv2, OK-VQA, Text-VQA, ST-VQA, ChartQA, infoVQA, DocVQA, MM-Vet, POPE를 포함한 5개의 텍스트 기반 및 4개의 일반 VQA 벤치마크에서 최신 기준 성능을 달성한다.
- Mind2Web 벤치마크에서 CogAgent는 오직 스크린샷만을 사용하여 41.4%의 성공률을 기록했으며, 추출된 HTML 텍스트를 사용하는 LLM 기반 방법들을 능가한다.
- AITW 벤치마크에서 CogAgent는 전체 사전 훈련 데이터(포함 GUI 및 기준 데이터)를 사용하여 54.2%의 성공률을 기록했으며, 이미지 캡션과 OCR 전용으로 훈련된 모델보다 뚜렷이 뛰어난 성능을 보였다.
- 1120×1120 해상도에서 원래 CogVLM-17B 아키텍처 대비 FLOPs를 50% 이상 감소시켰으며, 계산 오버헤드는 약간 증가에 그쳤다.
- 절단 실험 결과, 이미지 캡션과 OCR 전용으로 훈련된 모델 대비 GUI 전용 및 기준 사전 훈련 데이터를 추가한 모델은 Mind2Web 성능에서 15.6%포인트 향상되었다.
- 모델는 강력한 일반화 능력을 유지하여 1120×1120 해상도에서 ST-VQA에서 78.2%, OCRVQA에서 75.9%의 성능을 기록했으며, 다양한 시각 추론 작업에 대한 강건성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.