[논문 리뷰] Visual Programming: Compositional visual reasoning without training
VisProg는 태스크별 트레이닝 없이도 복잡한 시각적 작업을 해결할 수 있도록 자연어 지시문에서 실행 가능한 해석 가능한 파이썬 유사 프로그램을 생성하는 신경-기호 프레임워크를 소개한다. GPT-3의 인라인 학습을 활용하고, 사전 훈련된 시각 및 언어 모델을 모듈화된 프로그램으로 조합함으로써 VisProg는 시각질의 질문 응답, 지식 태깅, 이미지 편집과 같은 다양한 작업에서 강력한 제로샷 성능를 달성한다. 이와 동시에 해석 가능성과 오류 진단을 위한 종합적인 시각적 추론 과정을 생성한다.
We present VISPROG, a neuro-symbolic approach to solving complex and compositional visual tasks given natural language instructions. VISPROG avoids the need for any task-specific training. Instead, it uses the in-context learning ability of large language models to generate python-like modular programs, which are then executed to get both the solution and a comprehensive and interpretable rationale. Each line of the generated program may invoke one of several off-the-shelf computer vision models, image processing routines, or python functions to produce intermediate outputs that may be consumed by subsequent parts of the program. We demonstrate the flexibility of VISPROG on 4 diverse tasks - compositional visual question answering, zero-shot reasoning on image pairs, factual knowledge object tagging, and language-guided image editing. We believe neuro-symbolic approaches like VISPROG are an exciting avenue to easily and effectively expand the scope of AI systems to serve the long tail of complex tasks that people may wish to perform.
연구 동기 및 목표
- 충분한 트레이닝 데이터가 부족한 복잡하고 구성적인 시각적 작업에 대해 AI 시스템을 구현할 때 발생하는 장꼬리 문제를 해결하기 위해.
- 자연어 지시문을 실행 가능한 모듈화된 프로그램으로 분해함으로써 시각적 작업에 대한 제로샷 추론을 가능하게 하기 위해.
- 중간 프로그램 실행을 통해 시각적 추론 과정을 생성함으로써 시각 AI의 해석 가능성과 사용자 제어를 향상시키기 위해.
- 특정 태스크에 맞는 미세조정이 필요 없음을 입증하고, 대신 인라인 학습과 사전 훈련된 모델의 모듈화된 조합에 의존하기 위해.
- 사용자가 시각적 추론 과정을 기반으로 지시어 튜닝을 통해 성능 향상을 이끌어내는 데에 기여하기 위해.
제안 방법
- GPT-3의 인라인 학습을 활용하여 자연어 지시문과 몇 가지 예시를 바탕으로 모듈화되고 실행 가능한 프로그램을 생성한다.
- 생성된 프로그램의 각 줄은 객체 검출기, CLIP을 통한 제로샷 분류, 또는 OpenCV 함수와 같은 전용 모듈을 호출하며, 중간 출력을 단계적으로 처리한다.
- ViLT-vqa, OWL-ViT, Stable Diffusion 등의 사전 훈련된 모델을 미세조정 없이도 사전 구현된 모듈로 활용한다.
- 입력 이미지에 대해 프로그램을 실행하여 예측 결과를 도출하고, 同시에 중간 출력을 기록하여 해석 가능한 시각적 추론 과정을 생성한다.
- 간단한 코드 통합을 통해 새로운 모듈을 추가할 수 있도록 모듈화된 확장성을 지원한다.
- 시각적 추론 과정을 활용하여 오류를 진단하고, 성능 향상을 위한 지시어 튜닝을 이끌어내는 데에 활용한다.
실험 결과
연구 질문
- RQ1특정 태스크에 맞는 미세조정 없이도 신경-기호 시스템이 복잡한 시각적 작업에 대해 정확하고 해석 가능한 프로그램을 생성할 수 있는가?
- RQ2LLM의 인라인 학습이 다양한 사전 훈련된 모델을 조율하여 시각적 추론을 위한 프로그램을 구성하는 데 얼마나 효과적인가?
- RQ3시각적 추론 과정을 통해 지시어 튜닝을 통해 사용자의 이해도와 성능 향상에 얼마나 기여할 수 있는가?
- RQ4이러한 시스템의 주요 실패 유형은 무엇이며, 이를 어떻게 진단하고 완화할 수 있는가?
- RQ5이 시스템은 이미지 편집, 지식 기반 태깅, 이미지 쌍에 대한 추론과 같은 태스크에 대해 제로샷 일반화가 가능한가?
주요 결과
- VisProg는 지식 태깅 태스크에서 63.7%의 F1 스코어를 기록했으며, 어떤 미세조정 없이도 객체를 정확히 국소화하고 이름을 지정하는 데 성공했다.
- GQA 벤치마크에서 VisProg는 강력한 제로샷 성능를 달성했으며, 오류 분석 결과 잘못된 프로그램 생성이 16%의 샘플에 영향을 주었다.
- 시각적 추론 과정을 기반으로 한 지시어 튜닝은 지식 태깅 및 이미지 편집 태스크에서 질의 및 모듈 입력을 정교화함으로써 성능 향상에 기여했다.
- ViLT-vqa 모델을 더 나은 VQA 모델로 교체하면 NLVR 성능이 최대 24% 향상될 수 있으며, 이는 모듈 품질의 영향력을 보여준다.
- 단일 이미지 VQA 모델과 LLM을 사용하여 NLVRv2에 대해 제로샷 성능를 보였으며, 무작위 및 투표 기반 베이스라인을 능가했다.
- 시각적 추론 과정은 모듈 실행 실패(예: 잘못된 국소화 또는 지식 검색 실패)를 드러내어 오류 진단을 가능하게 하며, 타겟된 지시어 개선을 이끌어낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.