Skip to main content
QUICK REVIEW

[논문 리뷰] Symbolic Replay: Scene Graph as Prompt for Continual Learning on VQA Task

Stan Weixian Lei, Difei Gao|arXiv (Cornell University)|2022. 08. 24.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 시각적 질의 응답(VQA)에서 지속적 학습을 위한 새로운 벤치마크인 CLOVE를 제안하며, 장면-증분 및 기능-증분 설정을 지원한다. 또한 시나리오 그래프를 프롬프트로 사용하는 상징적 재생 방법인 SGP를 도입하여 실제 이미지 없이 지식을 재생함으로써 추론 메커니즘을 유지하고 다중 모odal VQA 모델에서 치명적인 잊음 현상을 방지하는 효과적인 지속적 학습을 가능하게 한다.

ABSTRACT

VQA is an ambitious task aiming to answer any image-related question. However, in reality, it is hard to build such a system once for all since the needs of users are continuously updated, and the system has to implement new functions. Thus, Continual Learning (CL) ability is a must in developing advanced VQA systems. Recently, a pioneer work split a VQA dataset into disjoint answer sets to study this topic. However, CL on VQA involves not only the expansion of label sets (new Answer sets). It is crucial to study how to answer questions when deploying VQA systems to new environments (new Visual scenes) and how to answer questions requiring new functions (new Question types). Thus, we propose CLOVE, a benchmark for Continual Learning On Visual quEstion answering, which contains scene- and function-incremental settings for the two aforementioned CL scenarios. In terms of methodology, the main difference between CL on VQA and classification is that the former additionally involves expanding and preventing forgetting of reasoning mechanisms, while the latter focusing on class representation. Thus, we propose a real-data-free replay-based method tailored for CL on VQA, named Scene Graph as Prompt for Symbolic Replay. Using a piece of scene graph as a prompt, it replays pseudo scene graphs to represent the past images, along with correlated QA pairs. A unified VQA model is also proposed to utilize the current and replayed data to enhance its QA ability. Finally, experimental results reveal challenges in CLOVE and demonstrate the effectiveness of our method. The dataset and code will be available at https://github.com/showlab/CLVQA.

연구 동기 및 목표

  • 장면 및 기능 증분 설정을 모두 지원하는 VQA에서 지속적 학습을 위한 벤치마크 부족 문제를 해결한다.
  • 새로운 시각적 장면이나 추론 기능을 학습할 때 VQA 모델에서 발생하는 치명적인 잊음 현상에 대처한다.
  • 이미지 생성에 의존하지 않고 추론 능력을 유지하는 실데이터 기반 재생 기법을 개발한다.
  • 실제 운영 환경과 유사하게 시간이 지남에 따라 새로운 환경과 새로운 질문 유형에 적응할 수 있도록 VQA 모델을 가능하게 한다.

제안 방법

  • 지속적 VQA를 위한 두 가지 설정(장면 증분(6개 장면), 기능 증분(6개 기능))을 갖춘 새로운 벤치마크인 CLOVE를 제안한다.
  • 과거 지식을 표현하기 위해 시나리오 그래프를 프롬프트로 사용하는 상징적 재생 메커니즘을 설계하여 실제 이미지 재생을 대체한다.
  • 시나리오 그래프와 QA 쌍 간의 태스크별 매핑을 학습하기 위해 언어 모델 기반의 상징적 재생 모델(SRM)을 개발한다.
  • 현재 및 재생된 시나리오 그래프–QA 입력을 모두 처리할 수 있는 통합 VQA 모델( UniVQA)을 사용하여 지속적 학습을 강화한다.
  • 랜덤으로 샘플된 시나리오 그래프 관계가 과거 지식의 재생을 유도하는 프롬프트 기반 추론을 구현한다.
  • 저품질의 이미지 생성에 기인한 가짜 재생 방법의 한계를 피하기 위해 구조적이고 상징적인 표현 방식을 활용한다.

실험 결과

연구 질문

  • RQ1실제 장면-증분 및 기능-증분 설정 하에서 지속적 학습이 VQA에서 효과적으로 평가될 수 있는 방법은 무엇인가?
  • RQ2시나리오 그래프를 활용한 상징적 재생이 기존의 이미지 기반 재생보다 치명적인 잊음 방지를 위해 더 우수한 성능을 보일 수 있는가?
  • RQ3통합 VQA 모델이 상징적 프롬프트를 사용해 새로운 시각적 장면과 새로운 추론 기능으로의 일반화 능력을 어느 정도 달성할 수 있는가?
  • RQ4시각적 환경과 기능 능력을 동시에 확장할 때 지속적 VQA에서 발생하는 주요 과제는 무엇인가?
  • RQ5제안된 SGP 방법은 다중 모odal, 다중 작업 VQA 환경에서 추론 메커니즘을 유지하면서 치명적인 잊음 현상을 방지하는 데 어떻게 기여하는가?

주요 결과

  • CLOVE 벤치마크는 특히 장면 및 기능 증분 모두에서 성능 유지에 있어 뚜렷한 과제를 드러낸다.
  • 제안된 SGP 방법은 CLOVE-scene 및 CLOVE-function 설정 양쪽 모두에서 베이스라인 재생 및 정규화 방법보다 뛰어난 성능을 달성한다.
  • 시나리오 그래프 기반 상징적 재생은 실데이터 없이도 추론 메커니즘을 효과적으로 유지하고 치명적인 잊음 현상을 감소시킨다.
  • 통합 VQA 모델( UniVQA)은 현재 지식과 재생된 지식을 성공적으로 통합하여 다양한 시각적 및 기능적 작업에서 강력한 일반화 능력을 보여준다.
  • CLOVE의 답변 분포는 높은 클래스 불균형을 보이며, 개방형 VQA 과제에서 지속적 학습의 어려움을 강조한다.
  • 정성 분석 결과 SGP는 시나리오 그래프에서 타당하고 다양한 QA 쌍을 생성하여 효과적인 지식 재생을 지원함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.