Skip to main content
QUICK REVIEW

[논문 리뷰] How to Design Sample and Computationally Efficient VQA Models

Karan Samel, Zelin Zhao|arXiv (Cornell University)|2021. 03. 22.
Multimodal Machine Learning Applications참고 문헌 18인용 수 4
한 줄 요약

이 논문은 시각과 언어를 위한 개체 수준의 시나리오 그래프와 확률적 프로그램을 사용하여 종단 간 미분 가능한 훈련이 가능하고 부드러운 논리 추론을 제공하는 샘플 및 계산 효율적인 VQA 모델 DePe를 제안한다. DePe는 기존 방법에 비해 특히 저자료 환경에서 샘플 및 계산 효율성을 크게 향상시키면서도 최첨단 정확도를 달성한다.

ABSTRACT

In multi-modal reasoning tasks, such as visual question answering (VQA), there have been many modeling and training paradigms tested. Previous models propose different methods for the vision and language tasks, but which ones perform the best while being sample and computationally efficient? Based on our experiments, we find that representing the text as probabilistic programs and images as object-level scene graphs best satisfy these desiderata. We extend existing models to leverage these soft programs and scene graphs to train on question answer pairs in an end-to-end manner. Empirical results demonstrate that this differentiable end-to-end program executor is able to maintain state-of-the-art accuracy while being sample and computationally efficient.

연구 동기 및 목표

  • VQA에서 시각, 언어, 추론에 대해 가장 샘플 및 계산 효율적인 구성 요소를 규명하기 위해.
  • 다중 모odal 추론에서 신경망 모델링과 기호 모델링 간의 신경-기호적 트레이드오프를 조사하기 위해.
  • 정확도를 희생시키지 않고 효율성을 향상시키기 위해 가장 효율적인 구성 요소들을 통합한 통합 VQA 모델을 설계하기 위해.
  • 특히 샘플 효율성 측면에서 저자료 지도 하에서 제안된 모델의 성능을 평가하기 위해.

제안 방법

  • 시각적 관계를 구조적으로 캡처하여 해석 가능성과 효율성을 향상시키기 위해 이미지를 개체 수준의 시나리오 그래프로 표현한다.
  • 기호 연산에 대한 미분 가능한 추론을 가능하게 하기 위해 질문을 확률적 프로그램(소프트 프로그램)으로 표현한다.
  • 소프트 논리 블록을 사용하여 시각적 및 언어적 표현 위에서 프로그램의 미분 가능한 실행을 가능하게 한다.
  • 강화 학습이나 이산 샘플링을 피하기 위해 표준 백프로파게이션을 사용하여 전체 모델을 종단 간으로 훈련한다.
  • 시나리오 그래프와 소프트 프로그램을 함께 처리할 수 있는 미분 가능한 프로그램 실행기로 시각, 언어, 추론 구성 요소를 통합한다.
  • 낮은 데이터 스케일(0.1% 및 1%)에서 개체 및 프로그램 특징(O 및 FP)에 대한 직접 지도를 활용하여 샘플 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1VQA에서 시각, 언어, 추론 구성 요소의 어떤 조합이 샘플 및 계산 효율성의 최적 균형을 이룰 수 있는가?
  • RQ2강화 학습이나 추론 기반 최적화에 비해 종단 간 미분 가능한 훈련 방식은 효율성과 정확도 측면에서 어떻게 비교되는가?
  • RQ3확률적 프로그램과 개체 수준의 시나리오 그래프가 함께 모델 성능을 향상시키면서 데이터 및 계산 요구량을 줄일 수 있는가?
  • RQ4모델은 저자료 환경에서 어떻게 작동하는가, 특히 약 0.1%의 레이블만 사용할 경우 어떻게 되는가?

주요 결과

  • DePe는 전체 VQA 데이터셋(100% 데이터)에서 99.0%의 정확도를 달성했고, 0.1% 지도 데이터에서 98.0%의 정확도를 기록하여 저자료 조건에서 대부분의 베이스라인을 능가했다.
  • 10% 데이터에서 DePe는 98.0%의 정확도를 달성했으며, NS-VQA(92.1%) 및 TbD(54.2%)와 같은 모델들을 능가하여 뛰어난 샘플 효율성을 입증했다.
  • DePe의 계산 효율성은 REINFORCE를 사용하고 수렴하기 위해 많은 반복을 요구하는 NS-CL에 비해 뚜렷이 높았다.
  • Stack-NMN과 Prob-NMN은 저자료 조건에서 강력한 성능을 보였지만, 개체 및 프로그램 특징에 직접 지도를 적용했을 때 DePe에 미치지 못했다.
  • 모델는 고비용의 이산 샘플링이나 추론을 줄이며 더 빠른 수렴을 가능하게 하기 때문에 상태 최신 정확도를 유지한다.
  • DePe의 종단 간 미분 가능한 훈련 프레임워크는 NS-VQA와 같은 이산 추론 모델에서 관찰되는 높은 분산을 보이는 것과는 달리 안정적인 최적화를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.