Skip to main content
QUICK REVIEW

[논문 리뷰] TAB-VCR: Tags and Attributes based Visual Commonsense Reasoning Baselines

Jingxiang Lin, Unnat Jain|arXiv (Cornell University)|2019. 10. 31.
Multimodal Machine Learning Applications참고 문헌 109인용 수 4
한 줄 요약

이 논문은 객체 속성과 향상된 텍스트-이미지 기반을 활용하여 성능을 향상시키는 간단하면서도 효과적인 시각적 공통지식 추론 모델인 TAB-VCR를 제안한다. 복잡한 어텐션 메커니즘을 경량 아키텍처로 대체하고, 속성 인식 가능 시각적 특징과 추가적인 객체 검출을 통합함으로써, TAB-VCR는 파라미터 수의 50% 미만으로도 최신 기술 수준(SOTA) 성능을 달성하며, 각각 VCR 질의 응답, 설명, 통합 작업에서 이전 작업보다 5.3%, 4.4%, 6.5% 향상되었다.

ABSTRACT

Reasoning is an important ability that we learn from a very early age. Yet, reasoning is extremely hard for algorithms. Despite impressive recent progress that has been reported on tasks that necessitate reasoning, such as visual question answering and visual dialog, models often exploit biases in datasets. To develop models with better reasoning abilities, recently, the new visual commonsense reasoning (VCR) task has been introduced. Not only do models have to answer questions, but also do they have to provide a reason for the given answer. The proposed baseline achieved compelling results, leveraging a meticulously designed model composed of LSTM modules and attention nets. Here we show that a much simpler model obtained by ablating and pruning the existing intricate baseline can perform better with half the number of trainable parameters. By associating visual features with attribute information and better text to image grounding, we obtain further improvements for our simpler & effective baseline, TAB-VCR. We show that this approach results in a 5.3%, 4.4% and 6.5% absolute improvement over the previous state-of-the-art on question answering, answer justification and holistic VCR.

연구 동기 및 목표

  • 시각적 공통지식 추론에서 복잡하고 편향 경향이 있는 모델의 한계를 해결하기 위해 더 단순하고 더 견고한 기반 모델을 개발하기 위해.
  • 시각적 속성과 원래 VCR 애너테이션을 초월한 객체 기반을 통합하여 모델 성능을 향상시키기 위해.
  • 향상된 시각-언어 기반을 갖춘 최소한의 아키텍처가 복잡한 모델보다 훨씬 적은 학습 가능한 파라미터로도 슈퍼리아를 달성할 수 있음을 보여주기 위해.
  • 정확한 추론을 방해하는 VCR 데이터셋 내 누락된 객체 검출을 식별하고 수정하기 위해.

제안 방법

  • 모델은 사전 학습된 이미지 CNN을 사용하여 속성 예측을 위한 미세조정을 수행함으로써, 표준 이미지 분류를 초월한 객체 표현을 향상시키는 시각적 특징을 추출한다.
  • 명사구를 시각적 객체와 연결하기 위해 어간 추출 및 Wu-Palmer 유사도를 활용한 새로운 기반 메커니즘을 도입한다. 이는 원래 VCR 애너테이션에 포함되지 않은 객체까지 포함한다.
  • 이미지에서 이전에 태그되지 않은 명사들(예: '카트', '코트')을 다시 탐지하고 레이블링하기 위해 CNN을 재사용함으로써 객체 검출을 확장한다.
  • 이전 최신 기술 수준(SOTA)의 LSTM과 어텐션 모듈을 대체하기 위해 단순화된 피드포워드 네트워크를 도입함으로써 모델 복잡성을 감소시키면서도 성능를 유지한다.
  • 이미지 특징, 예측된 속성, 확장된 객체 태그를 종합적으로 고려하여 답변과 추론 과정을 생성한다.
  • 제거 실험을 통해 속성 학습과 확장된 기반의 효과를 확인하였으며, 모델 크기를 줄일 경우에도 성능 향상이 이루어짐을 확인하였다.

실험 결과

연구 질문

  • RQ1속성과 기반 향상 기능을 갖춘 더 단순한 모델 아키텍처가 어텐션 기반의 복잡한 모델보다 시각적 공통지식 추론에서 슈퍼리아를 달성할 수 있는가?
  • RQ2시각적 속성과 이전에 태그되지 않은 객체를 탐지하는 것이 VCR 벤치마크에서 추론 성능에 어떤 영향을 미치는가?
  • RQ3VCR 데이터셋의 데이터 편향과 완전하지 않은 객체 애너테이션은 모델 성능을 얼마나 제한하며, 이를 어떻게 완화할 수 있는가?
  • RQ4모델 복잡성을 줄이기 위해 프루닝 및 제거 실험을 통해 일반화와 견고성을 향상시킬 수 있는가?

주요 결과

  • TAB-VCR는 이전 최신 기술 수준(SOTA) 대비 VCR 질의 응답 하위 작업에서 5.3%p의 절대적 성능 향상을 기록하였다.
  • 답변 설명 하위 작업에서 4.4% 향상되어 더 나은 추론 능력을 보였다.
  • 통합 VCR 작업에서 6.5%p의 절대적 성능 향상을 기록하였으며, 이는 종합적인 추론 성능 평가를 반영한다.
  • 학습 가능한 파라미터 수가 절반 미만(15M 대비 30M)임에도 불구하고, TAB-VCR는 이전 SOTA 모델을 초월하는 성능을 기록하였다.
  • 제거 실험을 통해 속성 학습과 확장된 객체 기반 기능이 성능 향상의 핵심 요소임을 확인하였다.
  • 더 풍부한 텍스트 기반을 갖춘 예시에서 모델가 더 뛰어난 성능을 보였으며, 이는 이미지와 언어 간의 정렬 향상이 추론 정확도를 높임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.