Skip to main content
QUICK REVIEW

[논문 리뷰] iReason: Multimodal Commonsense Reasoning using Videos and Natural Language with Interpretability

Aman Chadha, Vinija Jain|arXiv (Cornell University)|2021. 06. 25.
Multimodal Machine Learning Applications참고 문헌 54인용 수 4
한 줄 요약

iReason는 비디오와 자연어 캡션을 공동으로 활용하여 인공지능의 공통지식 추론 능력을 향상시키는 다중모odal 프레임워크입니다. 비디오 입력을 위한 정준 프레임 탐지 모듈과 해석 가능성 향상을 위한 원인관계 정당화 모듈을 사용하여 원인관계를 추론합니다. 다양한 벤치마크에서 VCC 및 BERT/GPT-2와 같은 최신 기술 모델들을 능가하며, 원인관계 이벤트 예측 및 설명 가능성 측면에서 뛰어난 성능을 보입니다.

ABSTRACT

Causality knowledge is vital to building robust AI systems. Deep learning models often perform poorly on tasks that require causal reasoning, which is often derived using some form of commonsense knowledge not immediately available in the input but implicitly inferred by humans. Prior work has unraveled spurious observational biases that models fall prey to in the absence of causality. While language representation models preserve contextual knowledge within learned embeddings, they do not factor in causal relationships during training. By blending causal relationships with the input features to an existing model that performs visual cognition tasks (such as scene understanding, video captioning, video question-answering, etc.), better performance can be achieved owing to the insight causal relationships bring about. Recently, several models have been proposed that have tackled the task of mining causal data from either the visual or textual modality. However, there does not exist widespread research that mines causal relationships by juxtaposing the visual and language modalities. While images offer a rich and easy-to-process resource for us to mine causality knowledge from, videos are denser and consist of naturally time-ordered events. Also, textual information offers details that could be implicit in videos. We propose iReason, a framework that infers visual-semantic commonsense knowledge using both videos and natural language captions. Furthermore, iReason's architecture integrates a causal rationalization module to aid the process of interpretability, error analysis and bias detection. We demonstrate the effectiveness of iReason using a two-pronged comparative analysis with language representation learning models (BERT, GPT-2) as well as current state-of-the-art multimodal causality models.

연구 동기 및 목표

  • 시각적 및 언어적 모odal을 통합하여 공통지식 지식을 추론함으로써 다중모달 원인관계 추론의 격차를 해소합니다.
  • 시각-언어 작업에 원인관계를 통합함으로써 모델의 강건성과 해석 가능성 향상을 도모합니다.
  • 정적 이미지, 무작위 프레임 쌍, 또는 해석 가능성 부족에 의존하는 기존 모델의 한계를 극복합니다.
  • 전용 원인관계 정당화 모듈을 통해 오류 분석 및 편향 탐지 기능을 제공합니다.
  • 다양한 최종 응용 분야의 시각-언어 작업에 걸쳐 원인관계 지식 통합의 일반적 적용 가능성을 입증합니다.

제안 방법

  • 원인관계 추론을 위한 시간적으로 중요한 사건을 식별하기 위해 정준 프레임 탐지 모듈을 활용한 비디오를 원천 입력으로 사용합니다.
  • 자연어 캡션을 통합하여 시각적 이벤트 표현을 풍부화하고 원인관계 추론을 위한 언어적 맥락을 제공합니다.
  • 예측된 원인관계에 대한 인간이 읽을 수 있는 정당화를 생성하는 원인관계 정당화 모듈을 활용합니다.
  • 사전 훈련된 객체 검출기에서 유도된 시각적 특징과 BERT 또는 GPT-2에서 유도된 맥락 임베딩을 조합하여 다중모달 입력을 인코딩합니다.
  • 원인관계가 있는 쌍과 없는 쌍을 구분하기 위해 대비 학습을 사용하여 원인관계가 있는 이벤트 쌍을 예측하는 통합 다중모달 인코더를 훈련합니다.
  • 시각적, 언어적, 다중모달 맥락이 원인관계 예측에 기여하는 정도를 분리하기 위해 추상화 실험을 수행합니다.

실험 결과

연구 질문

  • RQ1비디오와 자연어 캡션을 공동으로 모델링할 경우, 단모달 또는 비원인관계 기반 베이스라인 대비 원인관계 추론 정확도가 향상되는가?
  • RQ2원인관계 정당화 모듈의 통합이 다중모달 모델의 해석 가능성 향상과 오류 분석 지원에 어떻게 기여하는가?
  • RQ3시각적 모달과 언어적 모달이 공통지식 원인관계 추론에서 얼마나 상호보완적인가?
  • RQ4비디오 시퀀스에서 정준 프레임 탐지가 무작위 프레임 선택 또는 이미지 기반 모델보다 더 나은 원인관계 추론을 이끌어내는가?
  • RQ5원인관계 지식의 통합이 비디오 질의응답 및 밀도 높은 캡션 작성과 같은 다양한 최종 응용 작업에서 성능 향상에 기여하는가?

주요 결과

  • iReason는 VQA-CAUSAL 데이터셋에서 VCC zhang2020learning을 모든 지표에서 능가하며, R@5 38.71%와 R@10 65.12%를 기록하여 뛰어난 원인관계 이벤트 탐지 능력을 입증합니다.
  • BERT 기반 설정에서는 R@1 9.21%를, GPT-2 기반 설정에서는 R@1 8.90%를 기록하여 무작위 추측(2.13%)과 표준 언어 모델을 크게 능가합니다.
  • 시각적 및 언어적 맥락을 모두 활용한 모델이 가장 높은 성능을 보이며, 이는 다중모달 맥락이 단모달 입력보다 더 효과적임을 시사합니다.
  • 추상화 실험 결과, 단지 언어적 맥락만 사용하는 것이 단지 시각적 맥락만 사용하는 것보다 성능이 뛰어나지만, 두 맥락의 조합이 가장 우수한 성능을 낼 수 있음을 확인했습니다.
  • 원인관계 정당화 모듈은 예측에 대한 설명 가능한 정당화를 성공적으로 생성하여 오류 분석 및 편향 탐지 기능을 가능하게 했습니다.
  • iReason는 다이내믹 비디오 캡션 작성, 비디오 질의응답, 장면 이해 등 다양한 작업에서 최신 기술 모델들을 능가하는 상태의 성능을 보이며, 기존 모델 대비 일관된 성능 향상을 보였습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.