[논문 리뷰] KVL-BERT: Knowledge Enhanced Visual-and-Linguistic BERT for Visual Commonsense Reasoning
이 논문은 외부 공통지식 지식을 ConceptNet에서 통합하여 다중모odal BERT의 시각적 공통지식 추론 성능을 향상시키는 지식 강화 시각-언어 BERT 모델인 KVL-BERT를 제안한다. 상대적 위치 임베딩과 마스크-셀프 어텐션 기법을 사용하여 문장의 구조와 의미적 통일성을 유지하면서 관련 지식을 통합함으로써, QA→R 하위 작업에서 75.1%의 정확도를 기록하며 최신 기술 수준을 달성한다.
Reasoning is a critical ability towards complete visual understanding. To develop machine with cognition-level visual understanding and reasoning abilities, the visual commonsense reasoning (VCR) task has been introduced. In VCR, given a challenging question about an image, a machine must answer correctly and then provide a rationale justifying its answer. The methods adopting the powerful BERT model as the backbone for learning joint representation of image content and natural language have shown promising improvements on VCR. However, none of the existing methods have utilized commonsense knowledge in visual commonsense reasoning, which we believe will be greatly helpful in this task. With the support of commonsense knowledge, complex questions even if the required information is not depicted in the image can be answered with cognitive reasoning. Therefore, we incorporate commonsense knowledge into the cross-modal BERT, and propose a novel Knowledge Enhanced Visual-and-Linguistic BERT (KVL-BERT for short) model. Besides taking visual and linguistic contents as input, external commonsense knowledge extracted from ConceptNet is integrated into the multi-layer Transformer. In order to reserve the structural information and semantic representation of the original sentence, we propose using relative position embedding and mask-self-attention to weaken the effect between the injected commonsense knowledge and other unrelated components in the input sequence. Compared to other task-specific models and general task-agnostic pre-training models, our KVL-BERT outperforms them by a large margin.
연구 동기 및 목표
- 객체 검출 및 속성 인식을 넘어서 시각적 공통지식 작업에서의 기계 추론 성능을 향상시키기 위해.
- 기존 모델들이 복잡한 시각적 질문을 추론하기 위해 외부 공통지식을 활용하지 못하는 한계를 해결하기 위해.
- 외부 지식를 통합할 때 원본 입력 문장의 구조적 및 의미적 통일성을 유지하기 위해.
- 표현 학습을 방해하거나 노이즈를 유발하지 않으면서 ConceptNet에서 공통지식을 다중모달 BERT에 효과적으로 통합하는 강력한 방법을 개발하기 위해.
제안 방법
- 입력 텍스트 시퀀스에 ConceptNet의 관련 엔티티를 통합하여 지식 강화 입력을 생성하기 위해.
- 지식 통합 후 원본 문장의 구조적 정보를 유지하기 위해 상대적 위치 임베딩을 적용하기 위해.
- 주입된 지식이 관련 엔티티 토큰에만 영향을 주도록 주의를 제한하기 위해 가시성 행렬(visible matrix)을 사용하기 위해.
- 주의 계산 중 원본 입력의 의미적 및 시각적 표현을 유지하기 위해 마스크-셀프어텐션을 활용하기 위해.
- 강화된 토큰 임베딩, 위치 임베딩, 세그먼트 임베딩, 시각적 특징, 가시성 행렬을 사전 학습된 VL-BERT에 입력하여 공동 학습 및 추론을 수행하기 위해.
- 두 가지 변형을 평가: 지식 서브그래프를 transE로 임베딩하는 경우와 주입된 토큰과 원본 토큰 간에 위치 임베딩을 공유하는 경우로, 구조적 유지의 효과를 분석하기 위해.
실험 결과
연구 질문
- RQ1ConceptNet에서 유래한 외부 공통지식은 시각적 공통지식 추론 작업에서 성능 향상에 상당한 기여를 할 수 있는가?
- RQ2원본 입력의 의미적 및 구조적 표현을 방해하지 않으면서 외부 지식를 다중모달 BERT 모델에 통합하는 방법은 무엇인가?
- RQ3추론 성능을 최대화하기 위해 토큰당 최적의 지식 엔티티 수는 몇 개인가?
- RQ4상대적 위치 임베딩과 마스크-셀프어텐션을 사용할 경우, 표준 어텐션 기법에 비해 추론 정확도가 향상되는가?
- RQ5제안된 KVL-BERT 모델은 VCR 벤치마크에서 작업 특화 및 작업 무관 사전 학습 다중모달 모델과 비교해 어떻게 성능을 내는가?
주요 결과
- KVL-BERT는 QA→R 하위 작업에서 75.1%의 정확도를 기록하여 비교된 모든 작업 특화 및 작업 무관 모델을 앞서며 최고 성능을 달성한다.
- Q→A에서 74.0%, Q→AR에서 55.6%의 정확도를 기록하여 VCR의 모든 하위 작업에서 뛰어난 성능을 보였다.
- Variant I(지식 서브그래프를 transE로 임베딩하는 경우)는 KVL-BERT보다 2.3~4.0%p 낮은 성능을 보이며, 직접 주입 방식이 더 효과적임을 시사한다.
- Variant II(주입된 토큰과 원본 토큰 간에 위치 임베딩을 공유하는 경우)는 주입된 지식 엔티티 수가 증가할수록 성능이 감소하는 경향을 보였지만, KVL-BERT는 안정성을 유지하였다.
- 절단 분석 결과, 상대적 위치 임베딩과 마스크-셀프어텐션은 지식 노이즈를 크게 감소시키고 추론 정확도를 향상시킨다.
- 토큰당 주입된 지식 엔티티의 최적 수는 2개이며, 3개로 증가할 경우 성능이 저하됨을 확인하여 지식 커버리지와 노이즈 사이의 상충 관계를 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.