Skip to main content
QUICK REVIEW

[논문 리뷰] Consensus Graph Representation Learning for Better Grounded Image Captioning

Wenqiao Zhang, Haochen Shi|arXiv (Cornell University)|2021. 12. 01.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 시각적 및 언어적 시나리오 그래프를 생성적 적대 구조 네트워크를 통해 정렬함으로써 의미 일관성을 향상시키는 새로운 프레임워크인 공감 그래프 표현 학습(CGRL)을 제안한다. 공감 표현을 활용함으로써 CGRL은 Flickr30k Entities에서 객체 환영을 9% 감소시키고, 캡셔닝(Cider +2.9)과 지문화(F1 LOC +2.3) 성능을 향상시킨다.

ABSTRACT

The contemporary visual captioning models frequently hallucinate objects that are not actually in a scene, due to the visual misclassification or over-reliance on priors that resulting in the semantic inconsistency between the visual information and the target lexical words. The most common way is to encourage the captioning model to dynamically link generated object words or phrases to appropriate regions of the image, i.e., the grounded image captioning (GIC). However, GIC utilizes an auxiliary task (grounding objects) that has not solved the key issue of object hallucination, i.e., the semantic inconsistency. In this paper, we take a novel perspective on the issue above - exploiting the semantic coherency between the visual and language modalities. Specifically, we propose the Consensus Rraph Representation Learning framework (CGRL) for GIC that incorporates a consensus representation into the grounded captioning pipeline. The consensus is learned by aligning the visual graph (e.g., scene graph) to the language graph that consider both the nodes and edges in a graph. With the aligned consensus, the captioning model can capture both the correct linguistic characteristics and visual relevance, and then grounding appropriate image regions further. We validate the effectiveness of our model, with a significant decline in object hallucination (-9% CHAIRi) on the Flickr30k Entities dataset. Besides, our CGRL also evaluated by several automatic metrics and human evaluation, the results indicate that the proposed approach can simultaneously improve the performance of image captioning (+2.9 Cider) and grounding (+2.3 F1LOC).

연구 동기 및 목표

  • 시각 및 언어 모odal 간 의미 불일치로 인해 지속적으로 발생하는 시각 캡처 모델의 객체 및 속성 환영 문제를 해결한다.
  • 지역 기반 지문화에만 의존하여 속성 및 관계의 환영을 수정하지 못하는 기존의 지문화 이미지 캡처(GIC) 방법의 한계를 극복한다.
  • 정렬된 시각적 및 언어적 시나리오 그래프로부터 공감 표현을 학습하여 인간과 유사한 추론 방식을 모방함으로써 다중모odal 추론 능력을 향상시킨다.
  • 캡처 생성 및 영역 주의 메커니즘에 공감 지식을 통합함으로써 캡처 품질과 지문화 정확도를 동시에 향상시킨다.
  • 공감 기반 추론이 기존 기준 GIC 방법보다 더 의미적으로 일관되고 정확하며 상세한 이미지 기술을 생성할 수 있음을 입증한다.

제안 방법

  • 학습 중에 이미지에서 시각적 시나리오 그래프($\mathcal{SG}^{\mathcal{V}}$)와 정답 캡처에서 언어적 시나리오 그래프($\mathcal{SG}^{\mathcal{L}}$)를 구성한다.
  • 그래프 컬러이션 네트워크(GCN)를 사용하여 시각적 및 언어적 그래프의 세 가지 통합 수준에서 노드(객체, 속성, 관계)를 인코딩한다.
  • 생성적 적대 구조 네트워크(GASN)를 구현하여 다중모달 간의 노드 및 간선 매칭을 통해 인코딩된 시각적 및 언어적 그래프를 정렬한다.
  • 분포적 불일치를 최소화함으로써 시각과 언어 간 의미 일관성을 유지하는 공감 표현$\tilde{\mathbf{u}}$를 학습한다.
  • 공감 주의와 영역 기반 시각적 주의를 조합하는 이중 주의 메커니즘을 통해 공감 표현을 캡처 디코더에 통합한다.
  • 캡처링(Cider 등)과 지문화(F1 LOC 등) 성능을 동시에 최적화하는 통합 목표 함수를 사용하여 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1공감 표현 학습이 지문화 이미지 캡처에서 객체 환영을 어느 정도 감소시키는가?
  • RQ2공감 표현은 왜 자주 환영되는 속성 및 관계의 모델링을 어떻게 향상시키는가?
  • RQ3공감 추론은 지역 기반 지문화만으로 달성 가능한 바를 넘어서 캡처 품질과 지문화 정확도를 동시에 향상시킬 수 있는가?
  • RQ4GASN를 통한 시각적 및 언어적 시나리오 그래프 정렬이 다중모달 간 의미 일관성에 어떻게 기여하는가?
  • RQ5정확하고 지문화된 캡처를 생성할 때 공감 지식과 원시 시각적 또는 텍스트 기반 그래프 중 어느 것이 더 중요한 기여를 하는가?

주요 결과

  • 제안된 CGRL 프레임워크는 Flickr30k Entities 데이터셋에서 CHAIR i 지표로 측정된 바, 객체 환영을 9% 감소시켰다.
  • CGRL은 기준 모델 대비 +2.9 Cider 점수 향상을 기록하여 캡처 품질과 유창성 향상이 뚜렷하게 나타났다.
  • 지문화 성능은 +2.3 F1 LOC 향상으로 나타나, 생성된 단어가 올바른 이미지 영역과 연결되는 정확도가 향상됨을 보여주었다.
  • 인간 평가 결과, CGRL은 객체, 관계, 속성 재현률(R object, R relationship, Rt attribute)에서 높은 점수를 기록하며 더 정확한 기술을 생성함을 확인하였다.
  • 공감 기반 변종(CGRL)은 공감 추론 없이 제거한 버전(CGRL w/o CR)보다 모든 지표에서 뛰어난 성능을 보이며 공감 추론의 핵심적 역할을 입증하였다.
  • t-SNE 시각화 결과, 공감 표현이 공유 임베딩 공간에서 시각적 및 언어적 특징을 더 잘 정렬함을 확인하여 의미 일관성 향상에 기여함을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.