Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-Grained Image Captioning with Global-Local Discriminative Objective

Jie Wu, Tianshui Chen|arXiv (Cornell University)|2020. 07. 21.
Multimodal Machine Learning Applications참고 문헌 74인용 수 8
한 줄 요약

이 논문은 미세한 이미지 캡션 생성을 위한 글로벌-로컬 분류적 목적함수를 제안하며, 유사한 이미지들 사이에서 구분할 수 있도록 하는 글로벌 분류적 제약와 희귀하고 정보성 높은 어휘를 강조하는 로컬 분류적 제약를 결합함으로써 캡션의 정확도와 구분 능력을 향상시킨다. 이 방법은 MS-COCO에서 최신 기준 성능을 달성하여 기준 모델 대비 캡션 품질과 구분 능력이 크게 향상된다.

ABSTRACT

Significant progress has been made in recent years in image captioning, an active topic in the fields of vision and language. However, existing methods tend to yield overly general captions and consist of some of the most frequent words/phrases, resulting in inaccurate and indistinguishable descriptions (see Figure 1). This is primarily due to (i) the conservative characteristic of traditional training objectives that drives the model to generate correct but hardly discriminative captions for similar images and (ii) the uneven word distribution of the ground-truth captions, which encourages generating highly frequent words/phrases while suppressing the less frequent but more concrete ones. In this work, we propose a novel global-local discriminative objective that is formulated on top of a reference model to facilitate generating fine-grained descriptive captions. Specifically, from a global perspective, we design a novel global discriminative constraint that pulls the generated sentence to better discern the corresponding image from all others in the entire dataset. From the local perspective, a local discriminative constraint is proposed to increase attention such that it emphasizes the less frequent but more concrete words/phrases, thus facilitating the generation of captions that better describe the visual details of the given images. We evaluate the proposed method on the widely used MS-COCO dataset, where it outperforms the baseline methods by a sizable margin and achieves competitive performance over existing leading approaches. We also conduct self-retrieval experiments to demonstrate the discriminability of the proposed method.

연구 동기 및 목표

  • 기존의 이미지 캡션 모델이 보수적인 훈련 목표함수와 참조 캡션 내 단어 분포의 불균형으로 인해 너무 일반적이거나 비구분 가능한 캡션을 생성하는 데에 한계가 있음을 해결하기 위해.
  • 구분 능력을 향상시키기 위해 덜 자주 나타나는 더 구체적인 시각적 세부 정보를 강조함으로써 미세한 기술적 기술 캡션의 생성을 향상시키기 위해.
  • 글로벌(이미지 수준)과 로컬(어휘 수준)에서 작용하는 이중 제약 메커니즘을 도입함으로써 다양성과 정확성의 균형을 맞추기 위해.
  • MS-COCO에서의 정량적 평가와 캡션의 구분 능력을 측정하는 자기 검색 실험을 통해 제안된 방법의 효과성을 입증하기 위해.

제안 방법

  • 글로벌 분류적 제약는 생성된 캡션을 참조 이미지에 가깝게 하고, 다른 유사한 이미지들에서 멀리 떼어지도록 하는 순서 손실을 사용하여 구현된다.
  • 로컬 분류적 제약는 TF-IDF 점수를 기반으로 개별 단어/어휘에 대한 보상 값을 재가중하여, 덜 자주 나타나는 더 정보성 높은 어휘에 더 높은 보상을 부여함으로써 높은 빈도어휘에 대한 편향을 보완한다.
  • 두 제약는 기준 캡션 모델 위에 적용되며, 글로벌 및 로컬 분류 신호를 모두 포함한 수정된 보상 함수를 사용하는 강화학습을 통해 구현된다.
  • 훈련 오버헤드를 줄이기 위해 유사도 행렬과 TF-IDF 가중치를 사전에 계산하여 계산 효율성을 확보한다.
  • 훈련 파이프라인은 글로벌 및 로컬 제약를 순차적으로 적용한다: 먼저 유사한 이미지를 식별하여 순서 손실를 적용하고, 그 다음 어휘 수준 보상 값을 재가중한 후, 역전파를 수행한다.
  • 표준 평가 지표(CIDEr, BLEU 등)와 자기 검색 정확도를 사용하여 구분 능력과 캡션 품질을 측정한다.

실험 결과

연구 질문

  • RQ1글로벌 분류적 제약는 유사한 이미지들 사이에서 정확한 이미지로의 캡션을 끌어오고 다른 이미지들에서 멀어지게 하여 이미지 캡션 모델의 구분 능력을 향상시킬 수 있는가?
  • RQ2희귀하고 정보성 높은 어휘를 재가중하는 로컬 분류적 제약는 더 구체적이고 미세한 기술적 캡션의 생성을 향상시킬 수 있는가?
  • RQ3글로벌 및 로컬 분류적 제약를 결합하면 단독으로 사용할 경우보다 캡션 정확도, 다양성, 구분 능력 간의 균형을 더 잘 달성할 수 있는가?
  • RQ4기존 최신 기준 기술 대비 제안된 방법은 표준 캡션 평가 지표와 자기 검색 성능 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 글로벌-로컬 분류적(Goal-Local Discriminative, GLD) 목적함수는 MS-COCO test-UNIDEF 분할에서 CIDEr 점수 128.7을 기록하여 기준 모델 TDA+보다 2.80% 높은 성능을 달성했다.
  • TDA+GLD 모델의 자기 검색 정확도는 87.4%에 도달하여 생성된 캡션의 강력한 구분 능력을 시사한다.
  • 제거 실험을 통해 글로벌 및 로컬 제약가 각각 독립적으로 성능 향상에 기여하는 것으로 확인되었으며, 글로벌 제약는 이미지 수준의 구분 능력을 향상시키고, 로컬 제약는 어휘 수준의 세부 정보를 강화한다.
  • 이 방법은 '남자' 또는 '앉아 있는'과 같은 너무 일반적인 어휘의 생성을 줄이고, '노란 남자' 또는 '컴퓨터를 사용하는'과 같은 더 구체적이고 정보성 높은 어휘의 포함을 증가시켰다.
  • 성능 향상에도 불구하고, 일부 경우에 모델이 너무 과도하게 구분 가능한 캡션을 생성하여 참조 기술과의 일치도가 떨어지는 경우가 있어, 글로벌 제약에서 적응형 임계값 설정이 필요할 것으로 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.