Skip to main content
QUICK REVIEW

[논문 리뷰] Describing like humans: on diversity in image captioning

Qingzhong Wang, Antoni B. Chan|arXiv (Cornell University)|2019. 03. 28.
Multimodal Machine Learning Applications참고 문헌 35인용 수 18
한 줄 요약

이 논문은 이미지 캡션 생성에서 의미적 다양성을 측정하기 위해 커널화된 CIDEr 점수와 잠재적 의미 분석을 사용하는 새로운 다양성 지표 Self-CIDEr를 제안한다. 이는 정확도에 최적화된 최신 모델들(예: CIDEr)이 낮은 캡션 다양성을 보이는 것으로 드러나며, 강화학습에서 교차 엔트로피 손실와 CIDEr 보상 간의 균형을 맞추는 것이 정확도-다양성 트레이드오프를 효과적으로 개선함을 보여준다.

ABSTRACT

Recently, the state-of-the-art models for image captioning have overtaken human performance based on the most popular metrics, such as BLEU, METEOR, ROUGE, and CIDEr. Does this mean we have solved the task of image captioning? The above metrics only measure the similarity of the generated caption to the human annotations, which reflects its accuracy. However, an image contains many concepts and multiple levels of detail, and thus there is a variety of captions that express different concepts and details that might be interesting for different humans. Therefore only evaluating accuracy is not sufficient for measuring the performance of captioning models --- the diversity of the generated captions should also be considered. In this paper, we proposed a new metric for measuring the diversity of image captions, which is derived from latent semantic analysis and kernelized to use CIDEr similarity. We conduct extensive experiments to re-evaluate recent captioning models in the context of both diversity and accuracy. We find that there is still a large gap between the model and human performance in terms of both accuracy and diversity and the models that have optimized accuracy (CIDEr) have low diversity. We also show that balancing the cross-entropy loss and CIDEr reward in reinforcement learning during training can effectively control the tradeoff between diversity and accuracy of the generated captions.

연구 동기 및 목표

  • 이미지 캡션 생성에서 의미적 다양성을 평가하는 신뢰할 수 있는 지표가 부족한 문제를 해결하기 위해.
  • 표준 지표(예: CIDEr)에서 인간 수준을 초월하는 성능을 내는 최신 모델이 진정으로 인간 수준의 캡션 다양성을 갖는지 조사하기 위해.
  • 학습 중에 정확도와 다양성 간의 제어 가능한 트레이드오프를 가능하게 하는 방법을 개발하기 위해.
  • CIDEr 기반 커널화에서 유도된 잠재적 의미 공간을 사용하여 캡션 세트의 의미적 내용을 시각화하고 해석하기 위해.

제안 방법

  • 모든 캡션 쌍 간의 CIDEr 점수를 기반으로 캡션 세트 내의 자기 유사성 행렬을 구성하는 Self-CIDEr라는 다양성 지표를 제안한다.
  • CIDEr 기반 유사성 행렬에 커널화된 잠재적 의미 분석(LSA)을 적용하여 캡션 세트에서 의미적 구성 요소를 추출한다.
  • 커널 행렬의 특이값 분해(SVD)를 통해 특이값에서 다양성 점수를 유도하며, 높은 값일수록 더 높은 의미적 다양성을 의미한다.
  • 라다르 차트를 사용하여 각 축이 주요 의미적 개념(예: 'eating', 'talking')에 해당하는 2차원 잠재적 의미 공간에서 캡션 세트를 시각화한다.
  • 정확도-다양성 트레이드오프를 제어하기 위해 교차 엔트로피 손실와 CIDEr 기반 보상 간의 균형을 맞춘 강화학습 학습 전략을 도입한다.
  • mBLEU 및 기타 기준 지표를 사용하여 지표를 검증하였으며, Self-CIDEr가 n-gram 기반 지표보다 다양성을 더 잘 포착하는 것으로 나타났다.

실험 결과

연구 질문

  • RQ1최신 모델이 생성한 캡션의 다양성은 의미적 변동 측면에서 인간이 작성한 캡션과 비교해 어떻게 되는가?
  • RQ2CIDEr 유사성과 커널화된 LSA에 기반한 지표가 캡션 세트의 의미적 다양성을 효과적으로 측정할 수 있는가?
  • RQ3현재의 이미지 캡션 생성 모델에서 정확도와 다양성 간의 트레이드오프는 어떠한가?
  • RQ4균형 잡힌 손실 함수를 사용한 강화학습은 정확도와 다양성 양쪽을 향상시킬 수 있는가?

주요 결과

  • CIDEr 정확도에 최적화된 최신 모델은 인간이 작성한 캡션 세트에 비해 의미적 다양성이著しく 낮다.
  • Self-CIDEr 지표는 인간의 다양성 평가와 강한 상관관계를 보이며, mBLEU보다 캡션 간 의미적 차이를 더 잘 포착한다.
  • 강화학습에서 교차 엔트로피와 CIDEr 보상을 균형 있게 조합하여 훈련한 모델은 정확도를 유지하면서도 더 높은 다양성을 달성한다.
  • 잠재적 의미 공간에서의 시각화 결과, 인간 캡션은 'eating'이나 'little girl'과 같은 핵심 개념을 강조하는 반면, 모델이 생성한 캡션은 종종 이러한 의미적 뉘앙스를 놓치거나 왜곡한다.
  • Self-CIDEr 지표는 반복된 문장(예: 'zebras grazing')이 포함된 세트가 mBLEU 점수가 높더라도 낮은 다양성을 가지는 것을 성공적으로 식별한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.