Skip to main content
QUICK REVIEW

[논문 리뷰] Universal Captioner: Long-Tail Vision-and-Language Model Training through Content-Style Separation

Marcella Cornia, Lorenzo Baraldi|arXiv (Cornell University)|2021. 11. 24.
Multimodal Machine Learning Applications참고 문헌 64인용 수 9
한 줄 요약

이 논문은 COCO와 같은 인간 레이블 데이터셋의 기술적 품질을 유지하면서 웹 스케일의 노이지 데이터에서 학습할 수 있도록 키워드와 스타일 토큰을 사용해 콘텐츠와 스타일을 분리하는 Universal Captioner를 제안한다. 통합된 프롬프트 언어 모델링 목적함수를 통해 COCO와 NoCaps에서 모두 최신 기술 수준의 성능을 달성하며, 특히 장꼬리 개념 커버리지와 제로샷 설정에서 뛰어난 성능을 보인다.

ABSTRACT

While captioning models have obtained compelling results in describing natural images, they still do not cover the entire long-tail distribution of real-world concepts. In this paper, we address the task of generating human-like descriptions with in-the-wild concepts by training on web-scale automatically collected datasets. To this end, we propose a model which can exploit noisy image-caption pairs while maintaining the descriptive style of traditional human-annotated datasets like COCO. Our model separates content from style through the usage of keywords and stylistic tokens, employing a single objective of prompt language modeling and being simpler than other recent proposals. Experimentally, our model consistently outperforms existing methods in terms of caption quality and capability of describing long-tail concepts, also in zero-shot settings. According to the CIDEr metric, we obtain a new state of the art on both COCO and nocaps when using external data.

연구 동기 및 목표

  • 기존 캡셔닝 모델이 장꼬리 실세계 개념을 기술하는 데에 한계가 있다는 문제를 해결하기 위해.
  • 고품질 인간 레이블 데이터에만 의존하지 않고 노이지한 웹 스케일 이미지-캡셔닝 쌍에서 효과적으로 학습할 수 있도록 하기 위해.
  • COCO와 같은 데이터셋에서 피지컬 튜닝된 모델이 유지하는 자연스럽고 인간다운 기술 스타일을 유지하기 위해.
  • 희귀 및 분포 외 개념에 대한 제로샷 일반화 성능을 향상시키기 위해.
  • 콘텐츠와 스타일 모델링을 효과적으로 통합하는 단순한 통합 학습 목표를 개발하기 위해.

제안 방법

  • 모델은 시각적 개념(키워드)를 스타일적 요소(스타일 토큰)와 분리하는 콘텐츠 인식 토크나이제이션 체계를 사용한다.
  • 콘텐츠와 스타일을 동시에 최적화할 수 있도록 통합된 프레임워크에서 단일 프롬프트 언어 모델링 목적함수를 적용한다.
  • 스타일 토큰은 학습 중에 학습되어 인간 레이블 캡셔닝의 유창성과 자연스러움을 유지한다.
  • 모델은 대규모 자동 수집된 웹 데이터에서 학습되지만, COCO의 스타일 분포로 정규화된다.
  • 아키텍처 설계를 통해 콘텐츠와 스타일을 분리함으로써, 미리 보지 않은 개념으로의 일반화가 가능해진다.
  • 복잡한 다단계 학습이나 별도의 스타일 전이 모듈을 피함으로써 학습 파이프라인을 단순화한다.

실험 결과

연구 질문

  • RQ1통합된 시각-언어 모델은 노이지한 웹 스케일 데이터에서 효과적으로 학습하면서도 인간 레이블 데이터셋의 스타일 품질을 유지할 수 있는가?
  • RQ2이러한 모델은 장꼬리 및 분포 외 시각적 개념으로의 일반화 성능이 얼마나 우수한가?
  • RQ3콘텐츠-스타일 분리가 희귀 개념에 대한 제로샷 캡셔닝 성능을 향상시키는가?
  • RQ4이 설정에서 단일 통합 목표함수가 다목적 또는 다단계 학습 접근법을 능가할 수 있는가?
  • RQ5노이지 데이터에서 학습할 경우, 모델은 인간이 작성한 캡셔닝의 유창성과 자연스러움을 어느 정도 유지하는가?

주요 결과

  • 외부 데이터를 사용하여 COCO 벤치마크에서 새로운 최신 기술 수준을 달성했으며, CIDEr 점수 향상을 보였다.
  • 기존 방법에 비해 캡셔닝 품질 향상과 장꼬리 개념 커버리지 향상이 일관되게 나타났다.
  • 제로샷 설정에서 뛰어난 성능을 보였으며, 피지컬 튜닝 없이도 새로운 개념으로의 일반화가 효과적으로 이루어졌다.
  • 콘텐츠-스타일 분리 덕분에, 노이지 데이터에서 다양한 실세계 개념을 학습하면서도 높은 유창성을 유지할 수 있었다.
  • 통합된 프롬프트 언어 모델링 목적함수 덕분에 학습이 단순화되었고, 다양한 평가 설정에서 성능 유지가 가능했다.
  • NoCaps 벤치마크에서 기존 방법을 능가하여, 개방형 어휘 캡셔닝에서의 효과성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.