Skip to main content
QUICK REVIEW

[논문 리뷰] Prefix-diffusion: A Lightweight Diffusion Model for Diverse Image Captioning

Guisheng Liu, Yi Li|arXiv (Cornell University)|2023. 09. 10.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

Prefix-diffusion는 지속적인 프리픽스 이미지 임베딩을 노이즈 제거 과정에 통합하여 다양하고 유창하며 관련성이 높은 캡션을 생성하는 경량의 확산 기반 이미지 캡셔닝 모델을 제안한다. 동결된 CLIP 인코더와 소규모 학습 가능한 매핑 네트워크를 활용함으로써 기존 CLIP 기반 기준 모델 대비 파rameter를 38% 이상 감소시키면서도 Dist-3 및 어휘 사용도와 같은 최신 평가 지표에서 최고 성능을 달성한다.

ABSTRACT

While impressive performance has been achieved in image captioning, the limited diversity of the generated captions and the large parameter scale remain major barriers to the real-word application of these systems. In this work, we propose a lightweight image captioning network in combination with continuous diffusion, called Prefix-diffusion. To achieve diversity, we design an efficient method that injects prefix image embeddings into the denoising process of the diffusion model. In order to reduce trainable parameters, we employ a pre-trained model to extract image features and further design an extra mapping network. Prefix-diffusion is able to generate diverse captions with relatively less parameters, while maintaining the fluency and relevance of the captions benefiting from the generative capabilities of the diffusion model. Our work paves the way for scaling up diffusion models for image captioning, and achieves promising performance compared with recent approaches.

연구 동기 및 목표

  • 자기회귀적 이미지 캡셔닝 모델에서 반복적이거나 일반적인 캡션을 생성하는 데서 비롯하는 다양성의 한계를 해결하기 위해.
  • 다중모odal 캡셔닝 모델에서 흔히 볼 수 있는 큰 파rameter 수를 줄여 실세계 적용 가능성 향상시키기 위해.
  • 오른쪽에서 왼쪽으로의 자기회귀적 디코딩에서 발생하는 오류 누적 문제를 피하기 위해 병렬 처리가 가능한 비자기회귀적 캡셔닝 생성을 가능하게 하기 위해.
  • 시각-언어 모odal 갭을 메우면서 지속적인 확산 모델을 효과적으로 이미지 캡셔닝에 통합하기 위해.
  • 특히 제로샷 교차 데이터셋 평가에서의 일반화 능력을 포함하여 다양한 도메인 간 강력한 일반화 성능 달성하기 위해.

제안 방법

  • 지속적인 확산 모델의 노이즈 제거 과정에 학습된 프리픽스 이미지 임베딩을 통합하여 시각적 콘텐츠에 따라 텍스트 생성을 조건화한다.
  • 학습 가능한 파rameter를 줄이기 위해 사전 학습된 CLIP 이미지 인코더를 동결된 특징 추출기로 사용한다.
  • CLIP 이미지 특징을 확산 모델링을 위한 텍스트 공간으로 매핑하기 위해 경량의 학습 가능한 매핑 네트워크를 활용한다.
  • 정신적 통합성을 유지하고 생성 품질을 향상시키기 위해 전방 확산 과정에서 단절된 선형 노이즈 스케줄을 적용한다.
  • 추론 시 여러 노이즈 시드에서 샘플링하여 다각적인 캡션을 생성함으로써 비드림 서치의 한계를 피한다.
  • CLIP 기반의 이미지-텍스트 유사도를 사용하여 상위 후보 캡션을 선택함으로써 관련성과 다양성의 균형을 이룬다.

실험 결과

연구 질문

  • RQ1지속적인 확산 모델은 유창성과 관련성을 유지하면서도 다양한 이미지 캡셔닝에 효과적으로 적응할 수 있는가?
  • RQ2성능 저하 없이 시각-언어 캡셔닝에서 파ram터 효율성을 어떻게 향상시킬 수 있는가?
  • RQ3확산 노이즈 제거 과정에 시각적 프리픽스를 통합하면 캡션의 다양성과 품질이 향상되는가?
  • RQ4특히 제로샷 교차 데이터셋 평가에서 모델의 도메인 간 일반화 능력은 어떠한가?
  • RQ5다양한 노이즈 스케줄이 캡션 품질과 의미 보존에 어떤 영향을 미치는가?

주요 결과

  • Prefix-diffusion는 Dist-3 점수 109.3과 어휘 사용 점수 107.8을 기록하여 각각 기준 모델 대비 6.3점과 3.1점 향상되었다.
  • 기존 CLIP 기반 방법 대비 학습 가능한 파ram터를 38% 이상 감소시켰지만 CIDEr, BLEU, ROUGE-L 지표에서 성능을 유지하거나 향상시켰다.
  • 교차 도메인 평가에서 Prefix-diffusion는 COCO → Flickr30k에서 모든 기준 모델을 앞서며, 특히 더 큰 데이터셋에서 사전학습된 경우 강력한 일반화 능력을 보였다.
  • 단절된 선형 노이즈 스케줄이 코사인 또는 표준 스케줄 대비 더 우수한 성능을 보였으며, 캡션 품질과 기술적 정확도가 향상되었다.
  • 제거 분석 결과, CLIP 유사도를 사용해 상위-k 캡션을 선택함으로써 CIDEr 점수를 105.2에서 109.3으로 끌어올렸지만, 너무 많은 후보를 선택할 경우 유창성이 감소할 수 있음을 확인했다.
  • 모델는 풍부한 표현과 다양한 어법을 가진 다양한 캡션을 생성하여 자기회귀 모델보다 인간이 작성한 캡션에 더 가까운 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.