Skip to main content
QUICK REVIEW

[논문 리뷰] ContCap: A scalable framework for continual image captioning

Giang Nguyen, Tae Joon Jun|arXiv (Cornell University)|2019. 09. 19.
Multimodal Machine Learning Applications참고 문헌 33인용 수 10
한 줄 요약

ContCap는 지속적 학습을 이미지 설명 생성에 통합하여 참격적 잊음( catastrophic forgetting)을 완화하는 확장 가능한 프레임워크이다. 가짜 레이블링, 선택적 가중치 동결(인코더 또는 디코더), 및 특징 디스틸레이션을 사용한다. 특히 순차적 클래스 추가에서 표준 미세조정보다 뛰어나며, 다섯 개의 클래스를 한 번에 추가할 때 이전 작업에서 CIDEr 점수는 15.1(미세조정 대비 4.8)을 기록한다.

ABSTRACT

While advanced image captioning systems are increasingly describing images coherently and exactly, recent progress in continual learning allows deep learning models to avoid catastrophic forgetting. However, the domain where image captioning working with continual learning has not yet been explored. We define the task in which we consolidate continual learning and image captioning as continual image captioning. In this work, we propose ContCap, a framework generating captions over a series of new tasks coming, seamlessly integrating continual learning into image captioning besides addressing catastrophic forgetting. After proving forgetting in image captioning, we propose various techniques to overcome the forgetting dilemma by taking a simple fine-tuning schema as the baseline. We split MS-COCO 2014 dataset to perform experiments in class-incremental settings without revisiting dataset of previously provided tasks. Experiments show remarkable improvements in the performance on the old tasks while the figures for the new surprisingly surpass fine-tuning. Our framework also offers a scalable solution for continual image or video captioning.

연구 동기 및 목표

  • 새로운 시각적 클래스가 점진적으로 도입될 때 이미지 설명 생성에서 참격적 잊음을 해결한다.
  • 이전 데이터를 재방문하지 않는 비재생(non-rehearsal) 방식의 확장 가능한 지속적 이미지 설명 생성을 위한 접근법을 개발한다.
  • 정규화 기반 기법—가짜 레이블링, 가중치 동결, 특징 디스틸레이션—이 이전 작업과 신규 작업 모두에서 성능을 유지하는 데 얼마나 효과적인지 평가한다.
  • 순차적 클래스 추가의 실패 원인을 조사하여 '단계별 참격적 잊음'이 핵심 과제임을 규명한다.
  • 다중 모odal 생성 모델이 단일 모adal 작업을 위한 지속적 학습 기법을 어떻게 복수의 모달에서 유용하게 활용할 수 있는지 보여준다.

제안 방법

  • 정규화 기반 기법을 통해 인코더-디코더 기반 이미지 설명 생성과 지속적 학습을 통합한 ContCap 프레임워크를 제안한다.
  • 이전 모델의 출력을 감독으로 활용하여 새로운 작업에서 예측을 안정화시키기 위해 가짜 레이블링을 사용한다.
  • 이전 작업의 지식을 유지하기 위해 선택적 가중치 동결—인코더 또는 디코더 중 하나—를 적용한다.
  • 숨은 표현 간의 일치를 위해 특징 디스틸레이션을 구현하여 의미 일관성을 유지한다.
  • MS-COCO 2014를 데이터 재생 없이 순차적 작업 스트림으로 나누어 클래스 증분 설정에서 점진적으로 훈련한다.
  • 표준 이미지 설명 생성 평가 지표(BLEU, CIDEr, ROUGE)를 사용해 다양한 설정에서 이전 작업과 신규 작업 모두에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1표준 미세조정은 이전 데이터를 재방문하지 않고 지속적 이미지 설명 생성에 효과적으로 적용될 수 있는가?
  • RQ2정규화 기반 지속적 학습 기법(가짜 레이블링, 동결, 디스틸레이션)은 다중 모달, 순차적 설명 생성 설정에서 어떻게 작동하는가?
  • RQ3순차적 클래스 추가에서 성능 저하가 발생하는 원인은 무엇이며, 이를 완화할 수 있는가?
  • RQ4지속적 이미지 설명 생성에서 인코더를 동결하는 것과 디코더를 동결하는 것 중 어느 것이 더 높은 성능 유지율을 보이는가?
  • RQ5일반화 능력과 이전 작업에서의 잊음 측면에서 ContCap의 성능은 표준 미세조정 대비 어떻게 다른가?

주요 결과

  • 참격적 잊음은 이미지 설명 생성 성능을 심각하게 악화시킨다: 새로운 클래스(예: 'person')에서 미세조정을 수행한 후, '개' 이미지를 잘못 설명하여 '초승이 풀 위에 프리스비를 들고 서 있는 소년'이라고 기술한다.
  • 다섯 개의 클래스를 순차적으로 추가할 경우, 이전 작업에서의 CIDEr 점수는 기준값 47.1에서 특징 디스틸레이션 적용 시 4.8로, 미세조정 시 4.5로 떨어지며 극심한 잊음이 발생함을 보여준다.
  • 가짜 레이블링은 순차적 추가에서 가장 높은 성능(이전 작업에서 15.1 CIDEr)을 기록하여 누적된 노이즈에 대한 강건성을 보이며, 미세조정 및 특징 디스틸레이션을 모두 앞선다.
  • 순차적 설정에서 인코더를 동결하는 것이 디코더를 동결하는 것보다 더 높은 성능(15.6 CIDEr 대 10.0 CIDEr)을 기록함으로써, 인코더가 장기 지식 유지에 더 중요한 역할을 함을 시사한다.
  • 여러 클래스를 동시에 추가할 경우 순차적 추가보다 더 나은 일반화와 높은 성능(예: 가짜 레이블링 시 53.4 BLEU1 및 15.1 CIDEr)을 기록하며, 이는 '단계별 참격적 잊음'으로 인한 악영향을 피함을 보여준다.
  • 이 프레임워크는 클래스 증분 설정에서 확장성과 효과성을 입증하며, 특히 가짜 레이블링과 인코더 동결을 통해 이전 작업에서 강력한 성능을 유지하면서도 새로운 작업에서 높은 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.