[논문 리뷰] VisualGPT: Data-efficient Adaptation of Pretrained Language Models for Image Captioning
VisualGPT는 시각적 및 언어적 입력을 균형 있게 조절하기 위해 새로운 자기 복원형 인코더-디코더 어텐션 메커니즘을 사용하여 사전 훈련된 언어 모델(PLM) 디코더를 미세조정하는 데이터 효율적인 이미지 캡션 생성 프레임워크를 제안한다. MS COCO의 0.1%와 Conceptual Captions의 1%만으로 훈련되었음에도 불구하고, SOTA 성능을 달성하여 MS COCO에서 베이스라인 대비 최대 10.0% 높은 CIDEr 점수를 기록하고, Conceptual Captions에서는 17.9% 향상되었으며, 의료 분야의 IU X-ray 데이터셋에서도 새로운 SOTA 기록을 수립하였다.
The ability to quickly learn from a small quantity oftraining data widens the range of machine learning applications. In this paper, we propose a data-efficient image captioning model, VisualGPT, which leverages the linguistic knowledge from a large pretrained language model(LM). A crucial challenge is to balance between the use of visual information in the image and prior linguistic knowledge acquired from pretraining. We designed a novel self-resurrecting encoder-decoder attention mechanism to quickly adapt the pretrained LM as the language decoder ona small amount of in-domain training data. The proposed self-resurrecting activation unit produces sparse activations but has reduced susceptibility to zero gradients. We train the proposed model, VisualGPT, on 0.1%, 0.5% and 1% of MSCOCO and Conceptual Captions training data. Under these conditions, we outperform the best baseline model by up to 10.8% CIDEr on MS COCO and upto 5.4% CIDEr on Conceptual Captions. Further, Visual-GPT achieves the state-of-the-art result on IU X-ray, a medical report generation dataset. To the best of our knowledge, this is the first work that improves data efficiency of image captioning by utilizing LM pretrained on unimodal data. Our code is available at: https://github.com/Vision-CAIR/VisualGPT.
연구 동기 및 목표
- 실제 응용 분야에서 특히 의료 영상과 같은 전문 분야에서 애너테이션된 이미지 캡션 데이터의 부족 문제를 해결하기 위해.
- 대규모 도메인 내 훈련 데이터가 필요 없이 사전 훈련된 언어 모델(PLMs)을 활용하여 이미지 캡션의 데이터 효율성을 향상시키기 위해.
- 단모달 PLM과 다모달 이미지 캡션 간의 도메인 갭을 해소하기 위해 시각적 특징과 언어적 사전 지식을 균형 있게 조절하기 위해.
- 작은 도메인 내 데이터로 미세조정하는 동안 사전 훈련된 언어 지식이 완전히 상실되는 것을 방지하기 위해.
- PLM 사전 지식을 활용하여 생성된 캡션의 사실 일관성을 향상시키고 객체 환각을 최소화하기 위해.
제안 방법
- VisualGPT는 GPT-2와 같은 사전 훈련된 언어 모델의 가중치를 초기화하여 캡션 디코더를 설정함으로써 풍부한 언어적 및 의미적 지식을 유지한다.
- 자기 복원형 인코더-디코더 어텐션 메커니즘을 도입하여 컨볼루션 네트워크 인코더의 시각적 특징과 디코더의 컨텍스트 기반 은닉 상태를 동적으로 균형 있게 조절한다.
- 자기 복원형 활성화 유닛(SRAU)은 포화되지 않은 정류된 게이팅 함수를 사용하여 희소한 활성화를 생성하고 기울기 붕괴를 방지하며, 게이팅이 0이 되더라도 복원 가능하게 한다.
- SRAU 메커니즘은 시각 신호가 약하거나 희박한 경우에도 PLM에서 유래한 이전 언어 지식이 유지됨을 보장한다.
- 다중 수준의 시각적 인코더에서 유도된 시각적 특징은 SRAU에 의해 조절되는 학습 가능한 어텐션 가중치를 통해 디코더 상태와 융합된다.
- 추가 사전 훈련이나 아키텍처 재설계 없이, 작은 도메인 내 이미지-텍스트 쌍에 대해 엔드 투 엔드로 미세조정된다.
실험 결과
연구 질문
- RQ1소수의 도메인 내 훈련 데이터만으로 사전 훈련된 언어 모델이 이미지 캡션에 효과적으로 적응할 수 있는가?
- RQ2다중 모달 데이터로 미세조정하는 동안 PLM의 언어 지식이 치명적인 기억 상실 없이 어떻게 유지될 수 있는가?
- RQ3제안된 자기 복원형 어텐션 메커니즘이 저자원 환경에서 시각적 및 언어적 모odal 신호 간의 균형을 향상시키는가?
- RQ4저자원 설정에서 기존 베이스라인 모델 대비 VisualGPT는 얼마나 객체 환각을 줄이는가?
- RQ5의료 보고서 생성과 같은 전문화된 도메인으로 일반화할 수 있는가? (최소한의 데이터로)
주요 결과
- MS COCO의 0.1%에서 VisualGPT는 최고의 베이스라인 대비 CIDEr 점수를 10.0% 높게 기록하여 뛰어난 데이터 효율성을 입증하였다.
- Conceptual Captions의 1%에서 VisualGPT는 가장 강력한 베이스라인 대비 CIDEr 점수를 17.9% 향상시켜 저자원 환경에서의 효과성을 입증하였다.
- VisualGPT는 IU X-ray 의료 보고서 생성 데이터셋에서 새로운 SOTA 성능을 달성하여 기존 모델을 압도하였다.
- 인간 평가 결과, 0.1% 데이터 분할에서 VisualGPT가 생성한 캡션은 39.2%의 터커들이 선호하였으며, 통계적으로 유의미한 선호도(p < 0.05)를 보였다.
- 모델는 베이스라인 대비 더 낮은 객체 환각과 더 높은 객체 커버리지로 개선된 사실 일관성을 보였으며, 250개의 샘플 이미지에서 검증되었다.
- 시각화 결과, SRAU 메커니즘이 의미 있는 명사(예: 'desk', 'snowy surface')에 대해 높은 시각적 주의를 기울이고, 기능어에는 낮은 주의를 기울여 인간의 직관과 일치함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.