[논문 리뷰] Scheduled Sampling in Vision-Language Pretraining with Decoupled Encoder-Decoder Network
이 논문은 시각-언어 이해 및 생성을 동시에 가능하게 하는 이중 스트림 분리형 인코더-디코더 네트워크인 TDEN을 제안한다. 마스크 토큰 사용으로 인한 프리트레인-피넷유닝 불일치 문제를 해소하기 위해 새로운 이중단계 스케줄링 샘플링 전략을 사용함으로써, TDEN은 네 가지 다운스트림 시각-언어 작업에서 최신 기술 수준(SOTA) 성능을 달성하며, 마스크된 언어 모델링 및 마스크된 문장 생성 작업을 위한 분리된 다중모odal 인코더와 디코더를 통해 뛰어난 일반화 능력을 입증한다.
Despite having impressive vision-language (VL) pretraining with BERT-based encoder for VL understanding, the pretraining of a universal encoder-decoder for both VL understanding and generation remains challenging. The difficulty originates from the inherently different peculiarities of the two disciplines, e.g., VL understanding tasks capitalize on the unrestricted message passing across modalities, while generation tasks only employ visual-to-textual message passing. In this paper, we start with a two-stream decoupled design of encoder-decoder structure, in which two decoupled cross-modal encoder and decoder are involved to separately perform each type of proxy tasks, for simultaneous VL understanding and generation pretraining. Moreover, for VL pretraining, the dominant way is to replace some input visual/word tokens with mask tokens and enforce the multi-modal encoder/decoder to reconstruct the original tokens, but no mask token is involved when fine-tuning on downstream tasks. As an alternative, we propose a primary scheduled sampling strategy that elegantly mitigates such discrepancy via pretraining encoder-decoder in a two-pass manner. Extensive experiments demonstrate the compelling generalizability of our pretrained encoder-decoder by fine-tuning on four VL understanding and generation downstream tasks. Source code is available at \url{https://github.com/YehLi/TDEN}.
연구 동기 및 목표
- 시각-언어 이해 및 생성 작업을 모두 지원하는 유니버설 인코더-디코더 모델을 프리트레인하는 데 도전하는 것.
- MLM 및 MSG와 같은 프록시 작업에서 마스크 토큰 사용으로 인한 프리트레인-피넷유닝 불일치 문제를 완화하는 것.
- 각각 이해 및 생성 프록시 작업을 별도로 처리하는 이중 스트림 분리형 아키텍처의 효과성을 탐색하는 것.
- 실제 토큰 생성을 시뮬레이션함으로써 일반화 능력을 향상시키기 위해 프리트레인 중에 스케줄링 샘플링 전략을 설계하는 것.
- 제안된 방법을 다양한 다운스트림 시각-언어 작업에 적용하여 기존 접근 방식보다 향상된 성능을 보여주는 것.
제안 방법
- 공유된 객체 및 문장 인코더를 갖는 이중 스트림 분리형 아키텍처를 제안하며, 시각-언어 이해 및 생성을 위한 별도의 다중모달 인코더와 디코더를 사용한다.
- 이해 프리트레인을 위해 마스크된 언어 모델링(MLM), 마스크된 객체 분류(MOC), 이미지-문장 매칭(ISM)을 사용하고, 생성 프리트레인을 위해 마스크된 문장 생성(MSG)을 사용한다.
- 이중단계 프리트레인 전략을 도입한다: 첫 번째 단계에서는 모델이 마스크된 토큰에 대한 예측을 생성하고, 두 번째 단계에서는 이러한 예측을 [MASK] 토큰 대신 입력으로 사용하여 실제 추론을 시뮬레이션한다.
- 이전 단계의 예측 결과를 사용해 인위적인 [MASK] 토큰을 대체함으로써 스케줄링 샘플링을 적용하여 프리트레인 중에 노출 편향을 감소시킨다.
- ISM에 공유된 객체 및 문장 인코더의 출력을 사용하여 다중모달 인코더에 간섭을 피하고 성능을 향상시킨다.
- 다중 작업 학습 설정을 통해 다중모달 인코더와 디코더를 이해 및 생성 프록시 작업에서 함께 프리트레인한다.
실험 결과
연구 질문
- RQ1분리형 인코더-디코더 아키텍처가 이해 및 생성 작업 모두에 대한 시각-언어 프리트레인의 일반화 능력을 향상시킬 수 있는가?
- RQ2프리트레인 중 스케줄링 샘플링이 다운스트림 작업에서 시각-언어 모델의 성능에 어떤 영향을 미치는가?
- RQ3다중모달 인코더와 디코더를 동시에 프리트레인하는 것이 별도로 프리트레인하는 것보다 더 좋은 성능을 내는가?
- RQ4두 번째 단계 프리트레인 동안 [MASK] 토큰 대신 모델이 생성한 토큰을 사용할 경우 어떤 영향을 미치는가?
- RQ5ISM의 구현 방식 선택—다중모달 인코더 출력 대비 객체/문장 인코더 출력—이 전체 성능에 어떤 영향을 미치는가?
주요 결과
- TDEN은 시각질의 질문 응답, 이미지 캡션 생성, 영상 캡션 생성, 이미지-텍스트 검색의 네 가지 다운스트림 시각-언어 작업에서 모두 새로운 최신 기술 수준(SOTA) 성능을 달성한다.
- 다중모달 인코더와 디코더를 동시에 프리트레인하는 것이 별도로 프리트레인하는 것보다 성능이 뛰어나며, 이해 및 생성 작업 간 공동 최적화의 이점이 확인된다.
- 공유된 객체 및 문장 인코더의 출력을 사용한 이미지-문장 매칭(ISM)은 다중모달 인코더 출력을 사용할 때보다 더 좋은 성능을 내며, 분포 불일치 문제로 인한 성능 저하를 피할 수 있다.
- 이중단계 스케줄링 샘플링 전략은 표준 프리트레인 방식에 비해 다운스트림 성능을 크게 향상시킨다.
- 평가한 세 가지 이중단계 전략 중 Two-Pass-C가 성능과 학습 비용 간의 최적의 균형을 이룹니다. 정확도는 약간 감소하지만, 성능 손실는 미미하다.
- 제거 실험 결과, 분리된 아키텍처와 스케줄링 샘플링이 TDEN의 성공의 핵심 요소임을 확인하였으며, 모든 평가된 작업에서 일관된 성능 향상이 관찰되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.