[논문 리뷰] Vokenization: Improving Language Understanding with Contextualized, Visual-Grounded Supervision
이 논문은 이미지-캡션 데이터셋에서 훈련된 vokenizer를 사용하여 언어 토큰에 대한 문맥화된 시각적 임베딩(vokens)을 생성하는 vokenization 방법을 소개한다. 이 vokens를 대규모 언어 코퍼스에 적용함으로써 저자들은 GLUE, SQuAD, SWAG 벤치마크에서 BERT 기반 모델의 성능을 향상시켰으며, 이는 시각적 기반 지식이 단순 텍스트 작업에서도 일반 언어 이해를 향상시킬 수 있음을 보여준다.
Humans learn language by listening, speaking, writing, reading, and also, via interaction with the multimodal real world. Existing language pre-training frameworks show the effectiveness of text-only self-supervision while we explore the idea of a visually-supervised language model in this paper. We find that the main reason hindering this exploration is the large divergence in magnitude and distributions between the visually-grounded language datasets and pure-language corpora. Therefore, we develop a technique named "vokenization" that extrapolates multimodal alignments to language-only data by contextually mapping language tokens to their related images (which we call "vokens"). The "vokenizer" is trained on relatively small image captioning datasets and we then apply it to generate vokens for large language corpora. Trained with these contextually generated vokens, our visually-supervised language models show consistent improvements over self-supervised alternatives on multiple pure-language tasks such as GLUE, SQuAD, and SWAG. Code and pre-trained models publicly available at https://github.com/airsplay/vokenization
연구 동기 및 목표
- 기존 언어 사전 훈련 프레임워크에서 시각적 기반 지식의 부족 문제를 해결하기 위해, 텍스트 기반 자기지도 학습에만 의존하는 기존 접근 방식의 한계를 보완한다.
- 작은 시각적 기반 데이터셋과 대규모 언어 코퍼스 사이의 데이터 분포 격차를 극복한다.
- 언어 전용 데이터에 대해 문맥적으로 관련된 vokens를 생성함으로써 일반 NLP 작업을 위한 시각적 지도 학습을 가능하게 한다.
- 비시각적 단어나 추상적 단어에 대해서도 문맥 기반 토큰-이미지 매칭을 통해 시각적 맥락을 활용함으로써 언어 표현 학습을 향상시킨다.
제안 방법
- MS COCO, Visual Genome 등의 작은 이미지-캡션 데이터셋에서 컨텍스트 토큰-이미지 매칭 모델을 사용해 vokenizer를 훈련한다.
- 훈련된 vokenizer를 사용하여 영어 위키백과와 같은 대규모 텍스트 코퍼스의 토큰들에 대해 문맥적으로 관련된 이미지들(즉, vokens)을 검색한다.
- BERT 스타일 모델에 voken 예측을 보조 목표로 통합하여, 마스킹된 언어 모델링과 voken 분류를 함께 최적화한다.
- 문장 수준의 맥락을 활용하여 토큰을 해석하고, 추상적 또는 비구체적인 단어들(예: 'by', 'angry')에 대해서도 정확도를 향상시킨다.
- CNN/Daily Mail와 Wiki103 등의 다양한 NLP 데이터셋에 vokenization 파이프라인을 적용하여 전이 학습을 가능하게 한다.
- Jensen–Shannon 발산을 사용하여 시각적 기반 언어 코퍼스와 일반 언어 코퍼스 간의 분포적 차이를 정량화함으로써, vokenization의 필요성을 정당화한다.
실험 결과
연구 질문
- RQ1이미지-캡션 데이터에서 유도된 시각적 기반 지식이 순수 텍스트 기반 NLP 작업에서 언어 이해를 향상시킬 수 있는가?
- RQ2작은 시각적 기반 데이터셋과 대규모 언어 코퍼스 사이의 분포 격차와 크기 격차를 어떻게 극복할 수 있는가?
- RQ3문맥 기반 토큰-이미지 매칭은 비시각적 또는 추상적 단어의 시각적 기반 지식을 향상시킬 수 있는가?
- RQ4생성된 vokens를 보조 지도 학습으로 통합하면 다양한 NLP 벤치마크에서 일관된 성능 향상이 이루어지는가?
- RQ5vokens는 RoBERTa와 같은 다른 언어 모델 아키텍처 간에도 얼마나 잘 전이되는가?
주요 결과
- 제안된 vokenization 방법은 GLUE 벤치마크에서 자기지도 학습 BERT보다 일관된 성능 향상을 보이며, 개별 작업에서 0.8에서 2.1 포인트의 향상이 이루어졌다.
- SQuAD에서 시각적 지도 학습 모델은 자기지도 기반 모델보다 F1 점수에서 1.2 포인트 향상되었으며, 이는 더 나은 독해 능력을 의미한다.
- SWAG에서 정확도는 1.5포인트 향상되었으며, 이는 시각적 기반 지식을 통해 공리적 추론 능력이 향상되었음을 보여준다.
- 비시각적 또는 기능어인 단어들(예: 'by', 'angry')에 대해서도 vokenizer가 문맥적으로 관련된 vokens를 성공적으로 생성함을 시각화를 통해 확인하였다.
- 전이 실험 결과 vokens는 RoBERTa에서도 성능 향상을 이끌어내어, 이 방법이 BERT를 초월해 일반화 가능함을 확인하였다.
- 영어 위키백사의 기반 비율은 27.7%에 불과하지만, vokenization은 여전히 의미 있는 성능 향상을 이끌어내어, 문맥화된 vokens가 비기반 텍스트에 효과적으로 시각 지식을 통합할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.