[논문 리뷰] Language Modelling with Pixels
이 논문은 텍스트를 이미지로 렌더링하고 비전 트랜스포머를 사용해 이를 인코딩함으로써 어휘 병목 현상을 회피하는 비전 기반 언어 모델인 pixel을 제안한다. 이는 서브워드 토크나이저에 의존하지 않고 다양한 스크립트 간의 다국어 전이를 가능하게 하며, 비라틴 스크립트에서 BERT를 능가하고 철자 오차 및 코드 스위칭에 대해 뛰어난 내성성을 보인다. 다만 라틴 스크립트에서는 다소 뒤처지고, 장거리 문법적 의존성에서는 성능이 떨어진다.
Language models are defined over a finite set of inputs, which creates a vocabulary bottleneck when we attempt to scale the number of supported languages. Tackling this bottleneck results in a trade-off between what can be represented in the embedding matrix and computational issues in the output layer. This paper introduces PIXEL, the Pixel-based Encoder of Language, which suffers from neither of these issues. PIXEL is a pretrained language model that renders text as images, making it possible to transfer representations across languages based on orthographic similarity or the co-activation of pixels. PIXEL is trained to reconstruct the pixels of masked patches instead of predicting a distribution over tokens. We pretrain the 86M parameter PIXEL model on the same English data as BERT and evaluate on syntactic and semantic tasks in typologically diverse languages, including various non-Latin scripts. We find that PIXEL substantially outperforms BERT on syntactic and semantic processing tasks on scripts that are not found in the pretraining data, but PIXEL is slightly weaker than BERT when working with Latin scripts. Furthermore, we find that PIXEL is more robust than BERT to orthographic attacks and linguistic code-switching, further confirming the benefits of modelling language with pixels.
연구 동기 및 목표
- 사전 훈련된 언어 모델에서 발생하는 어휘 병목 현상을 해결함으로써 다국어 일반화를 제한하고 임베딩 및 출력 레이어 설계에서 발생하는 상충 관계를 완화하고자 한다.
- 유한한 서브워드나 문자 어휘에 의존하지 않고도 수천 개의 언어, 비라틴 스크립트를 포함한 언어를 지원할 수 있도록 하고자 한다.
- 언어를 시각적 표현으로 모델링함으로써 철자 변형, 소음, 코드 스위칭에 대한 내성성을 향상시키고자 한다.
- 픽셀 기반 인코딩이 다양한 언어 유형에 걸쳐 강력한 제로샷 및 피크샷 전이 성능을 달성할 수 있는지 탐색하고자 한다.
제안 방법
- 입력 시퀀스가 폰트 렌더러를 사용해 고정 크기의 이미지 패치로 렌더링되어 시각적 토큰으로 변환된다.
- 비전 트랜스포머(ViT) 인코더가 학습 가능한 토큰 임베딩 레이어 없이 이미지 패치를 처리함으로써 어휘 제약 조건을 제거한다.
- 모델은 마스킹된 오토에코딩을 사용한다: 사전 훈련 중에 무작위로 마스킹된 이미지 패치가 경량 디코더에 의해 재구성된다.
- 직접 비교를 가능하게 하기 위해, 동일한 영어 전용 데이터를 사용하여 BERT와 동일한 C4 데이터셋으로 사전 훈련된다.
- 微조정은 ViT 인코더 위에 분류 헤드를 추가하여 다운스트림 NLP 작업을 위해 수행된다.
- 모델은 14개의 스크립트를 포함한 32개의 언어에서 문법적 및 의미적 작업을 수행하여 평가되었으며, 태국어, 베트남어, 아랍어와 같은 비라틴 스크립트가 포함되어 있다.
실험 결과
연구 질문
- RQ1영어 전용 텍스트로 훈련된 비전 기반 언어 모델이 비라틴 스크립트를 사용하는 언어로 효과적으로 일반화할 수 있는가?
- RQ2다양한 언어 유형에 걸쳐 문법적 및 의미적 작업에서 pixel의 성능가 BERT 및 mBERT와 비교해 어떻게 되는가?
- RQ3서브워드 기반 모델에 비해 pixel이 철자 오차 및 언어적 코드 스위칭에 대해 얼마나 더 뛰어난 내성성을 보이는가?
- RQ4픽셀을 통한 시각적 표현 학습이 다국어 NLP에서 어휘 병목 현상을 완화하는가?
- RQ5의존 길이가 영어에서 pixel과 BERT 간의 문법 분석 성능 차이에 어떻게 영향을 주는가?
주요 결과
- pixel은 태국어(LAS: 50.2 vs. 35.7) 및 중국어(LAS: 54.1 vs. 46.2)와 같은 비라틴 스크립트에서 문법적 및 의미적 작업에서 BERT를 크게 능가한다.
- 라틴 스크립트에서는 pixel이 BERT보다 다소 뒤처지며, 영어에서 LAS 격차가 6.5점(77.2 vs. 83.7)으로 나타나 익숙한 스크립트에서의 성능 상충 관계가 확인된다.
- pixel은 철자 공격 및 코드 스위칭에 대해 뛰어난 내성성을 보이며, 시각적 표현 학습의 이점이 노이즈가 많은 입력에 대해 유리함을 확인한다.
- 모델는 새로운 폰트에 대한 강력한 제로샷 전이 성능를 보이며, 데이터 증강 없이도 높은 성능를 달성함으로써 내재된 시각적 일반화 능력을 보여준다.
- 영어에서 더 긴 문법적 의존성일수록 pixel과 BERT 간의 성능 격차가 커지며, 이는 pixel이 장거리 문법적 구조에서 더 어려움을 겪음을 시사한다.
- 비영어 텍스트의 약 0.05%만으로 사전 훈련되었음에도 불구하고 pixel은 다국어 작업으로 효과적으로 일반화되며, 스크립트 간 일관된 성능를 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.