[논문 리뷰] Porous Lattice-based Transformer Encoder for Chinese NER
이 논문은 중국어 NER를 위한 새로운 트랜스포머 기반 모델인 다공성 격자 인코더(PLTE)를 제안한다. PLTE는 격자 인식 자기주의 및 다공성 메커니즘을 사용하여 문자와 어휘 단어 격자를 동시에 처리함으로써 국소적 맥락 모델링을 향상시킨다. PLTE는 최신 기술보다 최대 11.4배 빠른 추론 속도를 달성하면서 성능을 향상시키며, 특히 BERT 표현과 조합할 경우 더욱 뛰어난 성능을 보인다.
Incorporating lattices into character-level Chinese named entity recognition is an effective method to exploit explicit word information. Recent works extend recurrent and convolutional neural networks to model lattice inputs. However, due to the DAG structure or the variable-sized potential word set for lattice inputs, these models prevent the convenient use of batched computation, resulting in serious inefficient. In this paper, we propose a porous lattice-based transformer encoder for Chinese named entity recognition, which is capable to better exploit the GPU parallelism and batch the computation owing to the mask mechanism in transformer. We first investigate the lattice-aware self-attention coupled with relative position representations to explore effective word information in the lattice structure. Besides, to strengthen the local dependencies among neighboring tokens, we propose a novel porous structure during self-attentional computation processing, in which every two non-neighboring tokens are connected through a shared pivot node. Experimental results on four datasets show that our model performs up to 9.47 times faster than state-of-the-art models, while is roughly on a par with its performance. The source code of this paper can be obtained from https://github.com/xxx/xxx.
연구 동기 및 목표
- 중국어 NER를 위한 레이스 기반 RNN 모델의 비효율성과 제한된 의미 상호작용 문제를 해결하기 위해.
- 레이스 LSTM 및 유사 모델에서의 순차적 처리 병목 현상과 이원방향 맥락 부족 문제를 극복하기 위해.
- 트랜스포머 기반 아키텍처에서 격자 구조 입력을 배치 기반으로 병렬 처리할 수 있도록 하기 위해.
- 이웃 토큰 간의 의존성을 강화하는 다공성 주의 메커니즘을 도입하여 NER의 국소적 맥락 모델링을 향상시키기 위해.
- PLTE가 특히 사전 학습된 BERT 표현과 통합되었을 때 뛰어난 성능과 속도를 달성함을 입증하기 위해.
제안 방법
- PLTE는 트랜스포머 인코더를 확장하여 문자와 일치하는 어휘 단어를 연결된 시퀀스에서 동시에 처리함으로써 전체 배치 기반 추론을 가능하게 한다.
- 레이스 인식 자기주의를 도입하여 Shaw 등(2018)의 영향을 받은 상대적 위치 임베딩 메커니즘을 사용해 레이스 구조에서 유도된 상대적 위치 정보를 통합한다.
- 다공성 메커니즘은 표준 완전 연결 주의를 피벗 공유 구조로 대체하며, 각 비인접 토큰 쌍은 공유 피벗을 통해 연결되어 국소적 의존성 모델링을 향상시킨다.
- 전역 주의 메커니즘을 유지하면서도 관련 국소 맥락에 집중함으로써 장거리 의존성 학습을 유지한다.
- 표준 트랜스포머에 최소한의 아키텍처 수정만으로도 엔드 투 엔드 학습 및 추론을 지원한다.
- 사전 학습된 언어 모델(예: BERT)과의 호환성을 확보하여 전이 학습을 통해 성능 향상을 더욱 가능하게 한다.
실험 결과
연구 질문
- RQ1트랜스포머 기반 아키텍처가 중국어 NER를 위한 격자 구조 입력을 효과적으로 처리하면서도 배치 기반 병렬 계산을 가능하게 할 수 있는가?
- RQ2레이스 인식 자기주의는 단방향 RNN에 비해 문자와 일치하는 어휘 단어 간의 상호작용 모델링을 어떻게 향상시키는가?
- RQ3다공성 주의 메커니즘은 문자 수준 NER 작업에서 국소적 맥락 모델링을 얼마나 향상시키는가?
- RQ4PLTE는 레이스 LSTM 및 LR-CNN과 같은 기존 레이스 기반 모델에 비해 속도와 정확도에서 어떻게 비교되는가?
- RQ5사전 학습된 BERT 표현과 PLTE를 통합하면 현재 최고 수준의 성능을 초월할 수 있는가?
주요 결과
- OneNotes 데이터셋에서 Word2vec 임베딩을 사용할 경우, PLTE는 레이스 LSTM보다 최대 11.4배, LR-CNN보다 5.11배 더 빠른 추론 속도를 기록한다.
- 4개의 벤치마크 데이터셋에서 PLTE는 여러 강력한 베이스라인 모델보다 F1 스코어에서 뛰어난 성능을 보이며, 특히 BERT 표현과 조합했을 때 두드러진 성능 향상을 보였다.
- 제거 실험 결과, 레이스 인식 자기주의를 제거할 경우 F1 스코어가 0.58%에서 3.63%까지 감소함을 확인하여 어휘 통합의 핵심적 역할을 입증했다.
- 다공성 메커니즘이 표준 주의 메커니즘 대비 일관된 성능 향상을 보이며 국소적 맥락 모델링 향상이 확인되었다.
- 이전 모델에서 볼 수 있었던 순환 계산 및 재고려 메커니즘의 제거 덕분에, 배치 크기가 1일 때에도 PLTE는 높은 효율성을 유지한다.
- BERT 임베딩으로 미세조정된 PLTE는 중국어 NER 벤치마크에서 보고된 바 가장 높은 성능을 달성하여, 사전 학습된 표현과의 호환성과 효과성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.