Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Better Internal Structure of Words for Sequence Labeling

Yingwei Xin, Ethan Hart|arXiv (Cornell University)|2018. 10. 29.
Topic Modeling참고 문헌 23인용 수 8
한 줄 요약

이 논문은 다운샘플링이 없는 펌프형 넓은 컨volution 신경망인 IntNet을 제안한다. 이는 문자 수준 표현에서 더 풍부한 내부 단어 구조를 학습하기 위해 설계되었으며, 얕거나 깊은 좁은 아키텍처보다 다중 척도 서브워드 패턴을 더 효과적으로 포착함으로써 시퀀스 태깅 작업에서 최신 기술 수준(SOTA) 성능을 달성한다. 외부 자원이나 수작업 특징 없이도 네덜란드어와 스페인어에서 OOV 단어의 F1 점수를 2% 이상 향상시킨다.

ABSTRACT

Character-based neural models have recently proven very useful for many NLP tasks. However, there is a gap of sophistication between methods for learning representations of sentences and words. While most character models for learning representations of sentences are deep and complex, models for learning representations of words are shallow and simple. Also, in spite of considerable research on learning character embeddings, it is still not clear which kind of architecture is the best for capturing character-to-word representations. To address these questions, we first investigate the gaps between methods for learning word and sentence representations. We conduct detailed experiments and comparisons of different state-of-the-art convolutional models, and also investigate the advantages and disadvantages of their constituents. Furthermore, we propose IntNet, a funnel-shaped wide convolutional neural architecture with no down-sampling for learning representations of the internal structure of words by composing their characters from limited, supervised training corpora. We evaluate our proposed model on six sequence labeling datasets, including named entity recognition, part-of-speech tagging, and syntactic chunking. Our in-depth analysis shows that IntNet significantly outperforms other character embedding models and obtains new state-of-the-art performance without relying on any external knowledge or resources.

연구 동기 및 목표

  • 문자 기반의 CNN 모델이 단어 표현에 쓰일 때와 문장 표현에 쓰일 때의 격차를 조사하기 위해.
  • 유사한 목표를 가짐에도 불구하고 현재의 문자-단어 모델이 문장 수준의 모델보다 더 단순하고 덜 정교한 이유를 규명하기 위해.
  • 시퀀스 태깅 작업을 위한 최신 기술 수준의 문자 임베딩 모델 간의 성능 차이를 평가하기 위해.
  • 문자에서 내부 단어 구조를 포착하기 위한 최적의 신경망 아키텍처—깊은 vs. 얕은, 넓은 vs. 좁은—를 결정하기 위해.
  • 외부 자원이나 특징 공학 없이도 희귀어 및 보편 외어(OOV) 단어에서 성능을 향상시키는 문자 수준 모델을 개발하기 위해.

제안 방법

  • 다양한 커널 크기를 사용하고 다운샘플링 없이 다양한 수준의 특징을 연결함으로써 순차적 패턴을 유지하는, 펌프형 넓은 컨volution 신경망인 IntNet을 제안한다.
  • 다양한 길이의 서브워드 패턴(예: 접두사, 접미사, 형태소 등)을 넓은 수신장으로 포착하기 위해 다중 척도 컨볼루션 아키텍처를 사용한다.
  • 컨텍스트 기반의 단어 수준 표현을 공동으로 모델링하고 시퀀스 레이블을 예측하기 위해 IntNet과 LSTM-CRF 레이어를 결합한다.
  • 제한된 지도 학습 데이터 코퍼스를 고려해 과적합을 방지하기 위해 학습 중 조기 정지 기법을 사용한다.
  • 문자 수준 전처리, 외부 지식, 수작업 특징을 모두 사용하지 않으며, 순수하게 원시 문자 시퀀스에 의존한다.
  • 교차 엔트로피 손실과 역전파를 사용하여 표준 시퀀스 태깅 데이터셋에서 엔드 투 엔드로 모델을 학습시킨다.

실험 결과

연구 질문

  • RQ1왜 문자 기반의 단어 모델과 문장 모델 간의 아키텍처 정교성에 격차가 존재하는가? 이 격차는 어떻게 메울 수 있는가?
  • RQ2최신 기술 수준의 문자 임베딩 모델(예: char-CNN, char-LSTM)이 단어 수준 표현을 학습하는 데 있어 성능적으로 어떻게 비교되는가?
  • RQ3문자에서 내부 단어 구조를 학습하는 데 있어 깊은 좁은 아키텍처와 얕은 넓은 아키텍처 중 어느 것이 더 낫단 말인가?
  • RQ4다운샘플링을 생략하면 단어의 접두사나 접미사 같은 순차적 패턴을 더 잘 모델링할 수 있는가?
  • RQ5외부 지식, 수작업 특징, 또는 공동 학습 없이도 문자 수준 모델이 최신 기술 수준 성능을 달성할 수 있는가?

주요 결과

  • IntNet은 NER, POS 태깅, 문법적 체크닝을 포함한 여섯 개의 시퀀스 태깅 데이터셋에서 char-CNN 및 char-LSTM 모두를 뛰어넘는 성능을 보였다.
  • OOV 단어에서 IntNet은 네덜란드어 및 독일어 데이터셋에서 기준 모델 대비 F1 점수를 3% 이상 향상시켰으며, 희귀어 및 미리보지 않은 단어에 대한 일반화 능력이 뛰어나다는 것을 입증했다.
  • 네덜란드어 및 스페인어와 같은 비영어 데이터셋에서 IntNet은 이전 최신 기술 수준 성능을 2% 이상 초월하여 다양한 언어에서의 강건성을 입증했다.
  • IntNet은 char-CNN 및 char-LSTM보다 수렴 속도가 느리지만, 더 복잡한 표현을 학습한다는 것을 시사하며, 과적합을 줄이기 위해 조기 정지를 통해 유의미한 이점을 얻는다.
  • 이웃 최소 거리 분석을 통해 OOV 환경에서 '11-month'과 'xx-month'과 같은 단어 형태 패턴을 더 잘 학습하는 것으로 나타났다.
  • char-CNN보다 학습 속도가 약 20% 느리지만, 추론 속도는 유사하고 문장 수준 모델보다 파rameter 수가 적어 시퀀스 태깅에 있어 효율적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.