Skip to main content
QUICK REVIEW

[논문 리뷰] Named Entity Recognition on Twitter for Turkish using Semi-supervised Learning with Word Embeddings

Eda Okur, Hakan Demir|arXiv (Cornell University)|2018. 10. 20.
Topic Modeling참고 문헌 16인용 수 5
한 줄 요약

이 논문은 라벨이 없는 트위터 코퍼스에서 유도된 도메인 내 단어 임베딩과 언어에 종속되지 않는 특징을 활용하여 터키어 트위터 데이터에 대한 명명된 실체 인식(NER)을 위한 준지도 학습 신경망 접근법을 제안한다. 지도사전이나 언어 특화 규칙을 사용하지 않고도 두 터키어 트위터 데이터셋에서 각각 48.96%와 56.79%의 최고 성능 F-스코어를 달성하여, 수동으로 구성된 지도사전과 정규화 기반의 이전 방법들을 능가한다.

ABSTRACT

Recently, due to the increasing popularity of social media, the necessity for extracting information from informal text types, such as microblog texts, has gained significant attention. In this study, we focused on the Named Entity Recognition (NER) problem on informal text types for Turkish. We utilized a semi-supervised learning approach based on neural networks. We applied a fast unsupervised method for learning continuous representations of words in vector space. We made use of these obtained word embeddings, together with language independent features that are engineered to work better on informal text types, for generating a Turkish NER system on microblog texts. We evaluated our Turkish NER system on Twitter messages and achieved better F-score performances than the published results of previously proposed NER systems on Turkish tweets. Since we did not employ any language dependent features, we believe that our method can be easily adapted to microblog texts in other morphologically rich languages.

연구 동기 및 목표

  • 트위터와 같은 비공식적이고 형태소가 풍부한 마이크로블로그 텍스트에서 터키어 NER의 성능 저하 문제를 해결하기 위해.
  • 지역 특화 기능인 지도사전이나 대문자 규칙에 의존하지 않는 견고한 터키어 트위터 NER 시스템을 개발하기 위해.
  • 라벨이 없는 트위터 데이터에서 학습한 지역 특화 단어 임베딩이 NER 성능 향상에 기여하는지 평가하기 위해.
  • 비지도 단어 표현이 자원이 제한된 비공식 텍스트 환경에서 전통적인 텍스트 정규화보다 더 효과적인지 입증하기 위해.
  • 언어학적 자원 의존도가 낮은 형태소가 풍부한 언어에 대해 공개 가능하고 유연하게 적용 가능한 NER 시스템을 제공하기 위해.

제안 방법

  • 대규모 라벨이 없는 터키어 코퍼스(Web+Tweets)에서 단어 임베딩을 먼저 학습한 후, 라벨이 있는 데이터에 대해 신경망을 미세조정하는 이중 단계 준지도 학습 프레임워크를 사용하였다.
  • 라벨이 없는 코퍼스에서 조밀한 단어 표현을 신속하게 비지도 학습하기 위해 음성 샘플링을 사용한 스킵그램(SGNS)을 활용하였다.
  • 학습된 단어 임베딩을 언어에 종속되지 않는 특징(예: 문자 n-그램, 케이스 패턴 등)과 통합하여 비공식 텍스트에서의 일반화 능력을 향상시켰다.
  • 결합된 특징을 사용하여 시퀀스 태깅 모델(CRF 또는 피드포워드 네트워크일 가능성이 높음)을 학습시켜 트위터 트윗에서 실체 태그를 예측하였다.
  • 기준 비교로 텍스트 정규화를 적용하였지만, 단어 임베딩만으로도 더 높은 성능을 달성하는 것으로 나타났다.
  • 모델의 견고성과 일반화 능력을 평가하기 위해 작은 라벨이 있는 트위터 데이터셋에 대해 10겹 교차검증을 실시하였다.

실험 결과

연구 질문

  • RQ1라벨이 없는 터키어 트위터에서 유도된 지역 특화 단어 임베딩이 표준 사전 학습된 임베딩보다 NER 성능 향상에 기여하는가?
  • RQ2지역 특화 기능이나 언어 특화 기능을 사용하지 않는 준지도 신경망 접근법이 기존의 터키어 트위터 NER 시스템을 능가하는가?
  • RQ3비공식 언어 처리에 있어 단어 임베딩 기반 표현 학습이 텍스트 정규화보다 더 효과적인가?
  • RQ4공식 텍스트에서 학습한 모델가 비공식 트위터 데이터에 대해 재학습 없이 얼마나 잘 일반화되는가?
  • RQ5단어 임베딩과 일반 특징만으로 학습된 모델가 언어학적 자원이 극히 적은 형태소가 풍부한 언어에 대해 쉽게 적용 가능한가?

주요 결과

  • 제안된 시스템은 TwtDS-2 데이터셋에서 F-스코어 48.96%를 달성하여 Küçük와 Steinberger(2014)가 보고한 이전 최고 성능인 48.13%를 초월하였다.
  • TwtDS-1 데이터셋에서는 F-스코어 46.61%를 기록하여 동일 연구에서 이전 최고 성능인 38.01%를 뛰어넘었다.
  • 지역 특화 기능인 지도사전 또는 음절 확장 기능을 전혀 사용하지 않음에도 불구하고, 모든 이전 터키어 트위터 NER 시스템을 능가하는 성능을 보였다.
  • 웹+트위터 코퍼스에서 유도된 지역 특화 단어 임베딩을 사용한 결과, 사전 처리 단계로 텍스트 정규화를 적용한 것보다 더 높은 성능을 달성하였다.
  • 작은 지역 특화 트위터 데이터셋에서 학습함에도 불구하고 두 데이터셋 모두 최고 성능을 기록하여 비공식 텍스트로의 일반화 능력이 뛰어나다는 것을 시사한다.
  • 대문자나 케이스 특징 없이도 성능이 높게 유지되어 비공식 글쓰기 스타일에 대해 뛰어난 내성성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.