Skip to main content
QUICK REVIEW

[논문 리뷰] Word Embedding based New Corpus for Low-resourced Language: Sindhi

Wazir Ali, Jay Kumar|arXiv (Cornell University)|2019. 11. 28.
Topic Modeling참고 문헌 38인용 수 6
한 줄 요약

이 논문은 웹 스크래핑을 통해 수집하고 철저히 전처리한 노이즈가 많은 데이터를 다루기 위한 대규모 6100만 단어의 신디어 코퍼스를 소개한다. 이 코퍼스를 바탕으로 최신 기술인 스킵그램, CBOW, GloVe 모델을 사용해 고품질의 워드 임베딩을 훈련시켰다. 제안된 임베딩은 내재 평가에서 기존의 SdfastText 표현보다 뛰어난 성능을 보였으며, 스킵그램 모델이 의미 유사도 및 단어 유사도 작업에서 최고의 성능을 기록하여 저자원 신디어 NLP 분야에서의 중대한 발전을 이룩했다.

ABSTRACT

Representing words and phrases into dense vectors of real numbers which encode semantic and syntactic properties is a vital constituent in natural language processing (NLP). The success of neural network (NN) models in NLP largely rely on such dense word representations learned on the large unlabeled corpus. Sindhi is one of the rich morphological language, spoken by large population in Pakistan and India lacks corpora which plays an essential role of a test-bed for generating word embeddings and developing language independent NLP systems. In this paper, a large corpus of more than 61 million words is developed for low-resourced Sindhi language for training neural word embeddings. The corpus is acquired from multiple web-resources using web-scrappy. Due to the unavailability of open source preprocessing tools for Sindhi, the prepossessing of such large corpus becomes a challenging problem specially cleaning of noisy data extracted from web resources. Therefore, a preprocessing pipeline is employed for the filtration of noisy text. Afterwards, the cleaned vocabulary is utilized for training Sindhi word embeddings with state-of-the-art GloVe, Skip-Gram (SG), and Continuous Bag of Words (CBoW) word2vec algorithms. The intrinsic evaluation approach of cosine similarity matrix and WordSim-353 are employed for the evaluation of generated Sindhi word embeddings. Moreover, we compare the proposed word embeddings with recently revealed Sindhi fastText (SdfastText) word representations. Our intrinsic evaluation results demonstrate the high quality of our generated Sindhi word embeddings using SG, CBoW, and GloVe as compare to SdfastText word representations.

연구 동기 및 목표

  • 신디어는 어순이 풍부하고 여러 스크립트를 사용하는 저자원 언어이지만, 대규모 고품질의 레이블이 없는 코퍼스가 부족한 문제를 해결하기 위해.
  • 오픈소스 신디어 NLP 도구가 부족한 상황에서 웹에서 수집한 텍스트의 노이즈를 제거하기 위한 체계적인 전처리 파이프라인을 개발하기 위해.
  • 최신 워드 임베딩 모델(Skip-gram, CBOW, GloVe)을 새로 구축한 신디어 코퍼스에 훈련 및 평가하여 더 나은 의미 표현을 확보하기 위해.
  • 최초로 신디어로 번역된 코사인 유사도 및 WordSim-353를 사용하여 신디어 워드 임베딩의 내재 평가 기준을 제공하기 위해.
  • POS 태깅, NER, BERT 유사 모델을 통한 컨텍스트 임베딩 등 향후 신디어 NLP 작업을 위한 기반을 마련하기 위해.

제안 방법

  • 공개된 코퍼스가 제한된 상황에서 웹 스크래핑 프레임워크를 사용해 다양한 웹 소스에서 6100만 단어의 신디어 코퍼스를 수집하였다.
  • 웹에서 수집한 데이터에서 노이즈, 비신디어, 손상된 텍스트를 걸러내기 위해 맞춤형 전처리 파이프라인을 설계 및 적용하여 코퍼스 품질을 확보하였다.
  • 청결한 코퍼스에 대해 세 가지 최신 기술 모델인 스킵그램(SG), 연속 백터 오브 워드(CBOW), GloVe를 사용해 워드 임베딩을 훈련시켰다.
  • 의미 유사도 성능 평가를 위해 코사인 유사도 행렬과 신디어로 번역된 WordSim-353 데이터셋을 활용한 내재 평가를 실시하였다.
  • 공정한 비교를 위해 동일한 평가 프rotocol를 사용해 생성된 임베딩을 최근 발표된 SdfastText 모델과 비교하였다.
  • 창문 크기, 학습률, 에포크 수 등 하이퍼파라미터를 최적화하여 임베딩 품질을 극대화하였으며, 코퍼스 크기와 전처리의 중요성을 강조하였다.

실험 결과

연구 질문

  • RQ1대규모 웹 기반으로 수집하고 철저히 전처리한 신디어 코퍼스는 기존의 저자원 기준 모델보다 더 높은 품질의 워드 임베딩을 도출할 수 있는가?
  • RQ2스킵그램, CBOW, GloVe 모델은 SdfastText에 비해 신디어에서 의미적 및 문법적 관계를 얼마나 잘 포착하는가?
  • RQ3스킵그램과 CBOW에서의 문자 수준 학습 및 서브샘플링은 저자원 환경에서 GloVe에 비해 의미 표현을 얼마나 향상시키는가?
  • RQ4코퍼스의 크기와 정제가 신디어 워드 임베딩의 내재 평가 성능에 상당한 영향을 미치는가?
  • RQ5제안된 임베딩은 텍스트 분류 및 WordNet 구축과 같은 후속 NLP 작업을 위한 강력한 베이스라인으로 활용될 수 있는가?

주요 결과

  • 제안된 코퍼스는 6100만 개 이상의 토큰과 908,456개의 고유어를 포함하고 있으며, SdfastText 훈련 코퍼스보다 크게 확장되었다.
  • 모든 내재 평가 지표에서 스킵그램 모델이 가장 높은 성능을 기록했으며, 이는 최근 이웃, 단어 쌍 유사도, WordSim-353 등에서 모두 뛰어난 성능을 보였다.
  • CBOW 임베딩은 스킵그램에 매우 가까운 성능을 보이며 강력한 의미 포착 능력을 보였고, 반면 GloVe는 더 낮은 성능을 보였는데, 이는 문자 수준 학습과 서브샘플링 기능의 부재 때문일 가능성이 높다.
  • SdfastText가 서브워드 정보를 사용하고 있음에도 불구하고, 제안된 워드 임베딩은 모든 평가 지표에서 SdfastText를 뛰어넘었으며, 이는 코퍼스 크기와 전처리의 영향을 강력하게 보여준다.
  • 하이퍼파라미터 튜닝, 특히 창문 크기, 학습률, 에포크 수가 임베딩 품질에 상당한 영향을 미쳤으며, 최적의 설정이 성능 향상에 기여했다.
  • 코퍼스와 임베딩은 공개되었으며, 정지어 목록까지 포함되어 있어 향후 POS 태깅, NER, 컨텍스트 임베딩 연구에 기여할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.