[논문 리뷰] Text Classification for Azerbaijani Language Using Machine Learning and Embedding
이 논문은 저자원 언어인 아제르바이잔어를 위한 자연어 처리(NLP) 도구의 부족을 해결하기 위해 기계학습 모델과 워드 임베딩을 사용한 텍스트 분류 시스템을 제안한다. 자체 구축한 데이터셋을 바탕으로 나이브 베이즈, 서포트 벡터 머신(SVM), 의사결정 트리를 평가하여 TF-IDF와 Word2Vec 임베딩을 사용한 SVM에서 가장 높은 정확도를 기록했으며, 뉴스 분류, 감성 분석, 스팸 필터링 등 자동 분류의 가능성을 입증한다.
Text classification systems will help to solve the text clustering problem in the Azerbaijani language. There are some text-classification applications for foreign languages, but we tried to build a newly developed system to solve this problem for the Azerbaijani language. Firstly, we tried to find out potential practice areas. The system will be useful in a lot of areas. It will be mostly used in news feed categorization. News websites can automatically categorize news into classes such as sports, business, education, science, etc. The system is also used in sentiment analysis for product reviews. For example, the company shares a photo of a new product on Facebook and the company receives a thousand comments for new products. The systems classify the comments into categories like positive or negative. The system can also be applied in recommended systems, spam filtering, etc. Various machine learning techniques such as Naive Bayes, SVM, Decision Trees have been devised to solve the text classification problem in Azerbaijani language.
연구 동기 및 목표
- 기계학습과 워드 임베딩 기반의 아제르바이잔어 전용 텍스트 분류 시스템을 개발한다.
- 기계학습 및 임베딩 기법을 적용하여 아제르바이잔어의 자동 텍스트 클러스터링 및 분류의 격차를 해소한다.
- 스포츠, 비즈니스, 교육 등 사전 정의된 카테고리로 아제르바이잔어 텍스트를 분류하는 데 효과적인 다수의 기계학습 모델을 평가한다.
- 뉴스 피드 분류, 제품 리뷰의 감성 분석, 스팸 필터링과 같은 실제 응용 분야에서의 시스템 활용 가능성을 탐색한다.
제안 방법
- 시스템은 스포츠, 비즈니스, 교육, 과학, 정치 등 카테고리로 수동으로 분류된 아제르바이잔어 텍스트로 구성된 자체 구축 데이터셋을 사용한다.
- 텍스트 전처리는 아제르바이잔어에 특화된 토큰화, 불용어 제거, 어간 추출을 포함한다.
- 특징 추출은 텍스트 데이터를 수치적으로 표현하기 위해 TF-IDF와 Word2Vec 임베딩을 사용한다.
- 나이브 베이즈, SVM, 의사결정 트리 등의 기계학습 분류기가 전처리된 데이터를 기반으로 훈련되고 평가된다.
- 모델 성능 평가는 정확도, 정밀도, 재현율, F1 점수와 같은 표준 지표를 사용하여 평가된다.
- 최고의 성능을 보인 모델은 교차 검증과 하이퍼파라미터 튜닝을 통해 선정된다.
실험 결과
연구 질문
- RQ1기존 기계학습 모델이 TF-IDF와 Word2Vec 임베딩을 활용해 아제르바이잔어 텍스트를 효과적으로 분류할 수 있는가?
- RQ2나이브 베이즈, SVM, 의사결정 트리 중 어느 기계학습 알고리즘이 아제르바이잔어 텍스트에서 가장 높은 분류 정확도를 달성하는가?
- RQ3TF-IDF와 Word2Vec과 같은 다양한 특징 표현 방법이 아제르바이잔어 텍스트 분류 성능에 미치는 영향은 어떠한가?
- RQ4제안된 시스템이 뉴스 분류 및 아제르바이잔어 감성 분석과 같은 실질적 응용 분야에서 얼마나 유용한가?
주요 결과
- SVM가 평가된 모델들 중에서 가장 높은 분류 정확도를 기록했으며, 나이브 베이즈와 의사결정 트리보다 뛰어난 성능을 보였다.
- TF-IDF와 Word2Vec 임베딩의 조합은 단독으로 사용할 경우보다 모델의 일반화 능력과 성능 향상을 이끌어냈다.
- 나이브 베이즈는 중간 수준의 성능를 보였지만, 아제르바이잔어의 복잡한 문장 구조 처리에서는 SVM에 비해 떨어졌다.
- 시스템은 자동 뉴스 피드 분류 및 제품 리뷰의 감성 분류와 같은 실질적 응용 분야에서 실용적인 가능성을 입증했다.
- 적절한 전처리 및 임베딩 전략을 적용할 경우, 기계학습 기반의 텍스트 분류가 저자원 언어인 아제르바이잔어에도 적용 가능하다는 것이 결과적으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.