Skip to main content
QUICK REVIEW

[논문 리뷰] N-gram and Neural Language Models for Discriminating Similar Languages

Andre Cianflone, Leila Kosseim|arXiv (Cornell University)|2017. 08. 11.
Authorship Attribution and Profiling참고 문헌 13인용 수 3
한 줄 요약

이 논문은 2016년 DSL 공동 과제에서 유사 언어를 식별하기 위해 문자 기반 n-그램 및 양방향 LSTM를 갖춘 합성곱 신경망(CLSTM) 모델을 평가한다. n-그램 모델은 88.45%의 정확도를 기록하여 7위를 차지했고, CLSTM 모델은 최소한의 튜닝으로도 78.45%의 정확도를 달성하여, 훈련 데이터가 제한된 상황에서 전통적인 n-그램 모델이 초기 신경망 모델보다 우수한 성능을 보임을 시사한다.

ABSTRACT

This paper describes our submission (named clac) to the 2016 Discriminating Similar Languages (DSL) shared task. We participated in the closed Sub-task 1 (Set A) with two separate machine learning techniques. The first approach is a character based Convolution Neural Network with a bidirectional long short term memory (BiLSTM) layer (CLSTM), which achieved an accuracy of 78.45% with minimal tuning. The second approach is a character-based n-gram model. This last approach achieved an accuracy of 88.45% which is close to the accuracy of 89.38% achieved by the best submission, and allowed us to rank #7 overall.

연구 동기 및 목표

  • 유사 언어를 식별하는 데에 문자 기반 n-그램 및 신경망 모델의 효과성을 평가하는 것.
  • 저자료 환경에서 CLSTM와 같은 깊은 신경망 모델이 언어 다양성 식별 과제에서 전통적인 n-그램 모델을 능가할 수 있는지 평가하는 것.
  • 특히 스페인어 다양체와 프랑스어 어색을 포함한 밀접하게 관련된 언어를 구별하는 데의 과제를 조사하는 것.
  • 이름 있는 실체가 언어 식별 성능에 상당한 영향을 미치는지 확인하는 것.
  • 언어적 애너테이션 없이도 원시 텍스트를 사용하여 언어 식별 모델을 훈련시키는 것이 가능한지 탐색하는 것.

제안 방법

  • 닫힌 트랙 제출을 위해 DSL 2016 신문 코퍼스(Set A)를 대상으로 n=7인 문자 기반 n-그램 모델을 훈련시켰다.
  • 1D 합성곱 층과 양방향 LSTM 층을 조합한 하이브리드 CLSTM 모델을 구현하여 원시 문자 시퀀스를 처리했다.
  • n-그램 모델은 문자 레벨 빈도 벡터를 특징으로 사용하고, SVM 분류를 적용했다.
  • CLSTM 모델은 언어학적 전처리 없이 문자 레벨 입력에서부터 엔드 투 엔드로 훈련되었다.
  • 두 모델 모두 DSL 2016 공동 과제의 동일한 보류된 테스트 세트에서 평가되었다.
  • 모델 성능은 스페인어 지역 다양체, 프랑스어, 기타 국가별 변형 포함 총 12개 언어 다양체에서 매크로 F1 및 정확도로 측정되었다.

실험 결과

연구 질문

  • RQ1제한된 훈련 데이터로 문자 기반 n-그램 모델이 유사 언어 식별에서 높은 정확도를 달성할 수 있는가?
  • RQ2훈련 데이터가 부족한 상황에서 CLSTM 모델이 언어 식별 과제에서 전통적인 n-그램 모델을 능가하는가?
  • RQ3특히 스페인어와 프랑스어처럼 밀접하게 관련된 다양체들 사이에서 오분류가 어떻게 분포하는가?
  • RQ4이름 있는 실체가 유사 언어 식별 과제에서 언어 식별 성능에 어느 정도의 영향을 미치는가?
  • RQ5유사 언어 다양체를 구별하기 위해 이중 단계 계층적 분류 접근이 필수적인가?

주요 결과

  • 문자 기반 n-그램 모델은 DSL 2016 공동 과제의 닫힌 트랙에서 참가자 17명 중 7위를 기록하며 88.45%의 정확도를 달성했다.
  • CLSTM 모델은 최소한의 초모델 하이퍼파라미터 튜닝으로도 78.45%의 정확도를 기록했지만, n-그램 기반 모델에 비해 뚜렷이 열등한 성능을 보였다.
  • n-그램 모델은 모든 언어 그룹에서 뛰어난 성능를 보였으며, F1 점수는 0.70에서 0.95 사이로 변동했고, 말레이어와 인донี시아어에서 가장 정확도가 높아 F1=0.99를 기록했다.
  • CLSTM 모델은 스페인어 다양체, 특히 멕시코 스페인어에서 가장 어려움을 겪었으며, F1 점수는 단지 0.46에 그쳐 스페인어 어색 간 혼동이 높다는 것을 시사했다.
  • 언어 그룹 간 오분류가 흩어져 있고 통계적으로 유의미하지 않아, 계층적 이중 단계 접근이 반드시 필요하지 않다는 것을 시사한다.
  • 놀랍게도, 훈련 데이터에서 이름 있는 실체를 제거했더니 정확도가 오직 1~2%p 뿐 감소하여, 이름 있는 실체가 주요 식별 신호가 아니라는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.