Skip to main content
QUICK REVIEW

[논문 리뷰] KeyXtract Twitter Model - An Essential Keywords Extraction Model for Twitter Designed using NLP Tools

Tharindu Cyril Weerasooriya, Nandula Perera|arXiv (Cornell University)|2017. 08. 09.
Advanced Text Analysis Techniques참고 문헌 14인용 수 4
한 줄 요약

이 논문은 텍스트가 짧고 노이즈가 많아서 어려운 트위터에서 핵심 키워드를 추출하는 데 목적이 있는 규칙 기반 키워드 추출 모델인 KeyXtract을 제안한다. 이 모델은 스탠퍼드 코어엔엘의 품사 태깅 도구에 도메인 특화된 트위터 모델을 통합하여 정확도를 향상시킨다. 두 단계로 구성된 시스템에서 명명된 실체 인식(Named Entity Recognition)과 어형화(Lemmatization)를 통합함으로써 F1 스코어는 0.69에서 0.77로, 튜링 테스트 통과율은 50%에서 83.33%로 향상된다.

ABSTRACT

Since a tweet is limited to 140 characters, it is ambiguous and difficult for traditional Natural Language Processing (NLP) tools to analyse. This research presents KeyXtract which enhances the machine learning based Stanford CoreNLP Part-of-Speech (POS) tagger with the Twitter model to extract essential keywords from a tweet. The system was developed using rule-based parsers and two corpora. The data for the research was obtained from a Twitter profile of a telecommunication company. The system development consisted of two stages. At the initial stage, a domain specific corpus was compiled after analysing the tweets. The POS tagger extracted the Noun Phrases and Verb Phrases while the parsers removed noise and extracted any other keywords missed by the POS tagger. The system was evaluated using the Turing Test. After it was tested and compared against Stanford CoreNLP, the second stage of the system was developed addressing the shortcomings of the first stage. It was enhanced using Named Entity Recognition and Lemmatization. The second stage was also tested using the Turing test and its pass rate increased from 50.00% to 83.33%. The performance of the final system output was measured using the F1 score. Stanford CoreNLP with the Twitter model had an average F1 of 0.69 while the improved system had a F1 of 0.77. The accuracy of the system could be improved by using a complete domain specific corpus. Since the system used linguistic features of a sentence, it could be applied to other NLP tools.

연구 동기 및 목표

  • 140자 제한으로 인해 짧고 모호하며 노이즈가 많은 트위터 콘텐츠에서 의미 있는 키워드를 추출하는 데 도전하는 것.
  • 일반적인 NLP 도구가 소셜 미디어에서 흔히 볼 수 있는 도메인 특화 및 비공식적인 언어를 처리하는 데 한계가 있다는 점을 극복하는 것.
  • 언어학적 특징과 도메인 특화 코퍼스를 활용하여 트위터에 특화된 강력한 규칙 기반 키워드 추출 시스템을 개발하는 것.
  • 언어학적 전처리와 튜링 테스트를 통한 평가를 반복적으로 적용하여 키워드 추출 성능을 향상시키는 것.
  • 정량적 지표인 F1 스코어와 인간 평가를 통한 튜링 테스트를 통해 시스템의 효과성을 입증하는 것.

제안 방법

  • 통신 기업의 트위터 프로필에서 수집한 도메인 특화 코퍼스를 활용해 시스템을 훈련하고 평가했다.
  • 스탠퍼드 코어엔엘의 품사 태깅 도구에 트위터 모델을 적용하여 명사구와 동사구를 초기 키워드 후보로 식별했다.
  • 노이즈를 걸러내고 품사 태거가 놓친 추가 키워드를 추출하기 위해 규칙 기반 파서를 적용했다.
  • 두 번째 단계에서 명명된 실체 인식(Named Entity Recognition)과 어형화(Lemmatization)를 통합하여 의미적 정확도를 향상시켰다.
  • 시스템 성능을 평가하기 위해 튜링 테스트를 수행하여 시스템 출력이 인간이 작성한 키워드와 얼마나 유사한지 인간의 인식을 비교했다.
  • 최종 성능을 측정하기 위해 키워드 추출의 F1 스코어를 측정하였으며, 기준 모델인 스탠퍼드 코어엔엘 모델과 비교하여 KeyXtract 시스템의 성능을 평가했다.

실험 결과

연구 질문

  • RQ1규칙 기반 키워드 추출 시스템이 짧고 비공식적인 트위터 텍스트에서 핵심 키워드를 추출하는 데 있어 표준 NLP 도구를 능가할 수 있는가?
  • RQ2도메인 특화 코퍼스와 언어학적 전처리를 통합할 경우 트위터에서의 키워드 추출 정확도가 어느 정도 향상되는가?
  • RQ3명명된 실체 인식과 어형화의 통합이 시스템이 인간처럼 키워드를 생성하는 데 미치는 영향은 어떠한가?
  • RQ4튜링 테스트는 소셜 미디어 환경에서 키워드 추출 시스템의 평가에 유효한 지표가 될 수 있는가?
  • RQ5기본 NLP 모델에 도메인 특화 및 언어학적 개선을 적용했을 때 F1 스코어의 측정 가능한 향상 수준는 얼마인가?

주요 결과

  • KeyXtract 시스템은 F1 스코어가 기존 스탠퍼드 코어엔엘 모델(트위터 모델 사용 시)의 0.69에서 개선된 0.77로 상당한 향상을 이룩했다.
  • 두 번째 단계 개선 후 튜링 테스트 통과율이 50.00%에서 83.33%로 상승하여 인간과 유사한 출력 품질이 향상되었음을 시사한다.
  • 명명된 실체 인식과 어형화의 통합은 시스템이 의미적으로 관련 있는 키워드를 추출하는 능력을 크게 향상시켰다.
  • 도메인 특화 코퍼스의 사용은 성능 향상에 결정적인 역할을 하였으며, 더 포괄적인 도메인 코퍼스를 활용할 경우 정확도를 더욱 높일 수 있음을 시사한다.
  • 규칙 기반 접근과 언어학적 특징의 조합은 짧은 소셜 미디어 텍스트의 노이즈와 모호성 처리에 효과적이었다.
  • POS 태그, NER, 어형화와 같은 표준 언어학적 특징에 의존함으로써 시스템 설계가 다른 NLP 도구와의 통합이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.