Skip to main content
QUICK REVIEW

[논문 리뷰] A Hidden Markov Model Based System for Entity Extraction from Social Media English Text at FIRE 2015

Kamal Sarkar|arXiv (Cornell University)|2015. 12. 12.
Natural Language Processing Techniques참고 문헌 10인용 수 6
한 줄 요약

이 논문은 영어 소셜 미디어 텍스트에서 엔티티 추출을 위한 트리그램 히든 마르코프 모델(HMM) 기반 시스템을 제안한다. 지도어록 목록(gazetteer lists), 품사 태그(POS tags), 및 워드 레벨 특징을 활용하여 알려진 및 알려지지 않은 토큰 모두의 관측 확률을 향상시킨다. 이 시스템은 FIRE 2015 영어 데이터셋에서 F1 스코어 48.21을 기록하여 영어 언어 과제의 다른 참가자들보다 뛰어난 성능을 보였다.

ABSTRACT

This paper presents the experiments carried out by us at Jadavpur University as part of the participation in FIRE 2015 task: Entity Extraction from Social Media Text - Indian Languages (ESM-IL). The tool that we have developed for the task is based on Trigram Hidden Markov Model that utilizes information like gazetteer list, POS tag and some other word level features to enhance the observation probabilities of the known tokens as well as unknown tokens. We submitted runs for English only. A statistical HMM (Hidden Markov Models) based model has been used to implement our system. The system has been trained and tested on the datasets released for FIRE 2015 task: Entity Extraction from Social Media Text - Indian Languages (ESM-IL). Our system is the best performer for English language and it obtains precision, recall and F-measures of 61.96, 39.46 and 48.21 respectively.

연구 동기 및 목표

  • 노이즈가 많고 비공식적인 영어 소셜 미디어 텍스트에 특화된 강력한 엔티티 추출 시스템을 개발하기 위해.
  • 소셜 미디어에서 어휘 변동성과 OOV(Out-of-Vocabulary) 단어로 인한 정밀도와 재현율 저하 문제를 해결하기 위해.
  • 통계적 HMM 프레임워크에 다수의 언어학적 특징을 통합하여 인식 성능을 향상시키기 위해.
  • 인도어 언어를 대상으로 한 FIRE 2015 벤치마크 과제에 참가하고 영어 과제에서 최상의 성능을 달성하기 위해.

제안 방법

  • 엔티티 레이블의 순서를 모델링하기 위해 트리그램 HMM을 사용하여 토큰 시퀀스의 장거리 의존성을 포착하였다.
  • 관측 확률을 향상시키기 위해 지도어록 목록, 품사(POS) 태그 및 기타 워드 레벨 특징을 활용하였다.
  • 알려진 토큰과 알려지지 않은 토큰을 모두 모델링하는 조합 방식을 사용하였으며, 알려지지 않은 토큰은 형태소적 및 맥락적 신호에 기반한 확률을 할당하였다.
  • 대문자, 구두점, 단어 형태와 같은 특징을 사용하여 OOV 엔티티의 인식을 향상시켰다.
  • 표준 HMM 디코딩과 비터비 알고리즘을 사용하여 FIRE 2015 ESM-IL 데이터셋에서 모델을 학습하고 테스트하였다.
  • 인도어 언어에 대한 적응 없이, FIRE 2015 과제의 영어 언어 서브셋에 최적화된 시스템을 구현하였다.

실험 결과

연구 질문

  • RQ1노이즈가 많고 비공식적인 영어 소셜 미디어 텍스트에서 트리그램 HMM 모델이 명시적 엔티티 추출에 효과적으로 기여할 수 있는가?
  • RQ2지역어록, 품사 태그 및 워드 레벨 특징의 통합이 자원이 제한된, OOV 상황에서의 엔티티 인식 성능에 어떻게 기여하는가?
  • RQ3통계적 HMM 기반 접근 방식이 FIRE 2015 엔티티 추출 벤치마크에서 기준 시스템보다 얼마나 뛰어나게 성능을 발휘할 수 있는가?
  • RQ4HMM를 사용한 소셜 미디어 텍스트에서의 엔티티 추출에서 정밀도와 재현율 간의 성능 트레이드오프는 어느 정도인가?

주요 결과

  • 제안된 HMM 기반 시스템은 FIRE 2015 ESM-IL 과제의 영어 테스트 세트에서 F1 스코어 48.21을 기록하였다.
  • 시스템은 정밀도 61.96%와 재현율 39.46%를 기록하여 중간 수준의 재현율을 희생하면서도 정밀도에 중점을 두었다.
  • 지역어록 목록과 품사 태그의 통합은 특히 알려지지 않은 또는 희귀 토큰에 대해 엔티티 식별 능력을 크게 향상시켰다.
  • 트리그램 HMM 아키텍처는 더 단순한 HMM 변종보다 우수한 시퀀스 모델링 성능을 제공하여 레이블 일관성을 향상시켰다.
  • 이 시스템은 FIRE 2015 벤치마크의 모든 참가자들 중 영어 언어 과제에서 최고 성능을 기록한 엔트리였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.