Skip to main content
QUICK REVIEW

[논문 리뷰] Automated Phrase Mining from Massive Text Corpora

Jingbo Shang, Jialu Liu|arXiv (Cornell University)|2017. 02. 15.
Topic Modeling인용 수 12
한 줄 요약

이 논문은 인간 레이블이 필요 없이 일반 지식 기반 데이터베이스(예: 위키백과)에서 고품질 어구를 활용하여 원거리 지도 학습을 수행하는 완전 자동화된 어구 추출 프레임워크인 AutoPhrase를 제안한다. 인간 레이블이 필요한 데이터 없이도 성능을 향상시키기 위해 양성 전용 원거리 학습 및 품사 품질 지도 기반 어구 분할 기법을 도입하여 다양한 도메인과 언어에서 성능을 향상시켰으며, 기존 최고 수준의 방법에 비해 재현율과 효율성에서 뚜렷한 향상을 이뤘다.

ABSTRACT

As one of the fundamental tasks in text analysis, phrase mining aims at extracting quality phrases from a text corpus. Phrase mining is important in various tasks such as information extraction/retrieval, taxonomy construction, and topic modeling. Most existing methods rely on complex, trained linguistic analyzers, and thus likely have unsatisfactory performance on text corpora of new domains and genres without extra but expensive adaption. Recently, a few data-driven methods have been developed successfully for extraction of phrases from massive domain-specific text. However, none of the state-of-the-art models is fully automated because they require human experts for designing rules or labeling phrases. Since one can easily obtain many quality phrases from public knowledge bases to a scale that is much larger than that produced by human experts, in this paper, we propose a novel framework for automated phrase mining, AutoPhrase, which leverages this large amount of high-quality phrases in an effective way and achieves better performance compared to limited human labeled phrases. In addition, we develop a POS-guided phrasal segmentation model, which incorporates the shallow syntactic information in part-of-speech (POS) tags to further enhance the performance, when a POS tagger is available. Note that, AutoPhrase can support any language as long as a general knowledge base (e.g., Wikipedia) in that language is available, while benefiting from, but not requiring, a POS tagger. Compared to the state-of-the-art methods, the new method has shown significant improvements in effectiveness on five real-world datasets across different domains and languages.

연구 동기 및 목표

  • 인간의 노력과 언어학적 적응을 최소화하는 완전 자동화된 어구 추출 프레임워크를 개발하는 것.
  • 비용이 많이 들거나 복잡한 언어학적 분석 도구에 의존하는 기존 방법의 한계를 해결하는 것.
  • 도메인 특화 학습 데이터가 필요 없이 다양한 도메인과 다국어 환경에서 어구 추출 성능을 향상시키는 것.
  • 기존 방법이 자주 간과하는 고품질의 단어어구(예: 'UIUC', 'USA')를 포함시켜 재현율을 향상시키는 것.
  • 강력한 원거리 학습과 병렬 인덱싱 전략을 통해 확장성과 효율성을 높이는 것.

제안 방법

  • AutoPhrase는 위키백과와 같은 일반 지식 기반 데이터베이스에서 고품질 어구를 양성 레이블로 활용하는 양성 전용 원거리 학습 전략을 사용하여 수동 레이블링을 피한다.
  • 대상 도메인 코퍼스에서 음성 레이블을 구성하고, 다수의 독립된 기본 분류기의 예측을 통합하여 노이즈를 감소시킨다.
  • 사전에 학습된 품사 태거가 이용 가능한 경우, 품사 태그를 활용해 어구 경계 탐지를 향상시키는 품사 지도 기반 어구 분할 모델을 구축한다.
  • 해당 언어에 일반 지식 기반 데이터베이스가 존재하는 한 어떤 언어도 지원 가능하여 다국어 어구 추출을 가능하게 한다.
  • 인기도, 정보량, 독립성 기준을 적용하여 고품질의 단어어구를 포함시키며, 독립성을 측정하기 위해 수정된 빈도 비율을 사용한다.
  • 효율적인 인덱싱 및 병렬 처리 전략을 적용하여, SegPhrase와 같은 이전 방법 대비 최대 11배의 속도 향상과 80–86%의 메모리 감소를 달성한다.

실험 결과

연구 질문

  • RQ1인간이 레이블링한 어구나 복잡한 언어학적 도구 없이도 어구 추출을 완전히 자동화할 수 있는가?
  • RQ2저자원 도메인에서 어구 추출에 있어 일반 지식 기반 데이터베이스를 양성 학습 신호로 활용할 경우의 효과는 어떠한가?
  • RQ3다국어 환경에서 품사 태그 정보를 통합할 경우 어구 경계 탐지 정확도는 어느 정도 향상되는가?
  • RQ4고품질의 단어어구를 포함시킬 경우 어구 추출의 전체 재현율에 어떤 영향을 미치는가?
  • RQ5기존 최고 수준의 방법과 비교해 AutoPhrase는 다양한 도메인과 언어에서 어떻게 확장 가능한가?

주요 결과

  • AutoPhrase는 영어, 스페인어, 중국어에서 실용적인 다섯 개의 데이터셋에서 재현율을 크게 향상시켰으며, 고품질의 단어어구를 포함시킬 경우 재현율이 10–30% 증가했다.
  • 'UIUC'와 'USA'와 같은 단어어구의 포함은 특히 중국어에서 토큰화 후 이러한 어구가 흔하기 때문에 재현율을 크게 향상시켰다.
  • 단어어구 지원 기능이 포함된 AutoPhrase+는 중국어에서 특히 초기 재현율 단계에서 AutoPhrase를 능가했으며, 특정 언어에서 단어어구의 중요성을 입증했다.
  • 최적화된 인덱싱과 병렬 처리 덕분에 AutoPhrase는 메모리 사용량을 80–86% 감소시키고 실행 시간을 최대 11배 향상시켰다.
  • 위키백과와 같은 지식 기반 데이터베이스를 활용한 강력한 양성 전용 원거리 학습은 수동 레이블링이 필요 없이도 다양한 도메인과 언어에서 높은 성능을 유지한다.
  • 사전에 학습된 품사 태거가 이용 가능한 경우, 품사 지도 기반 어구 분할은 정확도를 향상시키지만 도메인 독립성을 해치지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.