Skip to main content
QUICK REVIEW

[논문 리뷰] Document Embedding for Scientific Articles: Efficacy of Word Embeddings vs TFIDF

H. Meijer, Joanne Truong|arXiv (Cornell University)|2021. 07. 11.
Topic Modeling참고 문헌 26인용 수 7
한 줄 요약

이 연구는 Scopus에서 확보한 7000만 건의 논문 코퍼스를 바탕으로 과학 논문의 내용을 모델링하기 위해 워드임베딩과 TFIDF를 평가한다. 트레이닝된 word2vec 임베딩은 짧은 텍스트인 제목에서 TFIDF를 능가하지만, 더 긴 텍스트인 초록에서는 TFIDF가 약간 더 뛰어나지만 메모리 사용량이 3.7배 많고 계산 시간이 최대 184배 느리기 때문에 온라인 사용에선 임베딩이 더 효율적이다. 저널 임베딩의 시각화 결과 관련 저널들이 의미 있는 군집을 이룬다.

ABSTRACT

Over the last few years, neural network derived word embeddings became popular in the natural language processing literature. Studies conducted have mostly focused on the quality and application of word embeddings trained on public available corpuses such as Wikipedia or other news and social media sources. However, these studies are limited to generic text and thus lack technical and scientific nuances such as domain specific vocabulary, abbreviations, or scientific formulas which are commonly used in academic context. This research focuses on the performance of word embeddings applied to a large scale academic corpus. More specifically, we compare quality and efficiency of trained word embeddings to TFIDF representations in modeling content of scientific articles. We use a word2vec skip-gram model trained on titles and abstracts of about 70 million scientific articles. Furthermore, we have developed a benchmark to evaluate content models in a scientific context. The benchmark is based on a categorization task that matches articles to journals for about 1.3 million articles published in 2017. Our results show that content models based on word embeddings are better for titles (short text) while TFIDF works better for abstracts (longer text). However, the slight improvement of TFIDF for larger text comes at the expense of 3.7 times more memory requirement as well as up to 184 times higher computation times which may make it inefficient for online applications. In addition, we have created a 2-dimensional visualization of the journals modeled via embeddings to qualitatively inspect embedding model. This graph shows useful insights and can be used to find competitive journals or gaps to propose new journals.

연구 동기 및 목표

  • 대규모 학술 코퍼스를 활용하여 워드임베딩과 TFIDF가 과학 논문의 내용을 모델링하는 데 얼마나 효과적인지 평가한다.
  • 텍스트 길이의 차이(제목 대비 초록)에 따라 워드임베딩과 TFIDF의 성능 차이를 평가한다.
  • 저널 분류 기준을 활용하여 과학적 맥락에서 콘텐츠 모델 평가를 위한 벤치마크를 개발하고 적용한다.
  • 학습된 임베딩을 통해 저널 간 관계를 시각화하여 학술 출판의 구조적 패턴을 탐색한다.
  • 온라인 응용 프로그램을 고려할 때 임베딩과 TFIDF 표현 간의 계산 효율성 트레이드오���을 규명한다.

제안 방법

  • Scopus 데이터베이스의 약 7000만 건의 과학 논문 제목과 초록을 대상으로 스위프그램(word2vec) 모델을 학습한다.
  • 다양한 어휘 크기(5K, 10K)와 해시 버킷 수(5K, 10K)를 사용하여 TFIDF를 적용해 대체 표현을 생성한다.
  • 워드 임베딩에 TFIDF 점수를 단어 수준의 가중치로 적용한 후 평균을 내어 TFIDF 가중치를 통합한 표현을 만든다.
  • 저널 분류 벤치마크를 사용해 모델을 평가한다: 각 논문의 콘텐츠 표현과 유사도 기반으로 저널을 순위 매긴다.
  • t-SNE를 사용해 2차원에서 저널 임베딩을 시각화하여 저널 간 의미적 관계를 검토한다.
  • 중앙 순위, 절대 히트율, 계산 비용(메모리 및 시간)을 측정하여 성능을 평가한다.

실험 결과

연구 질문

  • RQ1워드임베딩이 과학 논문의 내용 모델링에서 TFIDF를 능가하는가? 이 성능은 텍스트 길이(제목 대비 초록)에 따라 달라지는가?
  • RQ2온라인 응용 프로그램에서 TFIDF와 워드임베딩 모델 간의 계산 비용(메모리 및 시간)은 어떻게 비교되는가?
  • RQ3학습된 워드임베딩이 의미적으로 유사한 저널 간 군집을 효과적으로 포착할 수 있는가? 이는 2차원 시각화에서의 군집화로 입증되는가?
  • RQ4TFIDF 가중치를 워드임베딩에 통합하면 저널 분류 작업에서 성능 향상이 유의미하게 이루어지는가?
  • RQ5TFIDF의 성능이 워드임베딩을 능가하는 임계 텍스트 길이가 존재하는가?

주요 결과

  • 워드임베딩은 제목에서 TFIDF를 능가하며, 중앙 순위가 35를 기록하는 반면, TFIDF는 초록에서 더 낮은 중앙 순위 14를 기록한다.
  • TFIDF는 초록에서 더 높은 정확도를 기록하지만, 워드임베딩 대비 메모리 사용량이 3.7배 많고 계산 시간이 최대 184배 더 오래 걸린다.
  • TFIDF 가중치를 워드임베딩에 통합한 결과는 성능 향상이 약간 있었지만, 사용된 데이터셋에서는 통계적으로 유의미하지 않다.
  • 저널 임베딩의 2차원 시각화 결과 유사한 저널들이 의미 있는 군집을 이룬다. 이는 의미적 관계가 잘 유지되었음을 시사한다.
  • 모델 간 성능 격차는 중앙 순위, 평균 순위, 절대 히트율 등 모든 지표에서 일관되며, 제목에서는 TFIDF가 어떤 지표에서도 유의미하게 슈퍼어리어를 기록하지 못한다.
  • 문단 벡터나 LDE와 같은 고급 모델을 사용해도 유의미한 향상이 관찰되지 않았다. 이는 목표 클래스 수가 매우 많고(3,700개의 저널), 저널 카테고리가 중복되기 때문일 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.