Skip to main content
QUICK REVIEW

[논문 리뷰] TweetNERD -- End to End Entity Linking Benchmark for Tweets

Shubhanshu Mishra, Aman Saini|arXiv (Cornell University)|2022. 10. 14.
Topic Modeling인용 수 4
한 줄 요약

TweetNERD는 Named Entity Recognition 및 Disambiguation(NERD)를 위한 340만 건 이상의 애너테이션된 트윗을 포함한 대규모이고 시간적으로 다양성이 확보된 벤치마크이다. 이는 언급을 Wikidata 엔티티에 연결함으로써 NERD 시스템의 평가를 세 가지 작업—NER, 진짜 스팬을 사용한 엔티티 링킹, 종단간 링킹—에 대해 가능하게 하며, 도메인 외부 및 시간적 일반화 능력을 평가하기 위해 두 가지 전용 분할(OOD 및 학술)을 제공한다. 최신 기술 모델인 GENRE, REL, NLAI API의 기준 성능도 보고되어 있다.

ABSTRACT

Named Entity Recognition and Disambiguation (NERD) systems are foundational for information retrieval, question answering, event detection, and other natural language processing (NLP) applications. We introduce TweetNERD, a dataset of 340K+ Tweets across 2010-2021, for benchmarking NERD systems on Tweets. This is the largest and most temporally diverse open sourced dataset benchmark for NERD on Tweets and can be used to facilitate research in this area. We describe evaluation setup with TweetNERD for three NERD tasks: Named Entity Recognition (NER), Entity Linking with True Spans (EL), and End to End Entity Linking (End2End); and provide performance of existing publicly available methods on specific TweetNERD splits. TweetNERD is available at: https://doi.org/10.5281/zenodo.6617192 under Creative Commons Attribution 4.0 International (CC BY 4.0) license. Check out more details at https://github.com/twitter-research/TweetNERD.

연구 동기 및 목표

  • 트위터에서 Named Entity Recognition 및 Disambiguation(NERD)를 위한 대규모, 시간적으로 다양성 있고 지속 가능한 데이터셋의 부족을 해결하기 위해.
  • Named Entity Recognition(NER), Entity Linking with True Spans(EL), 종단간 엔티티 링킹(End2End)을 포함한 다수의 작업에서 NERD 시스템 평가를 지원하는 벤치마크를 제공하기 위해.
  • TweetNERD-OOD(도메인 외부) 및 TweetNERD-Academic(시간적으로 다양하고 기존 벤치마크에서 재애너테이션된)라는 두 가지 별도의 분할을 통해 모델의 일반화 능력(도메인 및 시간 주기)을 평가할 수 있도록 하기 위해.
  • 학술 분할을 통해 장기적 지속성과 일관된 애너테이션 가이드라인을 제공하는 공개된 CC BY 라이선스 데이터셋을 제공함으로써 강건한 NERD 모델 연구를 지원하기 위해.

제안 방법

  • 내부에서 훈련된 애너테이터들이 자세한 가이드라인을 제공하는 맞춤형 애너테이션 인터페이스를 사용하여 명시적 엔티티 언급을 수동으로 식별하고 Wikidata 엔티티에 연결하였다.
  • 시간적 다양성을 확보하고 시간 주기 편향을 줄이기 위해 광범위한 시간 창(2010–2021)에서 트윗을 샘플링하였다.
  • 평가를 위한 두 가지 분할을 생성하였다: TweetNERD-OOD는 짧은 시간 프레임 내에서 더 디스amb이거블한 엔티티에 중점을 두었고, TweetNERD-Academic는 기존 학술 벤치마크에서 재사용된 비삭제, 시간적으로 다양성이 확보된 트윗들로, 새로운 가이드라인에 따라 재애너테이션하였다.
  • 언급 오프셋을 위해 바이트 수준의 UTF-16-BE 인코딩을 사용하며, 연결되지 않은 언급에는 NIL 레이블을 포함한다.
  • 표준 NERD 메트릭을 사용하여 평가를 수행하였으며, 종단간 작업의 경우 entity_match 및 스팬 예측을 위한 오프셋 인식 메트릭을 포함한다.
  • 모든 분할에서 단일 A100 GPU를 사용하여 StanzaNLP, spaCy, AllenNLP, BERTweet, GENRE, REL, Lookup, TagMe, DBPedia Spotlight, Google의 NLAI API 등 최신 기술 모델을 평가하였다.

실험 결과

연구 질문

  • RQ1일관된 애너테이션을 갖춘 대규모이고 시간적으로 다양성이 확보된 트위터 벤치마크에서 기존 NERD 시스템의 성능은 어떠한가?
  • RQ2모델은 도메인 외부(OOD) 및 시간적으로 거리가 먼 테스트 세트로의 일반화 능력이 어느 정도인가?
  • RQ3트위터 전용 NERD 작업에서 정확한 매칭 기반 히우리스틱 기반의 룩업 히어리스틱은 최신 기술 신경망 모델보다 어떻게 비교되는가?
  • RQ4트위터 NERD에서 성능의 한계와 오류 패턴은 무엇이며, 특히 스팬 경계 예측에서 어떤 문제가 있는가?
  • RQ5지식 기반(예: Wikidata)과 애너테이션 형식(예: 바이트 오프셋)의 선택이 모델 평가 및 시스템 설계에 어떤 영향을 미치는가?

주요 결과

  • Google의 NLAI API는 종단간 엔티티 링킹 작업에서 TweetNERD-OOD 분할에서 최고의 성능을 기록하였으며, GENRE나 REL과 같은 전용 모델을 뛰어넘었다.
  • TweetNERD-Academic 분할에서는 REL과 GENRE가 NLAI API에 근접한 뛰어난 성능을 보였으며, 시간적으로 다양성이 확보된 데이터에서 강력한 일반화 능력을 보였다.
  • 위키백과 공출현 빈도 기반의 단순 룩업 히어리스틱은 EL 및 종단간 작업 모두에서 뛰어난 성능을 보였으며, 특히 학술 분할에서 두드러진 성능을 보여, 인기도 기반의 기저선의 가치를 입증하였다.
  • TwitterNER와 AllenNLP는 OOD 및 학술 분할 모두에서 NER 시스템 중 가장 높은 성능을 기록하였으며, 주로 잘못된 스팬 경계 예측에서 오류가 발생하였다.
  • 애너테이터 간 일치도는 중간 수준이었으며, 이는 애너테이션 작업의 본질적 난이도를 반영하며 현재 시스템의 성능 한계를 설정한다.
  • TweetNERD의 오프셋 기반 형식은 기존 NER 시스템에 도전을 안겨, 원본 텍스트 오프셋을 반환하도록 수정이 필요하지만, entity_match 메트릭은 종단간 평가를 위한 토크나이제이션에 영향을 받지 않는 대안을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.