Skip to main content
QUICK REVIEW

[논문 리뷰] NLPContributions: An Annotation Scheme for Machine Reading of Scholarly Contributions in Natural Language Processing Literature

Jennifer D’Souza, Sören Auer|arXiv (Cornell University)|2020. 06. 23.
Topic Modeling참고 문헌 53인용 수 8
한 줄 요약

이 논문은 자연어 처리(NLP) 및 기계 학습(ML) 연구 논문에서 학술 기여를 추출하기 위한 구조화된 주석 체계인 NLPContributions를 소개한다. 다섯 가지 NLP 작업(기계 번역, 명명된 엔티티 인식, 질의 응답, 관계 분류, 텍스트 분류)을 다루는 50篇의 논문에 대한 파ilot 주석 분석을 바탕으로, 기계 독해를 가능하게 하기 위해 주어진-서술어-목적어 문장으로 표현되는 핵심 정보 단위 10개를 식별한다. 이는 지식 그래프 구축과 개방 과학 응용을 위한 재사용 가능하고 FAIR 기준을 충족하는 데이터셋을 지원한다.

ABSTRACT

We describe an annotation initiative to capture the scholarly contributions in natural language processing (NLP) articles, particularly, for the articles that discuss machine learning (ML) approaches for various information extraction tasks. We develop the annotation task based on a pilot annotation exercise on 50 NLP-ML scholarly articles presenting contributions to five information extraction tasks 1. machine translation, 2. named entity recognition, 3. question answering, 4. relation classification, and 5. text classification. In this article, we describe the outcomes of this pilot annotation phase. Through the exercise we have obtained an annotation methodology; and found ten core information units that reflect the contribution of the NLP-ML scholarly investigations. The resulting annotation scheme we developed based on these information units is called NLPContributions. The overarching goal of our endeavor is four-fold: 1) to find a systematic set of patterns of subject-predicate-object statements for the semantic structuring of scholarly contributions that are more or less generically applicable for NLP-ML research articles; 2) to apply the discovered patterns in the creation of a larger annotated dataset for training machine readers of research contributions; 3) to ingest the dataset into the Open Research Knowledge Graph (ORKG) infrastructure as a showcase for creating user-friendly state-of-the-art overviews; 4) to integrate the machine readers into the ORKG to assist users in the manual curation of their respective article contributions. We envision that the NLPContributions methodology engenders a wider discussion on the topic toward its further refinement and development. Our pilot annotated dataset of 50 NLP-ML scholarly articles according to the NLPContributions scheme is openly available to the research community at https://doi.org/10.25835/0019761.

연구 동기 및 목표

  • 자연어 처리(NLP) 및 기계 학습(ML) 연구 논문에서 학술 기여를 캡처하기 위한 체계적이고 재사용 가능한 주석 체계를 개발하기 위해.
  • NLP-ML 문헌에서 핵심 기여를 나타내는 반복 가능한 주어-서술어-목적어 문장 패턴을 식별하기 위해.
  • 기계 독해를 위한 연구 기여 추출 모델 훈련을 지원하기 위해 FAIR 데이터 원칙을 준수하는 대규모 주석 데이터셋을 구축하기 위해.
  • 주석 데이터를 개방형 연구 지식 그래프(ORKG)에 통합하여 학술 지식 탐색을 향상시키기 위해.
  • 세미틱적 구조화를 통해 사용자 우아한, 기계 기반의 연구 기여 개요 개발을 지원하기 위해.

제안 방법

  • 기계 번역, 명명된 엔티티 인식, 질의 응답, 관계 분류, 텍스트 분류 등 다섯 가지 정보 추출 작업을 다루는 50篇의 NLP-ML 연구 논문에 대한 파ilot 주석 연구를 수행하였다.
  • 반복적인 주석 작업과 공감대 형성 과정을 통해 학술 기여를 반영하는 10개의 핵심 정보 단위를 식별하였다.
  • 이러한 단위를 기반으로 주어-서술어-목적어 삼항조합을 중심으로 세미틱적 구조화를 위한 NLPContributions 주석 체계를 설계하였다.
  • 이 체계를 적용하여 50편의 주석 처리된 논문 데이터셋을 구축하였으며, DOI: 10.25835/0019761을 통해 공개하였다.
  • 찾기 쉬움, 접근성, 상호운용성, 재사용 가능성을 확보하기 위해 ORKG 기준에 맞춰 데이터셋의 FAIR 준수를 확보하였다.
  • 향후 확장 방안으로는 개선된 PDF 파싱, 엔티티 연결, 온톨로지 정렬(MEX 어휘 등), 다중 분야 일반화를 제안하였다.

실험 결과

연구 질문

  • RQ1자연어 처리(NLP) 및 기계 학습(ML) 연구 논문의 학술 기여에서 반복 가능한 주어-서술어-목적어 문장 패턴은 무엇인가?
  • RQ2NLP-ML 연구 논문의 핵심 기여를 일관되고 재사용 가능한 주석 체계로 어떻게 캡처할 수 있는가?
  • RQ350편의 논문으로 구성된 파ilot 주석 데이터셋이 학술 기여 추출을 위한 기계 독해 모델 훈련에 어느 정도 기여할 수 있는가?
  • RQ4이러한 주석 데이터셋은 ORKG와 같은 학술 지식 그래프 인fra구조에 어떻게 통합되어 연구 탐색을 향상시킬 수 있는가?
  • RQ5더 넓은 과학 분야로 주석 체계를 확장하기 위해 필요한 기술적·방법론적 개선 사항은 무엇인가?

주요 결과

  • 파ilot 주석 분석을 통해 NLP-ML 연구 논문의 학술 기여를 일관되게 반영하는 10개의 핵심 정보 단위를 식별하였다.
  • NLPContributions 체계는 주어-서술어-목적어 문장을 통해 기여를 성공적으로 캡처하여 연구 주장의 구조화되고 기계 독해 가능한 표현을 가능하게 하였다.
  • 50편의 주석 처리된 NLP-ML 논문으로 구성된 데이터셋은 DOI: 10.25835/0019761를 통해 공개되었으며, FAIR 데이터 원칙을 준수한다.
  • 주석 체계는 개방형 연구 지식 그래프(ORKG)에 통합 가능하도록 설계되어 있어 자동 쇄집 및 지식 탐색을 지원한다.
  • 향후 개선 사항으로는 향상된 PDF 파싱, 엔티티 연결, 온톨로지 정렬(MEX 어휘 등), 다중 분야로의 확장성 향상 등이 식별되었다.
  • 이 연구는 다양한 과학 분야에서 의미론적 출판과 학술 기여의 기계 독해를 위한 광범위한 도입 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.