Skip to main content
QUICK REVIEW

[논문 리뷰] LDKP: A Dataset for Identifying Keyphrases from Long Scientific Documents

Debanjan Mahata, Naveen Agarwal|arXiv (Cornell University)|2022. 03. 29.
Advanced Text Analysis Techniques인용 수 6
한 줄 요약

이 논문은 약 130만 건의 긴 과학 논문과 10만 건의 긴 과학 논문을 포함하는 대규모 데이터셋인 LDKP를 소개한다. 이 데이터셋은 전체 텍스트와 풍부한 메타데이터를 갖추고 있어, 기존의 키워드 추출(KPE) 및 키워드 생성(KPG) 데이터셋이 짧은 제목과 초록에 의존하는 한계를 보완하기 위해 제작되었다. S2ORC 코퍼스의 전체 텍스트 논문으로 기존 KP20K 및 OAGKx 키워드 데이터셋을 매핑함으로써, LDKP는 평균 문서 길이를 약 8문장에서 190문장 이상으로 늘리고, 입력 텍스트에 포함된 키워드 비율을 약 53%에서 최대 76%로 증가시켜, 긴 실제 문서에서 KPE/KPG 모델의 보다 현실적인 평가를 가능하게 한다.

ABSTRACT

Identifying keyphrases (KPs) from text documents is a fundamental task in natural language processing and information retrieval. Vast majority of the benchmark datasets for this task are from the scientific domain containing only the document title and abstract information. This limits keyphrase extraction (KPE) and keyphrase generation (KPG) algorithms to identify keyphrases from human-written summaries that are often very short (approx 8 sentences). This presents three challenges for real-world applications: human-written summaries are unavailable for most documents, the documents are almost always long, and a high percentage of KPs are directly found beyond the limited context of title and abstract. Therefore, we release two extensive corpora mapping KPs of ~1.3M and ~100K scientific articles with their fully extracted text and additional metadata including publication venue, year, author, field of study, and citations for facilitating research on this real-world problem.

연구 동기 및 목표

  • 짧고 인간이 작성한 초록에 의존하는 것보다 긴 과학 문서를 기반으로 하는 것이 더 현실적인 KPE 및 KPG 연구를 위해 필수적인 격차를 해소하기 위해.
  • 기존 데이터셋이 키워드 식별을 오직 8~10문장 이내로 제한하여 실제 문서 길이와 콘텐츠 분포를 반영하지 못하는 한계를 극복하기 위해.
  • 현대 딥러닝 모델의 훈련 및 평가를 지원하기 위해 전체 텍스트 과학 논문과 관련 키워드를 포함하는 확장 가능한 공개 데이터셋을 제공하기 위해.
  • 출판 장소, 연도, 저자, 인용 및 인용 맥락과 같은 풍부한 메타데이터를 포함하여 장문의 문서에서 키워드 추출 연구를 촉진하기 위해.
  • 기존 데이터셋의 경우 약 50~57% 수준이지만, LDKP3K에서는 입력 텍스트에 포함된 키워드 비율이 최대 76.11%까지 상승하여, 장문의 문서에서 KPE/KPG 모델의 평가를 보다 현실적으로 가능하게 하기 위해.

제안 방법

  • 논문 제목을 연결 키로 사용하여 S2ORC 코퍼스의 전체 과학 논문으로 기존 키워드 데이터셋(KP20K 및 OAGKx)을 매핑하였다.
  • 모든 문서에서 섹션 헤더(예: '서론', '메소드')를 통일된 형식으로 표준화하여 다양한 형태(예: '1. 서론', 'I. 서론')를 통일하였다.
  • 일반명, 숫자만 포함된 항목, 잘못 파arsed된 표현(예: '2,4-다클로로페녹시아세트산'이 여러 토큰으로 분리된 경우)과 같은 저품질 키워드를 걸러내었다.
  • 자원 제약이 있는 플랫폼(예: Google Colab)에서도 사용 가능한 자료를 위해 LDKP3K(10만 건의 문서)와 LDKP10K(130만 건의 문서)에 대해 소형, 중형, 대형의 세 가지 데이터 분할을 생성하였다.
  • 분야, 인용, 메타데이터(예: 출판 장소, 연도, DOI, PubMed ID) 정보를 유지하여 후속 연구를 위한 데이터셋의 풍부함을 높였다.
  • 제목 충돌을 수동으로 확인하고 신중한 샘플링을 통해 학습, 검증, 테스트 분할 간 분야별 분포의 균형을 확보하였다.

실험 결과

연구 질문

  • RQ1기존의 KPE 및 KPG 모델들이 짧은 초록이 아닌 긴 과학 문서에서 평가되었을 때, 얼마나 일반화되는가?
  • RQ2평균 문서 길이를 약 8문장에서 190문장 이상으로 늘였을 때, 입력 텍스트에 포함된 키워드 비율은 어떻게 변화하는가?
  • RQ3풍부한 메타데이터(예: 인용, 출판 장소, 연도)를 포함한 전체 텍스트 논문으로 훈련된 모델이 초록 전용 데이터로 훈련된 모델보다 더 높은 키워드 추출 성능을 달성할 수 있는가?
  • RQ4문서 길이와 키워드 분포가 현대 딥러닝 모델의 키워드 추출 및 생성 성능에 미치는 영향은 어떠한가?
  • RQ5소형, 중형, 대형 등 다양한 데이터 분할은 대규모 데이터셋에서 KPE/KPG 연구의 재현성과 확장성에 어떤 영향을 미치는가?

주요 결과

  • LDKP3K 데이터셋은 평균 문장 수가 280.67개인 10만 건의 전체 과학 논문을 포함하며, 이는 기존 데이터셋의 평균 8.87문장 대비 30배 이상 증가한 것이다.
  • LDKP10K 데이터셋은 평균 문장 수가 194.76개인 130만 건의 전체 과학 논문을 포함하며, 장문의 KPE 데이터의 규모를 크게 확장하였다.
  • 입력 텍스트에 포함된 키워드 비율은 OAGKx의 52.7%에서 LDKP10K의 63.65%로, KP20K의 57.4%에서 LDKP3K의 76.11%로 상승하여 입력 커버리지의 상당한 향상을 보였다.
  • LDKP 데이터셋은 출판 장소, 연도, 저자, 인용, 인용 맥락 등 풍부한 메타데이터를 포함하여, 더 정교한 후속 분석 및 모델 훈련을 가능하게 한다.
  • 소형, 중형, 대형 등 다양한 크기로 제공되어 Google Colab과 같은 자원이 제한된 플랫폼에서도 사용할 수 있어, 계산 자원이 제한된 연구자들에게도 접근성이 향상되었다.
  • 학습, 검증, 테스트 분할 간 분야별 분포가 시각화된 그림 1 및 2를 통해 균형 잡혀 있음을 확인하였으며, 이는 신뢰할 수 있는 모델 평가를 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.