[논문 리뷰] Improving Automated Patent Claim Parsing: Dataset, System, and Experiments
이 논문은 표준 NLP 도구가 잘못 분류한 동사 POS 태그를 보정함으로써 자동 특허 청구서 분석을 비용 효율적으로 향상시키는 방법을 제안한다. 아마존 메카니컬 터크를 통한 커뮤니티 기반 데이터셋을 활용해, 저자들은 분석 정확도를 향상시키기 위해 POS 태그 보정기를 훈련시켰으며, 이로 인해 특허 주제 분류 오류율이 2.797%로 크게 낮아졌다. 이는 수정되지 않은 NLP 도구를 사용하는 기준 시스템보다 유의미하게 낮은 수준이다.
Off-the-shelf natural language processing software performs poorly when parsing patent claims owing to their use of irregular language relative to the corpora built from news articles and the web typically utilized to train this software. Stopping short of the extensive and expensive process of accumulating a large enough dataset to completely retrain parsers for patent claims, a method of adapting existing natural language processing software towards patent claims via forced part of speech tag correction is proposed. An Amazon Mechanical Turk collection campaign organized to generate a public corpus to train such an improved claim parsing system is discussed, identifying lessons learned during the campaign that can be of use in future NLP dataset collection campaigns with AMT. Experiments utilizing this corpus and other patent claim sets measure the parsing performance improvement garnered via the claim parsing system. Finally, the utility of the improved claim parsing system within other patent processing applications is demonstrated via experiments showing improved automated patent subject classification when the new claim parsing system is utilized to generate the features.
연구 동기 및 목표
- 뉴스 및 웹 텍스트에 기반한 언어 모델과 불일치하는 특허 청구서 분석에서 표준 NLP 도구의 낮은 성능을 해결하기 위해.
- 특허 청구서를 위한 새로운 언어 모델을 훈련시키는 데 드는 비용과 노력을 줄이기 위해, 잘못 식별된 동사 POS 태그에 집중하는 것.
- 연구 목적을 위해 공개 가능한 커뮤니티 기반 특허 청구서 세그먼트 데이터셋을 구축하고, 수정된 POS 태그를 포함하여 공개하는 것.
- 향상된 분석이 하류 특허 처리 작업, 특히 주제 분류에 미치는 영향을 평가하는 것.
- 수정된 POS 태그에서 유도된 향상된 의존성 분석이 기계 학습 모델에 더 우수한 특징을 제공하는지 입증하는 것.
제안 방법
- 아마존 메카니컬 터크를 통한 커뮤니티 기반 데이터 수집을 통해, 처음에는 동사로 잘못 분류된 단어에 대해 수동으로 수정된 POS 태그가 포함된 특허 청구서 세그먼트 데이터셋을 생성한다.
- 수집된 데이터셋을 기반으로 기계 학습 기반의 POS 태그 보정기를 개발하여 특허 청구서 내 잘못된 동사 태그를 식별하고 수정한다.
- 수정된 POS 태그를 스탠퍼드 NLP 파이프라인에 통합하여, 수정된 태그로 다시 파서를 실행함으로써 정확한 분석을 유도한다.
- 의존성 분석을 사용해 청구서에서 문법적 특징을 추출하고, 수정되지 않은 시스템과 개선된 NLP 시스템 간의 성능을 비교한다.
- 단어 수준, 트리그램, 의존성 수준의 특징에서 유도된 TF-IDF 특징 벡터를 사용해 지원 벡터 머신(SVM) 분류기를 훈련하고 평가하여 특허 주제 분류를 수행한다.
- 다양한 특징 조합에서 수정되지 않은 NLP 도구와 개선된 청구서 분석 시스템의 오류율을 체계적으로 비교한다.
실험 결과
연구 질문
- RQ1전체 언어 모델을 재학습하지 않고도, 잘못 식별된 동사 POS 태그를 보정함으로써 특허 청구서의 분석 정확도를 크게 향상시킬 수 있는가?
- RQ2수정된 POS 태그를 포함한 커뮤니티 기반 데이터셋은 특허 청구서를 위한 경량이며 유연한 NLP 시스템을 개발하는 데 얼마나 효과적인가?
- RQ3향상된 청구서 분석이 주제 분류와 같은 하류 특허 처리 작업에 얼마나 기여하는가?
- RQ4개선된 분석 시스템에서 유도된 의존성 특징의 사용이 분류 오류율에 어떤 정량적 영향을 미치는가?
- RQ5개선된 의존성 특징을 다른 특징 유형(예: 트리그램, BOW)과 조합할 경우, 수정되지 않은 NLP 도구를 사용하는 것보다 더 높은 분류 성능을 달성할 수 있는가?
주요 결과
- 수정된 청구서 분석 시스템은 의존성 특징만을 사용할 경우, 특허 주제 분류 오류율을 5.974%에서 4.695%로 낮춰 유의미한 성능 향상을 보였다.
- 청구서 트리그램에 개선된 분석 시스템에서 유도된 의존성 특징을 추가한 결과, 오류율은 2.797%로 떨어졌으며, 수정되지 않은 NLP 의존성 특징을 사용할 경우 3.99%였다.
- 개념 설명의 트리그램과 청구서 트리그램, 그리고 개선된 시스템에서 유도된 의존성 특징을 조합한 결과 오류율은 2.597%로 떨어졌으며, 수정되지 않은 NLP 의존성 특징을 사용할 경우 3.696%였다.
- 다양한 특징 조합에서 수정된 분석 시스템은 수정되지 않은 NLP 도구보다 더 유용한 문법적 특징을 지속적으로 제공했으며, 이는 낮은 오류율로 입증되었다.
- 공개된 데이터셋을 기반으로 훈련된 POS 태그 보정기는 최소한의 노력으로도 뚜렷한 분석 향상을 이끌었으며, 언어 모델의 대규모 재학습이 필요 없음을 확인했다.
- 이 연구는 동사 POS 태그 오분류를 수정하는 것이 일반 목적의 NLP 도구를 특허 청구서의 고유한 문법에 적응시키는 데 매우 효과적이고 효율적인 전략임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.