[논문 리뷰] Measuring Patent Claim Generation by Span Relevancy
이 논문은 스파니어 리levance를 사용하여 특허 권리요약 생성 품질을 정량적으로 측정하는 새로운 스파니어 기반 프레임워크를 제안한다. 권리요약의 관련성을 자연어 추론 문제로 간주함으로써, BERT를 스파니어 쌍의 관련성 분류에 맞춤 학습하고 GPT-2를 이용해 권리요약을 생성함으로써, 저자들은 생성 다양성이 높아질수록 스파니어 관련성이 감소함을 입증함으로써, '증강된 발명'을 위한 신뢰할 수 있는 정량적 측정법으로서의 메트릭이 타당함을 검증한다.
Our goal of patent claim generation is to realize "augmented inventing" for inventors by leveraging latest Deep Learning techniques. We envision the possibility of building an "auto-complete" function for inventors to conceive better inventions in the era of artificial intelligence. In order to generate patent claims with good quality, a fundamental question is how to measure it. We tackle the problem from a perspective of claim span relevancy. Patent claim language was rarely explored in the NLP field. It is unique in its own way and contains rich explicit and implicit human annotations. In this work, we propose a span-based approach and a generic framework to measure patent claim generation quantitatively. In order to study the effectiveness of patent claim generation, we define a metric to measure whether two consecutive spans in a generated patent claims are relevant. We treat such relevancy measurement as a span-pair classification problem, following the concept of natural language inference. Technically, the span-pair classifier is implemented by fine-tuning a pre-trained language model. The patent claim generation is implemented by fine-tuning the other pre-trained model. Specifically, we fine-tune a pre-trained Google BERT model to measure the patent claim spans generated by a fine-tuned OpenAI GPT-2 model. In this way, we re-use two of the state-of-the-art pre-trained models in the NLP field. Our result shows the effectiveness of the span-pair classifier after fine-tuning the pre-trained model. It further validates the quantitative metric of span relevancy in patent claim generation. Particularly, we found that the span relevancy ratio measured by BERT becomes lower when the diversity in GPT-2 text generation becomes higher.
연구 동기 및 목표
- 특허 권리요약 생성 품질 평가를 위한 정량적 메트릭이 부족한 문제를 해결하기 위해.
- 특허 권리요약을 위한 AI 지원 자동완성 시스템을 개발하여 '증강된 발명'을 가능하게 하기 위해.
- 자연어 추론 원리를 활용하여 특허 권리요약 언어를 스파니어 쌍의 관련성 작업으로 모델링하기 위해.
- 사전 학습된 언어 모델을 사용하여 새로운 권리요약 생성 품질 메트릭을 검증하기 위해.
- 특허 텍스트에서 생성 다양성과 권리요약의 일관성 간의 관계 분석하기 위해.
제안 방법
- 특허 권리요약 생성 평가를 스파니어 쌍 분류 작업으로 재구성하여 연속된 권리요약 스파니어 간의 관련성 모델링.
- 특허 권리요약 내 연속된 스파니어 쌍 간의 의미적 관련성이 있는지 분류하기 위해 사전 학습된 BERT 모델을 미세조정.
- 평가를 위해 별도로 미세조정된 OpenAI GPT-2 모델을 사용하여 특허 권리요약을 생성.
- 실제 특허 권리요약에서 유도된 레이블이 부여된 스파니어 쌍을 기반으로 스파니어 쌍 분류기 학습을 통해 권리요약의 일관성 시뮬레이션.
- 사전 학습된 최신 모델(BERT 및 GPT-2)을 활용하여 전이 학습을 적용함으로써 권리요약 생성 및 관련성 점수 평가에 활용.
- 스파니어 관련성 비율을 권리요약 품질의 정량적 메트릭으로 측정하여 생성된 권리요약 간의 일관성 반영.
실험 결과
연구 질문
- RQ1스파니어 수준의 관련성으로 특허 권리요약 생성 품질을 어떻게 정량적으로 측정할 수 있는가?
- RQ2GPT-2 텍스트 생성에서 증가하는 다양성이 특허 권리요약의 일관성에 어떤 정도 영향을 미치는가?
- RQ3세밀하게 조정된 BERT 모델이 특허 권리요약 텍스트에서 스파니어 관련성을 효과적으로 분류할 수 있는가?
- RQ4스파니어 관련성은 특허 생성 작업에서 전체 권리요약 품질에 대한 신뢰할 수 있는 대체 측정 기준이 될 수 있는가?
- RQ5특허 권리요약의 명시적 및 암시적 표기 구조는 스파니어 기반 평가를 어떻게 지원하는가?
주요 결과
- 세밀하게 조정된 BERT 모델은 특허 권리요약 내 스파니어 관련성을 효과적으로 학습하여 제안된 메트릭의 실현 가능성을 입증한다.
- GPT-2로 생성된 권리요약의 다양성이 증가할수록 스파니어 관련성 비율이 감소함을 확인하여 창의성과 일관성 사이의 상충관계를 시사한다.
- 제안된 스파니어 쌍 분류 프레임워크는 특허 권리요약 생성 품질 평가를 위한 신뢰할 수 있는 정량적 측정법을 제공한다.
- 특허 권리요약 언어는 사전 학습된 언어 모델을 사용한 스파니어 기반 평가를 지원할 만큼 충분한 구조적 및 의미적 단서를 포함하고 있다.
- 스파니어 관련성이 AI로 생성된 특허 권리요약의 일관성과 품질 평가에 의미 있는 메트릭임을 결과가 검증한다.
- 이 프레임워크는 특허 권리요약 생성의 객관적이고 자동화된 평가를 가능하게 하여 AI 지원 발명 도구 개발을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.