[논문 리뷰] Deep Patent Landscaping Model Using Transformer and Graph Embedding
이 논문은 텍스트 분석을 위한 수정된 Transformer와 문헌정보 메타데이터를 위한 Diff2Vec 그래프 임베딩을 결합한 딥러닝 모델을 제안한다. 이 모델은 새로 도입된 네 가지 기준 데이터셋에서 최신 기술 수준의 성능을 달성하며, 기존 방법 대비 평균 분류 정확도를 약 15% 향상시킨다.
Patent landscaping is a method used for searching related patents during a research and development (R&D) project. To avoid the risk of patent infringement and to follow current trends in technology, patent landscaping is a crucial task required during the early stages of an R&D project. As the process of patent landscaping requires advanced resources and can be tedious, the demand for automated patent landscaping has been gradually increasing. However, a shortage of well-defined benchmark datasets and comparable models makes it difficult to find related research studies. In this paper, we propose an automated patent landscaping model based on deep learning. To analyze the text of patents, the proposed model uses a modified transformer structure. To analyze the metadata of patents, we propose a graph embedding method that uses a diffusion graph called Diff2Vec. Furthermore, we introduce four benchmark datasets for comparing related research studies in patent landscaping. The datasets are produced by querying Google BigQuery, based on a search formula from a Korean patent attorney. The obtained results indicate that the proposed model and datasets can attain state-of-the-art performance, as compared with current patent landscaping models.
연구 동기 및 목표
- 연구개발 프로젝트에서 반복적이고 비용이 많이 드는 수작업 특허 랜드스케이핑 과정을 자동화하기 위해.
- 특허 랜드스케이핑 연구를 위한 공개 가능하고 명확하게 정의된 기준 데이터셋의 부족을 해결하기 위해.
- 텍스트적 특허 특징과 문헌정보적 특징을 효과적으로 통합하는 통합된 딥러닝 모델을 개발하기 위해.
- 고급 자연어 처리 및 그래프 표현 기법을 활용해 관련 특허를 식별하는 분류 정확도를 향상시키기 위해.
- 최근에 출판된 관련 특허를 효율적이고 확장 가능하며 정확하게 검색할 수 있도록 지속적인 특허 모니터링을 지원하기 위해.
제안 방법
- 제목, 초록, 청구항을 포함한 특허 텍스트를 인코딩하고 분류하기 위해 수정된 Transformer 아키텍처를 사용한다.
- 배정자, 인용정보, IPC 분류 등 문헌정보 메타데이터를 그래프 구조로 모델링하기 위해 확산 기반 그래프 임베딩 기법인 Diff2Vec을 적용한다.
- Transformer 및 Diff2Vec 구성 요소의 표현을 융합하여 엔드 투 엔드 특허 관련성 분류를 수행한다.
- Google BigQuery와 한국 지적재산전략기구(KISTA)의 전문가가 검토한 검색 공식을 사용하여 네 가지 기준 데이터셋을 구축한다.
- 실제 특허 추세 보고서에서 유래한 데이터셋은 시드 특허와 그 관련 참조문헌을 포함하여 고품질의 훈련 및 평가 데이터를 보장한다.
- 이중 관련성 레이블을 사용하여 지도 학습 방식으로 모델을 훈련시키며, 표준 분류 평가 지표를 통해 성능을 평가한다.
실험 결과
연구 질문
- RQ1기반 텍스트 인코딩과 그래프 임베딩을 결합한 딥러닝 모델이 기존 방법보다 특허 랜드스케이핑에서 뛰어난 성능을 내는가?
- RQ2제안된 기준 데이터셋이 특허 랜드스케이핑 연구의 재현 가능성과 비교 가능성에 얼마나 기여하는가?
- RQ3다양한 기술 분야에서 텍스트적 특징과 문헌정보적 특징의 융합이 관련 특허 식별에 얼마나 효과적인가?
- RQ4기준 데이터셋의 다양성을 감안할 때, 모델이 최소한의 재학습으로 다양한 기술 분야에 일반화되는가?
- RQ5기본 모델 대비 제안된 모델의 분류 정확도 및 강건성 향상 정도는 어떠한가?
주요 결과
- 제안된 모델은 모든 네 가지 기준 데이터셋에서 최신 기술 수준의 성능을 달성하며, 기존 분류 모델을 크게 능가한다.
- 모든 데이터셋에 걸쳐 평균 분류 정확도가 기존 모델 대비 약 15% 향상되었다.
- 그래프 기반 메타데이터에 대한 Diff2Vec의 통합은 키워드 매칭을 넘어서 특허 간 복잡한 관계를 포착하는 데 모델의 능력을 향상시킨다.
- KISTA 특허 추세 보고서의 전문가가 검토한 검색 공식을 활용함으로써 기준 데이터셋의 훈련 데이터에 고품질의 도메인 관련 정보가 보장된다.
- 기준 데이터셋은 공개 가능하며 자동 특허 랜드스케이핑 연구의 재현 가능성을 지원하도록 설계되었다.
- 모델은 해양 차량, 유도 가열, 기상 모니터링, 위성 영상과 같은 다양한 기술 분야에서 강력한 일반화 능력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.