[논문 리뷰] PRIME: A System for Multi-lingual Patent Retrieval
PRIME는 일본어 및 영어 사용자가 단일 언어 쿼리를 사용하여 双어성 특허 데이터베이스를 검색할 수 있도록 해주는 다국어 특허 검색 시스템이다. 쿼리를 대상 언어로 번역하고, 관련 다국어 특허를 검색하며, 군집화와 문서 번역을 통해 브라우징 효율을 향상시키고, 일본어-영어 특허 가족에서 어휘 수준 번역을 추출하여 가중 치수 계수를 사용한 공존 점수 계산을 통해 번역 사전을 개선한다. 점수 기준치 5.0에서 67.4%의 정확도를 달성한다.
Given the growing number of patents filed in multiple countries, users are interested in retrieving patents across languages. We propose a multi-lingual patent retrieval system, which translates a user query into the target language, searches a multilingual database for patents relevant to the query, and improves the browsing efficiency by way of machine translation and clustering. Our system also extracts new translations from patent families consisting of comparable patents, to enhance the translation dictionary.
연구 동기 및 목표
- 사용자가 외국어 특허 데이터베이스를 검색하는 데 어려움을 겪는 다국어 특허 검색 문제를 해결하기 위해.
- 단일 언어 쿼리에 대해 동시에 여러 언어의 관련 특허를 검색할 수 있는 시스템을 개발하기 위해.
- 검색 결과의 브라우징 효율성을 향상시키기 위해 기계 번역과 문서 군집화를 통해 사용자 경험을 개선하기 위해.
- 이중 언어 특허 가족에서 새로운 어휘 기반 번역을 자동으로 추출하여 번역 사전를 확장하기 위해.
- 유사 특허 쌍에서 번역을 추출하는 반자동 방법의 정확도와 비용 효율성을 평가하기 위해.
제안 방법
- 시스템은 이중어 사전과 확률적 의미 해석을 사용하여 사용자 쿼리를 대상 언어로 번역하는 쿼리 번역 모듈을 사용하며, 기술 용어의 단어 순서를 유지한다.
- 문서 검색 모듈은 원본 쿼리와 번역된 쿼리를 모두 사용하여 일본어 또는 영어로 된 관련 문서를 이중 언어 특허 컬렉션에서 검색한다.
- 문서 번역 모듈은 사용자의 언어로 외국어 문서만 번역하여 가독성을 지원한다.
- 군집 모듈은 검색된 문서를 주제별 군집으로 묶어 브라우징 효율을 향상시킨다.
- 오프라인 번역 추출 모듈은 특허 가족의 제목 및 초록 필드에서 일본어-영어 어휘 쌍을 형태소 분석 및 품사 규칙을 사용하여 식별한다.
- 시스템은 가중 치수 계수를 사용하여 연관 점수를 계산한다: $\text{score}(W_j,W_e) = \log F_{je} \cdot \frac{2F_{je}}{F_j + F_e}$, 이를 통해 고신뢰도 번역을 순위 매기고 선택한다.
실험 결과
연구 질문
- RQ1단일 언어 쿼리를 사용하여 일본어 및 영어 특허 간의 다국어 특허 검색 시스템이 효과적으로 관련 특허를 검색할 수 있는가?
- RQ2문서 군집화와 기계 번역은 다국어 특허 결과의 브라우징 효율을 어떻게 향상시킬 수 있는가?
- RQ3특허 가족을 활용하여 고품질의 어휘 수준 번역을 자동으로 추출하여 번역 사전을 개선할 수 있는가?
- RQ4점수 기준치를 사용하여 특허 가족에서 번역을 추출할 때 정밀도와 재현율 사이의 상충 관계는 어떠한가?
- RQ5반자동 방법은 특허 검색을 위한 이중어 어휘 사전 구축에 있어 수동 작업을 얼마나 줄일 수 있는가?
주요 결과
- 시스템은 단일 언어 쿼리에 대해 다국어 특허를 성공적으로 검색하여 사용자가 자신의 모국어로 관련 문서에 접근할 수 있도록 한다.
- 군집화와 문서 번역의 활용은 검색 결과의 사용성과 브라우징 효율을 크게 향상시킨다.
- 번역 추출 방법은 32,000개의 특허 가족에서 37,669개의 후보 번역을 생성하였으며, 수동 평가 결과 5,879개가 정확한 것으로 판단되었다.
- 점수 기준치 5.0에서 이 방법은 67.4%의 정확도를 달성하여 고점수 번역에 대해 높은 정밀도를 입증하였다.
- 37,669개의 번역을 평가하는 데 단 4명일이 소요되어, 어휘 사전 확장에 있어 저비용이고 확장 가능한 접근법임을 시사한다.
- 가중 치수 계수는 저빈도 및 노이즈가 많은 공존 현상을 효과적으로 걸러내어 추출 정확도를 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.