Skip to main content
QUICK REVIEW

[논문 리뷰] Online Similarity Learning with Feedback for Invoice Line Item Matching

Chandresh Kumar Maurya, Neelamadhav Gantayat|arXiv (Cornell University)|2020. 01. 02.
Data Stream Mining Techniques참고 문헌 16인용 수 4
한 줄 요약

이 논문은 기업의 조달에서 지급(Procure-to-Pay, P2P) 프로세스에서 송장 항목 매칭을 위한 온라인 유사도 학습 방법을 제안한다. 에이전트 피드백을 활용하여 랭킹 또는 분류 모델을 훈련시으며, 제품 분류 체계와 카탈로그를 통합함으로써 기존 방법 대비 정확도와 효율성을 향상시켜 기업의 송장 처리에서 수작업 비용을 줄인다.

ABSTRACT

The procure to pay process (P2P) in large enterprises is a back-end business process which deals with the procurement of products and services for enterprise operations. Procurement is done by issuing purchase orders to impaneled vendors and invoices submitted by vendors are paid after they go through a rigorous validation process. Agents orchestrating P2P process often encounter the problem of matching a product or service descriptions in the invoice to those in purchase order and verify if the ordered items are what have been supplied or serviced. For example, the description in the invoice and purchase order could be TRES 739mL CD KER Smooth and TRES 0.739L CD KER Smth which look different at word level but refer to the same item. In a typical P2P process, agents are asked to manually select the products which are similar before invoices are posted for payment. This step in the business process is manual, repetitive, cumbersome, and costly. Since descriptions are not well-formed sentences, we cannot apply existing semantic and syntactic text similarity approaches directly. In this paper, we present two approaches to solve the above problem using various types of available agent's recorded feedback data. If the agent's feedback is in the form of a relative ranking between descriptions, we use similarity ranking algorithm. If the agent's feedback is absolute such as match or no-match, we use classification similarity algorithm. We also present the threats to the validity of our approach and present a possible remedy making use of product taxonomy and catalog. We showcase the comparative effectiveness and efficiency of the proposed approaches over many benchmarks and real-world data sets.

연구 동기 및 목표

  • 기업의 조달에서 지급(P2P) 프로세스에서 송장 항목 매칭의 높은 비용과 수작업 비용 문제를 해결하기 위해.
  • 에이전트 피드백(상대적 순위 또는 이진 매칭/비매칭 레이블)을 활용하는 유사도 학습 프레임워크를 개발하여 매칭 정확도를 향상시키기 위해.
  • 제품 분류 체계와 카탈로그를 통합하여 항목 설명 간 계층적 및 의미적 불일치를 해결하기 위해.
  • OOV 단어, OCR 오류, 문법적 변형 등으로 실패하는 규칙 기반 또는 키워드 매칭 접근법에 대한 의존도를 줄이기 위해.
  • 실제 데이터셋과 벤치마크 데이터셋에서 제안된 방법의 효과성과 효율성을 입증하기 위해.

제안 방법

  • 이 방법은 두 가지 형태의 에이전트 피드백을 사용한다: 상대적 순위(유사도 랭킹용) 또는 이진 매칭/비매칭 레이블(분류용).
  • 유사도 랭킹 알고리즘은 피드백을 이용해 잠재 표현 공간에서 잘못된 매칭보다 올바른 매칭을 우선시하도록 훈련된다.
  • 피드백이 이진일 경우 분류 유사도 알고리즘이 적용되어 매칭/비매칭 결과를 예측하도록 학습된다.
  • 제품 분류 체계를 통합하여 계층적 관계(예: 하위어 관계)를 탐지한다. 예를 들어 '식용유'는 '코conut 기름'의 하위 카테고리이다.
  • 제품 카탈로그는 제품 속성과 실체를 추출하고 매칭하여, 송장과 구매요청서 설명 간 의미적 일치도를 향상시킨다.
  • 합성된, 매칭된, 나머지 토큰을 기반으로 한 자카르 유사도를 활용한 하이브리드 유사도 측정 방식을 통해 최종 유사도 점수를 산출한다.

실험 결과

연구 질문

  • RQ1에이전트 피드백을 활용한 온라인 유사도 학습은 P2P 프로세스에서 송장 항목 매칭 정확도를 어떻게 향상시킬 수 있는가?
  • RQ2제품 분류 체계와 카탈로그를 통합함으로써 송장 설명의 계층적 및 의미적 불일치는 어떻게 해결되는가?
  • RQ3제안된 방법은 OOV 단어, OCR 오류, 문법적 변형을 다루는 데 있어 규칙 기반 또는 키워드 매칭 접근법보다 어떻게 뛰어나게 되는가?
  • RQ4상대적 순위 또는 이진 레이블 형태의 피드백이 실시간에서 강력한 유사도 모델을 훈련시키는 데 효과적으로 활용될 수 있는가?
  • RQ5제품 분류 체계는 일반적이거나 광범위한 제품 카테고리가 송장과 구매요청서 간에 매칭되는 데 어떤 역할을 하는가?

주요 결과

  • 제안된 방법은 에이전트 피드백과 도메인 지식을 활용하여 수작업 기반의 송장 처리 비용을 크게 줄였다.
  • 제품 분류 체계를 통합함으로써 계층적 관계를 해결함으로써 매칭 정확도가 향상되었으며, 예를 들어 '식용유'를 '코conut 기름'으로 매칭시키는 데 기여했다.
  • 제품 카탈로그를 활용함으로써 설명의 어휘나 어순이 다를 경우나 수량 등의 추가 정보가 포함되어 있어도 속성과 실체를 일치시켜 매칭을 향상시켰다.
  • 실제 및 벤치마크 데이터셋에서 랭킹 및 분류 모델이 기준 방법보다 뛰어난 성능을 보이며, 효과성과 효율성 향상을 입증했다.
  • 매칭된, 공통의, 나머지 토큰을 기반으로 한 자카르 유사도를 활용한 하이브리드 접근법은 강인하고 해석 가능한 유사도 점수를 산출한다.
  • OCR 오류, OOV 단어, 문법적 변형(예: '10개의 연필' vs '10개의 연필 상자')과 같은 과제를 효과적으로 처리할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.