Skip to main content
QUICK REVIEW

[논문 리뷰] Classification of Goods Using Text Descriptions With Sentences Retrieval

Eunji Lee, Sundong Kim|arXiv (Cornell University)|2021. 11. 02.
Law, logistics, and international trade참고 문헌 19인용 수 8
한 줄 요약

이 논문은 KoELECTRA 기반의 딥러닝 모델을 제안하며, 세관 관리자가 상품을 HS 코드로 분류하는 데 도움을 주기 위해 HS 수첩에서 관련 문장을 검색하고, 이를 바탕으로 헤딩(4자리) 및 서브헤딩(6자리)의 계층적 분류를 향상시킨다. 이 모델은 129,084건의 과거 사례에서 상위 3개 정확도가 95.5%에 도달하여 분류 시간을 크게 단축시키고, 지원 근거 문장과 유사 사례를 통해 해석 가능성도 향상시킨다.

ABSTRACT

The task of assigning and validating internationally accepted commodity code (HS code) to traded goods is one of the critical functions at the customs office. This decision is crucial to importers and exporters, as it determines the tariff rate. However, similar to court decisions made by judges, the task can be non-trivial even for experienced customs officers. The current paper proposes a deep learning model to assist this seemingly challenging HS code classification. Together with Korea Customs Service, we built a decision model based on KoELECTRA that suggests the most likely heading and subheadings (i.e., the first four and six digits) of the HS code. Evaluation on 129,084 past cases shows that the top-3 suggestions made by our model have an accuracy of 95.5% in classifying 265 subheadings. This promising result implies algorithms may reduce the time and effort taken by customs officers substantially by assisting the HS code classification task.

연구 동기 및 목표

  • 복잡하고 다양한 상품 및 증가하는 전자상거래 물량으로 인해 점점 증가하는 업무 부담을 겪고 있는 세관 관리자들이 HS 코드 분류에 소요되는 시간과 노력을 줄이기 위해.
  • 관세율에 직접적인 영향을 미치며, 일관성 없을 경우 국제 분쟁으로 이어질 수 있는 HS 코드 할당의 정확성과 일관성을 향상시키기 위해.
  • HS 수첩에서 관련 문장을 검색하고 지원 근거 문장과 유사 사례를 제공하여 AI 기반 결정의 해석 가능성을 향상시키기 위해.
  • 제출자와 세관 관리자 양측을 지원하기 위해, 정당화된 이유와 함께 가능성이 높은 HS 코드를 제안하는 의사결정 지원 시스템을 제공하기 위해.
  • 복잡하고 오류율이 높은 것으로 알려진 장치 85장(전기 기기)의 계층적 분류 과제를 해결하기 위해.

제안 방법

  • 모델은 사전에 미세조정된 KoELECTRA 모델을 사용하여 제품 기술서를 바탕으로 4자리 HS 코드 헤딩을 예측한다.
  • 밀도 검색 기법을 활용해 제품 기술서와 의미적 유사도가 높은 문장을 HS 수첩에서 검색한다.
  • 서브헤딩(6자리) 예측을 위해 모델은 제품 기술서와 검색된 HS 수첩 문장을 함께 입력으로 사용하여 계층적 분류 헤드를 적용한다.
  • 상위-k 예측의 신뢰도를 높이기 위해 신뢰도 점수를 校정하기 위해 온도 스케일링을 적용한다.
  • 상위 3개 헤딩 및 서브헤딩 후보, 검색된 문장, 유사 과거 사례를 포함한 출력 템플릿을 생성한다. 이는 맥락적 근거 제공에 기여한다.
  • 모델은 인간 전문가가 사용하는 GRI 기반 추론 과정을 모방하여, AI 결정이 법적 및 해석 기준과 일치하도록 한다.

실험 결과

연구 질문

  • RQ1HS 수첩에서 텍스트 검색을 활용한 딥러닝 모델이 세관 관리자들이 수행하는 계층적 HS 코드 분류의 정확도를 향상시킬 수 있는가?
  • RQ2검색된 HS 수첩 문장의 통합이 모델의 해석 가능성 및 의사결정 정당화에 얼마나 효과적인가?
  • RQ3실제 세관 분류 작업 환경에서 기존 솔루션과 비교해 모델의 성능은 어느 정도인가?
  • RQ4모델이 고신뢰도의 설명 가능한 제안을 제공함으로써 세관 관리자의 업무 부담을 줄일 수 있는가?
  • RQ5모델이 장치 85장(전기 기기)과 같은 복잡하고 모호한 상품 카테고리에 얼마나 잘 일반화되는가?

주요 결과

  • 모델은 129,084건의 과거 사례에서 265개의 서브헤딩을 분류하는 데 있어 상위 3개 정확도가 95.5%에 도달하여 실제 세관 데이터에서 뛰어난 성능을 입증했다.
  • 이커머스 제품 분류 경쟁에서 최우수 성과를 거둔 솔루션보다도 모델이 뛰어난 성능을 보이며, 복잡한 분류 작업에서의 강건성을 입증했다.
  • 한국세관 내부 평가에서 11개의 비공개 의사결정 사례에서 상위 3개 정확도가 82%를 기록하여 실용적 유용성을 입증했다.
  • HS 수첩에서 검색된 문장은 전문가가 제공한 정당화 근거와 매우 유사하게, 재현율과 정밀도가 각각 0.75로 높은 관련성을 보였다.
  • 모델의 출력 형식은 신뢰도 점수, 검색된 문장, 유사 사례를 포함하고 있어 전문가 보고서와 유사하여 신뢰도와 사용성 향상에 기여했다.
  • GRI와 HS 수첩을 통한 맥락 기반 논리 및 규칙 기반 추론의 통합은 순수 패tern 기반 딥러닝 모델보다 모델의 신뢰도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.