[논문 리뷰] PP-StructureV2: A Stronger Document Analysis System
PP-StructureV2는 최적화된 모델과 새로운 모듈을 통해 레이아웃 분석, 표 인식, 핵심 정보 추출을 향상시킨 향상된 문서 분석 시스템입니다. 경량화, 지식 증류, 시각적 특징에 의존하지 않는 LayoutXLM 변종을 통해 11배 빠른 추론 속도를 달성하면서도 mAP는 유사 수준을 유지하고, 표 정확도는 6% 향상되었으며, 관계 추출 성능은 9.1% 향상되었습니다.
A large amount of document data exists in unstructured form such as raw images without any text information. Designing a practical document image analysis system is a meaningful but challenging task. In previous work, we proposed an intelligent document analysis system PP-Structure. In order to further upgrade the function and performance of PP-Structure, we propose PP-StructureV2 in this work, which contains two subsystems: Layout Information Extraction and Key Information Extraction. Firstly, we integrate Image Direction Correction module and Layout Restoration module to enhance the functionality of the system. Secondly, 8 practical strategies are utilized in PP-StructureV2 for better performance. For Layout Analysis model, we introduce ultra light-weight detector PP-PicoDet and knowledge distillation algorithm FGD for model lightweighting, which increased the inference speed by 11 times with comparable mAP. For Table Recognition model, we utilize PP-LCNet, CSP-PAN and SLAHead to optimize the backbone module, feature fusion module and decoding module, respectively, which improved the table structure accuracy by 6\% with comparable inference speed. For Key Information Extraction model, we introduce VI-LayoutXLM which is a visual-feature independent LayoutXLM architecture, TB-YX sorting algorithm and U-DML knowledge distillation algorithm, which brought 2.8\% and 9.1\% improvement respectively on the Hmean of Semantic Entity Recognition and Relation Extraction tasks. All the above mentioned models and code are open-sourced in the GitHub repository PaddleOCR.
연구 동기 및 목표
- CPU 및 모바일 장치에서의 실용적 배포를 지원하는 더 강력하고 효율적인 문서 분석 시스템을 개발하기 위해.
- PP-Structure의 한계점인 낮은 CPU 효율성과 기울어진 또는 복잡한 레이아웃 문서에 대한 기능 제한을 해결하기 위해.
- 추론 속도를 희생시키지 않은 채 레이아웃 분석, 표 인식, 핵심 정보 추출 성능을 향상시키기 위해.
- 종단 간 편집 가능한 문서 출력을 위한 이미지 방향 보정 및 레이아웃 복원을 통합하기 위해.
- 지식 증류와 경량 아키텍처 설계를 통해 모델의 효율성과 정확도를 향상시키기 위해.
제안 방법
- 분석 이전에 기울어진 문서 이미지를 처리하기 위해 이미지 방향 보정 모듈을 도입합니다.
- 분석 후 원래 레이아웃을 편집 가능한 워드 파일로 복원하기 위해 레이아웃 복원 모듈을 활용합니다.
- PP-PicoDet(경량 YOLO 기반 검출기)와 FGD 지식 증류를 조합하여 레이아웃 분석 속도를 11배 향상시키고 mAP는 유사 수준을 유지합니다.
- PP-LCNet(백본), CSP-PAN(특징 융합), SLAHead(구조 인식 디코딩)를 활용해 표 인식 모델을 최적화하여 정확도를 6% 향상시켰습니다.
- 일반화 성능과 추론 속도 향상을 위해 시각적 특징에 의존하지 않는 LayoutXLM 변종인 VI-LayoutXLM을 제안합니다.
- 독해 순서 정렬을 위한 TB-YX 정렬과 U-DML 지식 증류를 적용하여 관계 추출 성능을 추가로 향상시켰습니다.
실험 결과
연구 질문
- RQ1정확도를 유지하거나 향상시키면서 문서 분석 시스템의 속도를 크게 향상시킬 수 있는 방법은 무엇인가요?
- RQ2모델의 경량화와 지식 증류를 통해 레이아웃 분석, 표 인식, 핵심 정보 추출 성능에 어떤 향상이 이루어질 수 있나요?
- RQ3시각적 특징에 의존하지 않는 LayoutXLM 변종이 핵심 정보 추출 작업에서 성능과 추론 속도 향상에 기여할 수 있나요?
- RQ4새로운 모듈인 이미지 방향 보정 및 레이아웃 복원 모듈은 시스템의 강성과 사용성 향상에 얼마나 효과적인가요?
- RQ5SLAHead 및 TB-YX 정렬과 같은 최적화된 구성 요소는 문서 이해에서 구조 정확도와 관계 추출 성능 향상에 어느 정도 기여합니까?
주요 결과
- PP-PicoDet와 FGD 지식 증류를 활용해 이전 버전 대비 레이아웃 분석에서 11배 빠른 추론 속도를 달성했으며, mAP는 유사 수준을 유지했습니다.
- PP-LCNet, CSP-PAN, SLAHead를 사용해 PubTabNet에서 표 인식 정확도를 6% 향상시켰고, 추론 시간은 유사 수준을 유지했습니다.
- VI-LayoutXLM 모델은 LayoutXLM 대비 SER에서 Hmean이 0.96% 높고, XFUND-zh에서 RE Hmean은 9.1% 향상되었으며, 모델 크기는 감소하고 추론 속도는 빨라졌습니다.
- TB-YX 정렬 알고리즘은 XFUND-zh에서 RE Hmean을 71.87%에서 78.81%로 높여, 독해 순서의 중요성을 입증했습니다.
- U-DML 지식 증류를 통해 XFUND-zh에서 RE Hmean을 83.92%로 높였고, 속도 저하가 최소 수준이었으며, 강력한 일반화 능력과 효율성을 보였습니다.
- 모든 하위 작업—레이아웃 분석, 표 인식, 핵심 정보 추출—에서 PP-Structure를 초월했으며, CPU 및 모바일 배포에 더 적합한 성능을 보였습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.