[논문 리뷰] Automatic Information Extraction from Piping and Instrumentation Diagrams
이 논문은 깊이 학습 모델—CTPN을 사용한 텍스트 검출 및 FCN을 사용한 기호 세분화를 조합한 하이브리드 접근 방식과 전통적인 이미지 처리 기법을 결합하여, 파이핑 및 인스트루멘테이션 다이어그램(P&IDs)에서 자동 정보 추출을 위한 최초의 엔드 투 엔드 시스템을 제시한다. 파이프라인, 인let, 아웃렛 검출을 위한 전통적 이미지 처리 기법을 활용한 결과, 기호 검출에 있어 높은 정확도(F1-스코어 ≥ 0.86)를 달성하였고, 성공적인 파이프라인 연관성을 통해 트리 기반 데이터 모델을 통해 구조화된 프로세스 흐름 표현이 가능해졌다.
One of the most common modes of representing engineering schematics are Piping and Instrumentation diagrams (P&IDs) that describe the layout of an engineering process flow along with the interconnected process equipment. Over the years, P&ID diagrams have been manually generated, scanned and stored as image files. These files need to be digitized for purposes of inventory management and updation, and easy reference to different components of the schematics. There are several challenging vision problems associated with digitizing real world P&ID diagrams. Real world P&IDs come in several different resolutions, and often contain noisy textual information. Extraction of instrumentation information from these diagrams involves accurate detection of symbols that frequently have minute visual differences between them. Identification of pipelines that may converge and diverge at different points in the image is a further cause for concern. Due to these reasons, to the best of our knowledge, no system has been proposed for end-to-end data extraction from P&ID diagrams. However, with the advent of deep learning and the spectacular successes it has achieved in vision, we hypothesized that it is now possible to re-examine this problem armed with the latest deep learning models. To that end, we present a novel pipeline for information extraction from P&ID sheets via a combination of traditional vision techniques and state-of-the-art deep learning models to identify and isolate pipeline codes, pipelines, inlets and outlets, and for detecting symbols. This is followed by association of the detected components with the appropriate pipeline. The extracted pipeline information is used to populate a tree-like data-structure for capturing the structure of the piping schematics. We evaluated proposed method on a real world dataset of P&ID sheets obtained from an oil firm and have obtained promising results.
연구 동기 및 목표
- 스캔된 이미지로만 저장되며 기계로 읽을 수 있는 구조가 없는 P&ID 다이어그램의 디지털화를 위한 자동화된 시스템 부족 문제를 해결하기 위해.
- 저해상도 이미지, 노이즈가 많은 텍스트, 상당히 유사한 시각적 특성을 가진 기호들 간의 미세한 클래스 간 차이로 인해 발생하는 실제 P&ID 데이터의 과제를 극복하기 위해.
- P&ID에서 공학 데이터를 추출하고 구조화하여 재고 관리 및 프로세스 분석에 활용할 수 있는 강력한 엔드 투 엔드 파이프라인을 개발하기 위해.
- 실제 석유 기업의 실생활 데이터셋을 기반으로 시스템을 평가하여 산업 현장에서의 타당성과 성능을 입증하기 위해.
제안 방법
- 노이즈가 많은 P&ID 이미지 내 텍스트 조각을 검출하고 국소화하기 위해 사전 학습된 커넥티스트 텍스트 제안 네트워크(CTPN)를 활용하였다.
- 자체 데이터셋으로 미세조정된 완전 컨volutional 네트워크(FCN)를 적용하여 밸브 및 계측기 등 총 11개 기호 클래스의 세분화 및 분류를 수행하였다.
- 기하학적 및 연결성 제약 조건을 기반으로 히우리스틱 규칙 기반 방법을 사용하여 파이프라인, 인let, 아웃렛을 검출하고 추적하였다.
- 공학 컴포넌트 검출 결과를 공간적 및 위상적 관계를 기반으로 하는 규칙 기반 연관 모듈을 통해 기반 파이프라인에 기호와 텍스트를 매핑하였다.
- 유체 흐름의 연결성과 계층적 관계를 포괄하는 파이프라인의 연결성을 모델링하기 위해 트리 기반 데이터 구조를 구성하였다.
- 실제 P&ID 데이터셋의 수량이 제한되어 있는 것을 보완하기 위해 데이터 증강 기법을 적용하여 딥러닝 모델의 일반화 능력을 향상시켰다.
실험 결과
연구 질문
- RQ1CTPN 및 FCN과 같은 딥러닝 모델이 상당히 유사한 시각적 특성을 가지며 노이즈가 많은 저해상도 P&ID 이미지에서 텍스트와 기호를 높은 정확도로 검출할 수 있는가?
- RQ2딥러닝과 규칙 기반 방법을 조합한 하이브리드 시스템이 파이프라인 컴포넌트(인let, 아웃렛, 기호)를 올바른 유량 경로에 정확히 검출하고 연관시킬 수 있는가?
- RQ3컴포넌트 연관 후, 트리 기반 데이터 구조가 P&ID 도면의 연결성 및 흐름 토폴로지(구조)를 얼마나 정확히 표현할 수 있는가?
- RQ4실제 산업 현장에서의 실생활 P&ID 시트에서 시스템의 성능은 어떠한가? 특히 시각적 노이즈와 복잡한 레이아웃에 대응하는 능력은 어떠한가?
- RQ5이전의 수동 또는 부분 자동화된 접근 방식의 한계를 극복하고, P&ID에서 엔드 투 엔드 정보 추출을 달성할 수 있는가?
주요 결과
- 히우리스틱 규칙 기반 방법을 통해 인let과 아웃렛 검출에 100% 정확도를 달성하여 컴포넌트 국소화에 대한 높은 강건성을 입증하였다.
- 파이프라인 코드 연관 정확도는 64.1% (64개 중 41개)에 달했으며, 주로 파이프라인 검출 오류와 아웃렛과의 교차 부족으로 인한 제한을 받았다.
- 인let-파이프라인 연관 정확도는 96.8%를 기록하여 흐름 진입 지점이 정확한 경로에 매핑되는 데 강력한 성능을 보였다.
- FCN를 사용한 기호 검출 결과, 11개 모든 클래스에서 F1-스코어가 0.86 이상을 달성하였고, 볼 밸브(ball_valve), 글로브 밸브 비연결(globe_valve_nc), 절연체(insulation) 등 대부분의 클래스에서 정밀도와 재현율이 0.90 초과를 기록하였다.
- 혼동 행렬 분석 결과, 유사한 외관을 가진 기호들 간의 미세한 오분류(예: ball_valve vs. globe_valve)가 발생했지만, '기타' 클래스의 정밀도가 95.5%로 높아 가짜 양성 결과가 감소하였다.
- 교차 엔트로피 손실 곡선을 통해 효과적인 학습이 이루어졌고 과적합 현상이 없음을 확인하였으며, 검증 성능 기반으로 7000 반복 시점에서 모델을 저장하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.