[논문 리뷰] RT-DAP: A Real-Time Data Analytics Platform for Large-scale Industrial Process Monitoring and Control
RT-DAP는 대규모 산업 공정 모니터링 및 제어를 위한 실시간 데이터 분석 플랫폼으로, 마이크로소프트 아크류에서 분산 시간시리즈 데이터베이스, 통합 메시징 프로토콜, 실시간 처리 프레임워크를 활용한다. 이 플랫폼은 저지연 데이터 스트리밍, 집계 및 시각화를 가능하게 하며, 적응형 배치 기법을 통해 HBase I/O 오버헤드를 감소시키고, 최적의 큐 크기 설정을 통해 1000개 태그/초 속도에서 500ms 이내의 처리 성능을 달성한다.
In most process control systems nowadays, process measurements are periodically collected and archived in historians. Analytics applications process the data, and provide results offline or in a time period that is considerably slow in comparison to the performance of the manufacturing process. Along with the proliferation of Internet-of-Things (IoT) and the introduction of "pervasive sensors" technology in process industries, increasing number of sensors and actuators are installed in process plants for pervasive sensing and control, and the volume of produced process data is growing exponentially. To digest these data and meet the ever-growing requirements to increase production efficiency and improve product quality, there needs to be a way to both improve the performance of the analytics system and scale the system to closely monitor a much larger set of plant resources. In this paper, we present a real-time data analytics platform, called RT-DAP, to support large-scale continuous data analytics in process industries. RT-DAP is designed to be able to stream, store, process and visualize a large volume of realtime data flows collected from heterogeneous plant resources, and feedback to the control system and operators in a realtime manner. A prototype of the platform is implemented on Microsoft Azure. Our extensive experiments validate the design methodologies of RT-DAP and demonstrate its efficiency in both component and system levels.
연구 동기 및 목표
- 실시간 산업 데이터 생성과 느린 오프라인 분석 간의 격차를 해소하기 위해.
- 일반 센서 데이터를 활용해 이질적인 공장 자원의 대규모 실시간 모니터링 및 제어를 가능하게 하기 위해.
- 고속의 시간시리즈 산업 데이터를 처리하는 데 있어 전통적 히스토리안 및 일반 목적 플랫폼의 한계를 극복하기 위해.
- 데이터 수신, 저장, 처리, 시각화를 통합한 확장성 있고 저지연의 분석 스택을 설계하기 위해.
- 실시간 분석과 제어 시스템 간 피드백 루프를 닫아 공정 효율성, 안전성, 품질 향상을 도모하기 위해.
제안 방법
- 다양한 공장 자원에서의 실시간 데이터 수신을 표준화하기 위해 통합 메시징 프로토콜을 설계하기 위해.
- 고처리량, 저지연 시간시리즈 데이터 저장 및 쿼리에 최적화된 분산 시간시리즈 데이터베이스(HBase 기반)를 구현하기 위해.
- 공정 분석을 위한 데이터 및 제어 플로우 파이프라인을 설계하기 위한 분석 모델 개발 스튜디오(MDS)를 개발하기 위해.
- HBase I/O 작업과 지연 시간을 줄이기 위해 적응형 배치 기능을 갖춘 유연한 실시간 처리 엔진(Storm)을 통합하기 위해.
- 이질적인 센서 및 액추에이터를 플랫폼에 연결하기 위해 미니멀한 IIoT 현장 게이트웨이(IIoT-FG)를 민노우보드에 배포하기 위해.
- 처리량과 지연 시간을 균형 있게 유지하기 위해 자가 적응형 큐잉을 갖춘 이중 스레드 스푸트 아키텍처를 사용하기 위해.
실험 결과
연구 질문
- RQ1대규모 산업 공장에서 유입되는 고속, 이질적인 시간시리즈 데이터를 처리할 수 있는 실시간 분석 플랫폼은 어떻게 아키텍처화할 수 있는가?
- RQ2지속적인 데이터 집계 중 시간시리즈 데이터베이스에서 I/O 오버헤드를 최소화할 수 있는 설계 패턴은 무엇인가?
- RQ3배치 및 적응형 큐잉은 산업 분석 워크로드에서 실시간 스트림 처리 성능을 어떻게 향상시킬 수 있는가?
- RQ4마이크로소프트 아크류와 같은 클라우드 기반 플랫폼이 산업 공정 제어를 위한 저지연, 확장 가능한 분석을 얼마나 잘 지원할 수 있는가?
- RQ5현장 게이트웨이와 실시간 처리 프레임워크의 통합이 분석과 제어 결정 간 루프를 효과적으로 닫을 수 있는가?
주요 결과
- 최적의 큐 크기 설정을 사용할 경우, RT-DAP 플랫폼은 최대 초당 1000개 태그의 데이터 스트림에 대해 종단 간 처리 시간이 500ms 이내를 달성했다.
- HBase 쓰기 및 스캔 작업이 처리 시간의 대부분을 차지하여 데이터 집계 작업에서 주요 지연 원인이 되었다.
- 최대 큐 크기를 20에서 200으로 증가시킴으로써 HBase 쓰기 시간을 크게 감소시켰고, 이는 시스템 처리량 향상과 지연 감소에 기여했다.
- 큐 크기가 160을 초과할 경우 평균 런타임 큐 크기가 최대값 이하로 안정화되어 효과적인 로드 밸런싱이 이루어졌음을 나타냈다.
- 1200개 태그/초를 초과하는 데이터 속도에서는 처리 시간이 500초 테스트 윈도우를 초과하여 시스템이 데이터 처리를 따라가지 못했다.
- 적응형 배치 기법은 다수의 레코드를 한 번에 처리함으로써 HBase 접근 빈도를 감소시켜 I/O 효율성을 향상시켰고, 동시에 실시간 반응성 손실 없이 운영되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.