[논문 리뷰] C-slow Technique vs Multiprocessor in designing Low Area Customized Instruction set Processor for Embedded Applications
이 논문은 소비자 전자기기 응용 분야에 적합한 단일 핵심 맞춤형 지시 세트 프로세서를 위한 새로운 멀티스레딩 기법인 C-slow 기법을 제안한다. 이 기법은 실시간 운영체제(RTOS)가 필요 없이 단일 데이터패스를 사용하여 스레드를 병렬로 실행할 수 있도록 한다. 이 방법은 낮은 면적과 복잡도로 높은 성능을 달성하며, 전통적인 다중 프로세서 설계 대비 면적 효율성이 뛰어나면서도 소비자 전자기기 응용 분야에서 낮은 전력 소비를 유지한다.
The demand for high performance embedded processors, for consumer electronics, is rapidly increasing for the past few years. Many of these embedded processors depend upon custom built Instruction Ser Architecture (ISA) such as game processor (GPU), multimedia processors, DSP processors etc. Primary requirement for consumer electronic industry is low cost with high performance and low power consumption. A lot of research has been evolved to enhance the performance of embedded processors through parallel computing. But some of them focus superscalar processors i.e. single processors with more resources like Instruction Level Parallelism (ILP) which includes Very Long Instruction Word (VLIW) architecture, custom instruction set extensible processor architecture and others require more number of processing units on a single chip like Thread Level Parallelism (TLP) that includes Simultaneous Multithreading (SMT), Chip Multithreading (CMT) and Chip Multiprocessing (CMP). In this paper, we present a new technique, named C-slow, to enhance performance for embedded processors for consumer electronics by exploiting multithreading technique in single core processors. Without resulting into the complexity of micro controlling with Real Time Operating system (RTOS), C-slowed processor can execute multiple threads in parallel using single datapath of Instruction Set processing element. This technique takes low area & approach complexity of general purpose processor running RTOS.
연구 동기 및 목표
- 소비자 전자기기 분야에서 높은 성능, 낮은 전력 소비, 저비용을 요구하는 임베디드 프로세서에 대한 수요 증가에 대응하기 위해.
- 면적과 복잡도 측면에서 기존의 다중 프로세서 및 슈퍼스칼라 아키텍처의 한계를 극복하기 위해.
- 실시간 운영체제(RTOS)에 의존하지 않고도 병렬 스레드 실행을 지원하는 단일 핵심 프로세서를 설계하기 위해.
- 높은 성능를 달성하기 위해 효율적인 멀티스레딩을 구현하면서 하드웨어 오버헤드를 최소화하기 위해.
- 칩 멀티프로세싱(CMP) 및 기타 병렬 아키텍처에 비해 낮은 면적, 낮은 복잡도의 대안을 제공하기 위해.
제안 방법
- C-slow 기법은 미세한 제어로 스레드 실행을 시간 분할하여 단일 데이터패스에서 다수의 스레드가 병행 실행되도록 한다.
- 이 기법은 단일 코어 내부의 스레드 수준 병렬성(TLP)을 활용하여 복수의 처리 유닛이 필요 없도록 한다.
- 프로세서 데이터패스에 스레드 스케줄링 논리를 직접 통합함으로써 RTOS 오버헤드를 피한다.
- 스레드 컨텍스트 스위칭을 하드웨어 수준에서 지원하는 수정된 지시 세트 아키텍처(ISA)를 사용한다.
- 스레드 간에 기존 데이터패스 자원을 재사용하여 면적을 최소화하고 추가 하드웨어의 필요성을 줄인다.
- 면적, 성능, 전력 측면에서 기존의 다중 프로세서(CMP) 및 슈퍼스칼라 설계와의 비교 평가를 수행한다.
실험 결과
연구 질문
- RQ1하드웨어 복잡도를 증가시키지 않고 단일 핵심 프로세서에서 스레드 수준 병렬성을 어떻게 효율적으로 활용할 수 있는가?
- RQ2새로운 멀티스레딩 기법을 사용함으로써 맞춤형 지시 세트 프로세서가 낮은 면적으로 높은 성능을 달성할 수 있는가?
- RQ3면적 효율성과 성능 측면에서 C-slow 기법은 칩 멀티프로세싱(CMP)과 어떻게 비교되는가?
- RQ4임베디드 시스템에서 C-slow 기법이 RTOS의 필요성을 얼마나 줄일 수 있는가?
- RQ5기존의 다중 프로세서 아키텍처에 비해 C-slow를 통해 멀티스레딩을 구현할 경우 성능 및 면적 오버헤드는 어느 정도인가?
주요 결과
- C-slow 기법은 단일 데이터패스만을 사용하여 다수의 스레드를 병행 실행할 수 있어 하드웨어 면적을 크게 감소시킨다.
- 이 방법은 다중 프로세서 설계와 비슷한 성능를 달성하면서도 상당히 낮은 면적과 전력 소비를 유지한다.
- RTOS가 필요 없어지므로 시스템 복잡도가 감소하고 실시간 반응성이 향상된다.
- 성능, 면적, 복잡도 사이의 균형이 잘 잡혀 있어 저비용 임베디드 응용 분야에 이상적이다.
- 평가 결과 C-slow는 특히 자원이 제한된 환경에서 기존의 다중 프로세서 설계에 비해 면적 효율성이 뛰어나다.
- 복수의 처리 유닛이나 복잡한 제어 논리를 사용하지 않고도 스레드 수준 병렬성을 효과적으로 활용한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.