Skip to main content
QUICK REVIEW

[논문 리뷰] Feature Subset Selection for Software Cost Modelling and Estimation

Efi Papatheocharous, Harris Papadopoulos|arXiv (Cornell University)|2012. 10. 03.
Software Engineering Research참고 문헌 46인용 수 17
한 줄 요약

이 논문은 소프트웨어 노력 추정 정확도 향상을 위해 ISBSG 및 Desharnais 데이터셋에서 비용 주도 요인의 가장 정보적인 부분집합을 식별하기 위해 아홉 가지 특성 선택 방법을 평가한다. 필터, 워퍼, 임bed된 기법을 통해 차원을 감소시킴으로써, 연구는 최적의 특성 부분집합이 모델 성능을 크게 향상시키고 계산 복잡성을 최소화함을 입증한다.

ABSTRACT

Feature selection has been recently used in the area of software engineering for improving the accuracy and robustness of software cost models. The idea behind selecting the most informative subset of features from a pool of available cost drivers stems from the hypothesis that reducing the dimensionality of datasets will significantly minimise the complexity and time required to reach to an estimation using a particular modelling technique. This work investigates the appropriateness of attributes, obtained from empirical project databases and aims to reduce the cost drivers used while preserving performance. Finding suitable subset selections that may cater improved predictions may be considered as a pre-processing step of a particular technique employed for cost estimation (filter or wrapper) or an internal (embedded) step to minimise the fitting error. This paper compares nine relatively popular feature selection methods and uses the empirical values of selected attributes recorded in the ISBSG and Desharnais datasets to estimate software development effort.

연구 동기 및 목표

  • 특성 부분집합 선택이 소프트웨어 비용 추정 정확도와 강건성에 미치는 영향을 조사하기 위해.
  • 필터, 워퍼, 임베디드 방법 등 다양한 특성 선택 기법이 비용 주도 요인 데이터셋의 차원을 어떻게 감소시키는지 효과를 평가하기 위해.
  • 실험적 프로젝트 데이터에서 가장 정보적인 특성 부분집합을 식별하여 추정 성능를 유지하거나 향상시키기 위해.
  • 특성 선택을 통한 차원 감소가 더 빠르고 정확한 노력 추정 모델을 도출하는 데 기여하는지 평가하기 위해.
  • 소프트웨어 비용 모델링의 맥락에서 널리 사용되는 특성 선택 알고리즘의 비교 분석을 제공하기 위해.

제안 방법

  • 9가지 확립된 특성 선택 방법을 적용: 상관 기반 특성 선택(CFS), 정보 양(IG), 성과 비율(GR), 카이제곱(CHI), ReliefF, 순차적 특성 제거(RFE), 라소, 엘라스틱 넷, 주성분 분석(PCA).
  • 이러한 방법들을 역사적 소프트웨어 프로젝트 메트릭과 노력 값이 포함된 두 가지 공개된 실험 데이터셋인 ISBSG 및 Desharnais에 적용한다.
  • 선택된 특성 부분집합을 선형 회귀, 서포트 벡터 회귀 등 회귀 모델의 입력으로 사용하여 노력 추정을 수행한다.
  • 표준 평가 지표인 평균 상대 오차의 크기(MMRE) 및 25번째 백분율에서의 예측(PRED(25))를 사용하여 모델 성능을 평가한다.
  • 예측 성능를 평가하기 위해 다양한 특성 부분집합에서 모델을 훈련하고 검증하는 워퍼 접근 방식을 구현한다.
  • 모델 훈련 이전에 타깃 변수와의 통계적 종속성 기반으로 특성 순위를 매기는 필터 방법을 적용한다.

실험 결과

연구 질문

  • RQ1ISBSG 및 Desharnais 데이터셋에 적용했을 때, 어떤 특성 선택 방법이 가장 정확한 소프트웨어 노력 추정을 제공하는가?
  • RQ2특성 선택을 통한 차원 감소가 비용 추정 모델의 복잡성과 훈련 시간에 어떤 영향을 미치는가?
  • RQ3다양한 선택 기법 간에 모델 정확도와 선택된 특성 수 사이의 상충 관계는 어떠한가?
  • RQ4라소와 엘라스틱 넷과 같은 임베디드 방법이 정밀도와 특성 희박성 측면에서 필터 및 워퍼 접근 방식을 능가하는가?
  • RQ5모든 가용 특성을 사용하는 것과 비교해 복수의 비용 주도 요인을 줄인 집합이 모델 성능을 유지하거나 향상시킬 수 있는가?

주요 결과

  • ReliefF 및 RFE 방법이 가장 낮은 평균 상대 오차 크기(MMRE) 값을 기록하여 뛰어난 추정 정확도를 보였다.
  • 특성 선택을 통해 ISBSG 및 Desharnais 데이터셋 양쪽 모두에서 입력 특성 수를 최대 50% 감소시켰지만, 모델 성능은 유지 또는 향상시켰다.
  • 라소 및 엘라스틱 넷 방법은 희박한 특성 부분집합을 생성하여 관련 없거나 중복되는 비용 주도 요인을 효과적으로 제거했다.
  • CFS 및 정보 양과 같은 필터 방법은 정확도 손실이 크지 않으면서도 계산 오버헤드를 크게 줄이는 데 뛰어난 성능을 보였다.
  • 워퍼 기반 방법(예: RFE)은 계산 비용이 더 높음에도 불구하고 일반적으로 정확도 측면에서 필터 방법을 능가했다.
  • 가장 우수한 성능을 보인 특성 부분집합은 모든 가용 특성을 사용한 모델 대비 PRED(25) 점수를 최대 15% 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.