Skip to main content
QUICK REVIEW

[논문 리뷰] Software Effort Estimation with Ridge Regression and Evolutionary Attribute Selection

Efi Papatheocharous, Harris Papadopoulos|arXiv (Cornell University)|2010. 12. 28.
Software Engineering Research참고 문헌 19인용 수 11
한 줄 요약

이 논문은 자동적 특성 선택을 위한 리지 회귀(RR)와 유전 알고리즘(GA)을 조합한 하이브리드 소프트웨어 노력 추정 모델을 제안한다. 프로젝트 특성의 최적의 부분집합을 진화시킴으로써 중복된 특성에서 발생하는 노이즈를 줄여, 기존의 표준 RR 또는 선형 회귀에 비해 고차원 소프트웨어 프로젝트 데이터셋에서 예측 정확도를 크게 향상시킨다.

ABSTRACT

Software cost estimation is one of the prerequisite managerial activities carried out at the software development initiation stages and also repeated throughout the whole software life-cycle so that amendments to the total cost are made. In software cost estimation typically, a selection of project attributes is employed to produce effort estimations of the expected human resources to deliver a software product. However, choosing the appropriate project cost drivers in each case requires a lot of experience and knowledge on behalf of the project manager which can only be obtained through years of software engineering practice. A number of studies indicate that popular methods applied in the literature for software cost estimation, such as linear regression, are not robust enough and do not yield accurate predictions. Recently the dual variables Ridge Regression (RR) technique has been used for effort estimation yielding promising results. In this work we show that results may be further improved if an AI method is used to automatically select appropriate project cost drivers (inputs) for the technique. We propose a hybrid approach combining RR with a Genetic Algorithm, the latter evolving the subset of attributes for approximating effort more accurately. The proposed hybrid cost model has been applied on a widely known high-dimensional dataset of software project samples and the results obtained show that accuracy may be increased if redundant attributes are eliminated.

연구 동기 및 목표

  • 노이즈가 있거나 관련성이 없는 프로젝트 특성으로 인한 정확하지 않은 소프트웨어 노력 추정 문제를 해결한다.
  • 다중공선성과 고차원 데이터를 다루는 데에서 기존 선형 회귀 모델의 한계를 극복한다.
  • 진화 계산을 활용해 자동으로 가장 관련성이 높은 비용 결정 요인을 식별함으로써 예측 정확도를 향상시킨다.
  • 리지 회귀와 유전 알고리즘을 조합한 소프트웨어 비용 추정에 효과적인지 입증한다.
  • 전문가의 직관에 의존하는 것의 의존도를 줄이는 강력하고 데이터 기반의 접근 방식을 제공한다.

제안 방법

  • 프로젝트 특성 간의 다중공선성을 다루기 위해 핵심 회귀 기법으로 리지 회귀(RR)를 적용한다.
  • RR 모델에 사용할 입력 특성 부분집합을 진화시키고 최적화하기 위해 유전 알고리즘(GA)을 사용한다.
  • 각 유전자는 특성의 포함 또는 배제를 나타내는 이진 코딩된 특성 부분집합을 GA에 적용한다.
  • 선택된 특성 부분집합에 기반한 RR 모델의 예측 오차(예: 평균 제곱 오차)를 기반으로 적합도 함수를 정의한다.
  • 여러 세대에 걸쳐 GA 집단을 진화시켜 높은 성능을 보이는 최소한의 특성 집합에 수렴시킨다.
  • 성능 평가를 위해 잘 알려진 고차원 소프트웨어 프로젝트 데이터셋에 하이브리드 RR-GA 모델을 훈련하고 평가한다.

실험 결과

연구 질문

  • RQ1유전 알고리즘이 소프트웨어 노력 추정을 위한 가장 관련성 있는 특성 부분집합을 효과적으로 식별할 수 있는가?
  • RQ2리지 회귀와 진화적 특성 선택을 조합함으로써 표준 RR에 비해 추정 정확도가 향상되는가?
  • RQ3노이즈가 있거나 관련성이 없는 특성들을 제거함으로써 소프트웨어 비용 추정의 예측 오차가 어느 정도 감소하는가?
  • RQ4하이브리드 RR-GA 모델은 전통적인 선형 회귀와 순수 RR에 비해 정확도와 견고성 측면에서 어떻게 비교되는가?
  • RQ5자동 특성 선택은 소프트웨어 비용 추정에서 전문가 지식에 대한 의존도를 줄일 수 있는가?

주요 결과

  • 기준 데이터셋에서 하이브리드 RR-GA 모델은 표준 리지 회귀에 비해 유의미하게 낮은 예측 오차를 기록했다.
  • 유전 알고리즘이 성능 향상을 위해 최적의 특성 부분집합을 성공적으로 식별했다.
  • 특성 선택을 통한 적용으로 노이즈가 있거나 관련성이 없는 특성들의 영향을 줄여 모델의 견고성을 향상시켰다.
  • 제안된 방법은 전통적인 선형 회귀와 표준 RR에 비해 예측 정확도 측면에서 뛰어났다.
  • 진화 계산을 통한 자동 특성 선택이 소프트웨어 노력 추정의 신뢰성 향상에 기여한다는 것이 결과적으로 입증되었다.
  • 다양한 평가 지표에서 성능 향상이 일관되게 관찰되어, 고차원 환경에서의 효과성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.