Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Neural Network Test Coverage: How Far Are We?

Junjie Chen, Ming Yan|arXiv (Cornell University)|2020. 10. 10.
Adversarial Robustness in Machine Learning참고 문헌 51인용 수 18
한 줄 요약

이 연구는 테스트 세트 크기를 통제하면서도 인기 있는 딥 네ural 네트워크(DNN) 테스트 커버리지 메트릭이 테스트 효과성과 상관관계가 있는지 체계적으로 평가한다. 구조적 커버리지 메트릭은 일반적으로 효과성을 예측하지 못하는 반면, 비구조적 커버리지 메트릭은 평가된 모델의 50퍼센트 이상에서 잠재력을 보이며, 이는 DNN 테스트에서 행동 기반 메트릭이 테스트 품질 측정에 더 신뢰할 수 있음을 시사한다.

ABSTRACT

DNN testing is one of the most effective methods to guarantee the quality of DNN. In DNN testing, many test coverage metrics have been proposed to measure test effectiveness, including structural coverage and non-structural coverage (which are classified according to whether considering which structural elements are covered during testing). Those test coverage metrics are proposed based on the assumption: they are correlated with test effectiveness (i.e., the generation of adversarial test inputs or the error-revealing capability of test inputs in DNN testing studies). However, it is still unknown whether the assumption is tenable. In this work, we conducted the first extensive study to systematically validate the assumption by controlling for the size of test sets. In the study, we studied seven typical test coverage metrics based on 9 pairs of datasets and models with great diversity (including four pairs that have never been used to evaluate these test coverage metrics before). The results demonstrate that the assumption fails for structural coverage in general but holds for non-structural coverage on more than half of subjects, indicating that measuring the difference of DNN behaviors between test inputs and training data is more promising than measuring which structural elements are covered by test inputs for measuring test effectiveness. Even so, the current non-structural coverage metrics still can be improved from several aspects such as unfriendly parameters and unstable performance. That indicates that although a lot of test coverage metrics have been proposed before, there is still a lot of room for improvement of measuring test effectiveness in DNN testing, and our study has pointed out some promising directions.

연구 동기 및 목표

  • DNN 테스트에서 테스트 커버리지 메트릭이 테스트 효과성과 상관관계가 있다는 널리 퍼진 가정을 검증하는 것.
  • 구조적 및 비구조적 커버리지 메트릭이 적대적 입력을 생성하거나 오류를 드러내는 능력을 신뢰성 있게 예측할 수 있는지 검토하는 것.
  • 테스트 세트 크기가 커버리지-효과성 상관관계에 미치는 영향을 평가하여 공정한 평가를 보장하는 것.
  • DNN 테스트에서 커버리지 메트릭을 향상시키기 위한 유망한 방향을 규명하는 것.
  • 다양한 모델-데이터 세트 9개 조합(이전에 테스트되지 않은 조합 4개 포함)에서 일곱 가지 커버리지 메트릭을 평가하는 것.

제안 방법

  • 고정된 테스트 세트 크기를 사용하여 커버리지가 테스트 효과성에 미치는 영향을 분리할 수 있도록 제어된 실험을 실시하였다.
  • 다양한 행동 및 구조 기준에 기반한 네 가지 구조적 및 세 가지 비구조적 기준의 대표적 테스트 커버리지 메트릭을 평가하였다.
  • 구조적 및 비구조적 커버리지 메트릭을 비교하기 위해 구조적 커버리지(예: 뉴런, 레이어, 활성 기반)와 비구조적 커버리지(예: 입력 공간 또는 행동 기반)를 사용하였다.
  • 다양한 DNN 모델 9개와 데이터 세트를 사용하였으며, 이 중 네 가지 조합은 이전에 커버리지 메트릭 평가에 사용된 바가 없었다.
  • 테스트 효과성은 테스트 입력이 적대적 예제를 생성하거나 모델의 오류를 드러내는 능력으로 측정되었다.
  • 모든 주제에 대해 커버리지 메트릭과 테스트 효과성 간의 상관관계를 평가하기 위해 통계 분석을 실시하였다.

실험 결과

연구 질문

  • RQ1테스트 세트 크기를 통제할 경우 DNN에서 구조적 테스트 커버리지가 테스트 효과성과 상관관계가 있는가?
  • RQ2동일한 조건에서 DNN에서 비구조적 테스트 커버리지가 테스트 효과성과 상관관계가 있는가?
  • RQ3다양한 DNN 모델과 데이터 세트에서 다양한 커버리지 메트릭은 어떻게 성능을 보이는가?
  • RQ4현재 비구조적 커버리지 메트릭에는 신뢰성 저하를 초래하는 특정한 제약 사항이 있는가?
  • RQ5DNN 테스트에서 커버리지 메트릭을 향상시키기 위한 가장 유망한 방향은 무엇인가?

주요 결과

  • 평가된 모델 전반에 걸쳐 구조적 커버리지 메트릭은 테스트 효과성과 일관된 상관관계를 보이지 않아, 이 메트릭을 사용하는 데 기반하는 가정이 일반적으로 타당하지 않음을 시사한다.
  • 비구조적 커버리지 메트릭은 평가된 대상의 절반 이상에서 테스트 효과성과 유의미한 상관관계를 보이며, 테스트 품질 측정에 더 큰 잠재력을 지닌다.
  • 연구에서 테스트 입력과 훈련 데이터 간의 행동 차이를 측정하는 것이 활성화된 구조적 구성 요소를 추적하는 것보다 더 효과적임을 발견하였다.
  • 현재 비구조적 커버리지 메트릭은 여전히 성능이 불안정하고 파라미터 민감도 문제를 겪고 있어 향후 개선 여지가 있음을 시사한다.
  • 결과적으로 향후 연구는 DNN 테스트 효과성 평가에서 구조적 메트릭보다 행동 기반 커버리지 메트릭을 우선적으로 고려해야 한다고 제안한다.
  • 이전에 테스트되지 않은 네 가지 모델-데이터 세트 조합의 평가 결과, 커버리지 효과성이 다양한 DNN 아키텍처와 데이터 분포 간에 크게 달라질 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.