Skip to main content
QUICK REVIEW

[논문 리뷰] ALFAA: Active Learning Fingerprint Based Anti-Aliasing for Correcting Developer Identity Errors in Version Control Data

Sadika Amreen, Audris Mockus|arXiv (Cornell University)|2019. 01. 10.
Software Engineering Research참고 문헌 35인용 수 4
한 줄 요약

ALFAA는 행동 지문(시간대 패턴, 수정된 파일, 커밋 메시지 임베딩)을 사용하여 버전 관리 데이터의 개발자 신원 오류를 보정하는 주동 학습 기반의 지문 기반 방법을 제안한다. 이는 동명이인을 해소하는 데 있어 상용 및 연구 방법보다 유의미하게 높은 정확도를 달성하며 오류를 수 차례 줄이고, 신원 보정이 추론된 개발자 사회 네트워크의 정밀도를 크게 향상시킨다는 것을 보여준다.

ABSTRACT

Graphs of developer networks are important for software engineering research and practice. For these graphs to realistically represent the networks, accurate developer identities are imperative. We aim to identify developer identity errors from open source software repositories in VCS, investigate the nature of these errors, design corrective algorithms, and estimate the impact of the errors on networks inferred from this data. We investigate these questions using over 1B Git commits with over 23M recorded author identities. By inspecting the author strings that occur most frequently, we group identity errors into categories. We then augment the author strings with 3 behavioral fingerprints: time-zone frequencies, the set of files modified, and a vector embedding of the commit messages. We create a manually validated set of identities for a subset of OpenStack developers using an active learning approach and use it to fit supervised learning models to predict the identities for the remaining author strings in OpenStack. We compare these predictions with a commercial effort and a leading research method. Finally, we compare network measures for file-induced author networks based on corrected and raw data. We find commits done from different environments, misspellings, organizational IDs, default values, and anonymous IDs to be the major sources of errors. We also find supervised learning methods to reduce errors by several times in comparison to existing methods and the active learning approach to be an effective way to create validated datasets and that correction of developer identity has a large impact on the inference of the social network. We believe that our proposed Active Learning Fingerprint Based Anti-Aliasing (ALFAA) approach will expedite research progress in the software engineering domain for applications that depend upon graphs of developers or other social networks.

연구 동기 및 목표

  • 버전 관리 시스템에서 발생하는 개발자 신원 오류의 일반적인 원인을 식별하고 분류하는 것.
  • 이름 철자 외의 비문법적 행동 지문(예: 시간대 사용, 파일 수정 패턴, 커밋 메시지 임베딩)이 동명이인을 해소하는 데 어떻게 기여할 수 있는지 탐색하는 것.
  • 예측의 불확실성을 우선적으로 검토하여 수동 레이블링 작업을 최소화하는 주동 학습 전략을 통해 레이블링 노력의 최소화.
  • 신원 오류가 사회 네트워크 측정치에 미치는 영향을 평가하고 보정의 필요성을 입증하는 것.
  • 소프트웨어 공학 연구에서 개발자 네트워크 분석의 신뢰성 향상을 위한 확장 가능한 오픈소스 솔루션 개발

제안 방법

  • 행동 지문은 세 가지 출처에서 구성된다: 커밋의 시간대 빈도, 수정된 파일의 집합, 자연어 처리 기법을 사용한 커밋 메시지의 벡터 임베딩.
  • OpenStack 개발자의 수동 검증된 부분집합을 기반으로 훈련된 지도 학습 모델(Random Forest)을 적용하여 검증되지 않은 저자 문자열에 대한 정확한 신원을 예측한다.
  • 주동 학습을 통해 예측의 불확실성이 가장 높은 항목을 반복적으로 선별하여 수동 레이블링을 수행함으로써 인간의 노력은 최소화하면서도 모델 정확도는 최대화한다.
  • 고빈도 저자 문자열을 통해 동명이인을 식별한 후, 지문 기반 매칭을 통해 커밋을 정확한 개발자에게 할당한다.
  • 고불확실성 또는 고빈도 클러스터 내에서만 O(n²) 유사도 계산을 수행함으로써 대규모 데이터셋에 대해 확장 가능성을 확보한다.
  • 보정된 데이터와 원본 데이터 간의 네트워크 측정치(차수 중심성, 클러스터링 계수, 제약도, 고유벡터 중심성)를 비교하여 영향을 평가한다.

실험 결과

연구 질문

  • RQ1버전 관리 데이터에서 발생하는 개발자 신원 오류의 가장 흔한 원인은 무엇인가?
  • RQ2이름 철자 외에 어떤 행동 지문이 소프트웨어 리포지토리에서 동명이인을 해소하는 데 기여할 수 있는가?
  • RQ3높은 정확도를 달성하면서도 수동 레이블링 노력의 최소화는 어떻게 달성할 수 있는가?
  • RQ4제안된 방법은 상용 및 연구 기반의 해소 기법과 비교해 어떻게 다른가?
  • RQ5신원 오류는 추론된 개발자 사회 네트워크의 구조와 측정치에 어떤 영향을 미치는가?

주요 결과

  • 가장 흔한 오류 원인은 환경 특화 커밋, 철자 실수, 조직 또는 도구 ID(예: 'Jenkins Build'), 기본 이름(예: 'root'), 익명 식별자였다.
  • 행동 지문을 사용한 지도 학습은 상용 솔루션과 최근 연구 방법보다 신원 오류를 수 차례 줄였다.
  • 보정된 데이터와 원본 데이터 간의 네트워크 측정치(차수 중심성, 클러스터링 계수, 제약도, 고유벡터 중심성) 간의 스피어만의 rho 상관계수는 모두 0.95 이하였으며, 네트워크 구조에 중대한 영향을 미친다는 것을 시사한다.
  • 개발자 중 25퍼센트 백분위수 기준으로, 보정된 네트워크에서는 동료 수가 210명이었지만 원본 네트워크에서는 단지 113명이었으며, 협업의 수를 심각하게 낮게 평가하고 있음을 보여준다.
  • 고유벡터 중심성은 원본 네트워크에서 0.007이었고 보정된 네트워크에서는 0.024였으며, 전반적으로 영향력과 전문성 평가에 심각한 왜곡이 있었음을 시사한다.
  • 주동 학습 접근법은 최소한의 수동 레이블링으로도 모델 성능을 급격히 향상시켜 대규모 적용 가능성에 대한 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.