Skip to main content
QUICK REVIEW

[논문 리뷰] Automated labeling of bugs and tickets using attention-based mechanisms in recurrent neural networks

Volodymyr Lyubinets, Taras Boiko|arXiv (Cornell University)|2018. 07. 08.
Topic Modeling참고 문헌 7인용 수 4
한 줄 요약

이 논문은 소프트웨어 버그 및 지원 티켓의 자동 다중 클래스 레이블링을 위한 새로운 계층적 어텐션 기반 순환 신경망(RNN)과 게이트드 순환 단위(GRUs) 및 얕은 보조 네트워크를 제안한다. 이는 이전의 방법들을 능가하며 크롬 버그 트래커 데이터셋에서 88.2%의 정확도와 0.879의 F1 스코어를 기록했고, 소프트웨어 공학을 위한 자연어 처리 연구를 위한 두 개의 공개 데이터셋을 제공한다.

ABSTRACT

We explore solutions for automated labeling of content in bug trackers and customer support systems. In order to do that, we classify content in terms of several criteria, such as priority or product area. In the first part of the paper, we provide an overview of existing methods used for text classification. These methods fall into two categories - the ones that rely on neural networks and the ones that don't. We evaluate results of several solutions of both kinds. In the second part of the paper we present our own recurrent neural network solution based on hierarchical attention paradigm. It consists of several Hierarchical Attention network blocks with varying Gated Recurrent Unit cell sizes and a complementary shallow network that goes alongside. Lastly, we evaluate above-mentioned methods when predicting fields from two datasets - Arch Linux bug tracker and Chromium bug tracker. Our contributions include a comprehensive benchmark between a variety of methods on relevant datasets; a novel solution that outperforms previous generation methods; and two new datasets that are made public for further research.

연구 동기 및 목표

  • 우선순위 및 제품 영역과 같은 여러 기준에 따라 수작업으로 시간이 오래 걸리는 소프트웨어 버그 및 고객 지원 티켓의 레이블링 과제를 해결하기 위해.
  • 실제 소프트웨어 및 지원 시스템에서의 다중 클래스 텍스트 분류를 위한 고전적(예: TF-IDF와 SVM, 나이브 베이즈) 및 현대적인 딥러닝 방법을 비교 평가하기 위해.
  • 성능 향상을 위해 게이트드 순환 단위(GRU) 셀과 보조적인 얕은 네트워크를 갖춘 새로운 계층적 어텐션 기반 RNN 모델을 개발하고 평가하기 위해.
  • 향후 연구를 지원하기 위해 아크 리눅스와 크롬 버그 트래커에서 유래한 두 개의 새로운 공개 데이터셋을 제공하기 위해.

제안 방법

  • 단어 수준 및 문장 수준에서 텍스트를 모델링하기 위해 게이트드 순환 단위(GRUs)로 구성된 여러 개의 스택된 블록을 갖춘 계층적 어텐션 메커니즘을 적용한다.
  • 입력 텍스트를 표현하기 위해 Word2Vec을 통해 훈련된 워드 임베딩을 사용하여 의미적 표현을 효과적으로 학습할 수 있도록 한다.
  • 주 RNN의 보조 분지로 기능을 향상시키고 일반화 성능을 향상시키기 위해 얕은 피드포워드 네트워크를 도입한다.
  • 과적합을 줄이기 위해 RNN과 완전 연결층 사이에 드롭아웃 정규화를 적용하며, 드롭아웃 비율은 0.5로 설정한다.
  • 그리드 서치를 통해 학습률를 최적화하고, RMSprop 알고리즘을 사용하여 모델을 최적화한다.
  • 15%의 데이터를 테스트용으로 확보한 채로, 아크 리눅스와 크롬 버그 트래커라는 두 개의 실제 세계 데이터셋에서 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1TF-IDF와 SVM, 나이브 베이즈와 같은 고전적 텍스트 분류 방법은 소프트웨어 이슈 레이블을 분류하는 데서 현대적인 딥러닝 접근 방식과 어떻게 비교되는가?
  • RQ2GRU 셀과 얕은 보조 네트워크를 갖춘 계층적 어텐션 기반 RNN은 기존의 최신 기술 수준의 모델보다 다중 클래스 버그 및 티켓 레이블링에서 더 뛰어난 성능을 내는가?
  • RQ3어텐션 메커니즘과 잔여 연결과 같은 아키텍처 구성 요소가 버그 트래커에서의 저자원, 구조화된 텍스트에서의 분류 성능에 어떤 영향을 미치는가?
  • RQ4드롭아웃 비율과 학습률와 같은 다양한 하이퍼파라미터는 실제 소프트웨어 이슈 데이터셋에서 모델의 일반화 능력과 강건성에 어떤 영향을 미치는가?
  • RQ5제안된 모델이 리눅스 커널 이슈와 크롬 기능 요청과 같은 다양한 도메인 간에서 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 계층적 어텐션 RNN은 GRU와 얕은 네트워크를 갖추고 있어 아크 리눅스 버그 트래커 데이터셋에서 우선순위 분류(9개 클래스)에 대해 69.1%의 정확도와 0.579의 F1 스코어를 기록했으며, 모든 기준 모델을 능가했다.
  • 크롬 버그 트래커 데이터셋에서 유형 분류(3개 클래스)에 대해 88.2%의 정확도와 0.879의 F1 스코어를 기록했으며, 이는 다음으로 좋은 방법인 DeepTriage보다 정확도에서 6.6% 포인트 높았다.
  • 고전적 방법인 TF-IDF와 SVM은 저자원 환경에서 강력한 성능(아크 리눅스 우선순위에서 65.0% 정확도)을 보이며 여전히 관련성이 있음을 입증했다.
  • 나이브 베이즈는 다중 클래스 작업에서 성능이 열악했으며 아크 리눅스 우선순위에서 뿐만 아니라 51.6%의 정확도를 기록하여 복잡한 분류 시나리오에서의 한계를 확인했다.
  • 모델은 크롬 데이터셋에선 뛰어난 성능를 보였지만 아크 리눅스의 제품 영역 분류(16개 클래스)에선 성능이 떨어졌으며, 이는 세밀한 분류에서 도메인 특화된 과제가 있음을 시사한다.
  • 이 연구는 아크 리눅스와 크롬 버그 트래커에서 유래한 두 개의 새로운 공개 데이터셋을 제공하여 향후 자연어 처리를 위한 소프트웨어 공학 분야의 벤치마킹과 재현 가능성을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.