Skip to main content
QUICK REVIEW

[논문 리뷰] A Reinforcement Learning-assisted Genetic Programming Algorithm for Team Formation Problem Considering Person-Job Matching

Yangyang Guo, Hao Wang|arXiv (Cornell University)|2023. 04. 08.
Metaheuristic Optimization Algorithms Research인용 수 4
한 줄 요약

이 논문은 인적자원-업무 매칭(TFP-PJM) 문제를 해결하기 위해 강화학습 기반 유전적 프로그래밍(RL-GP) 알고리즘을 제안한다. 이 알고리즘은 매칭 점수를 정량화하기 위해 이차수 퍼지 수를 통합하고, 탐색과 이용의 균형을 위해 강화학습을 사용해 네 가지 인구 탐색 모드 중 하나를 동적으로 선택한다. 이 방법은 기준 GP, 휠수 및 메타휴리스틱 알고리즘 대비 최대 10배 빠른 학습 시간과 뛰어난 팀 효율성을 달성한다.

ABSTRACT

An efficient team is essential for the company to successfully complete new projects. To solve the team formation problem considering person-job matching (TFP-PJM), a 0-1 integer programming model is constructed, which considers both person-job matching and team members' willingness to communicate on team efficiency, with the person-job matching score calculated using intuitionistic fuzzy numbers. Then, a reinforcement learning-assisted genetic programming algorithm (RL-GP) is proposed to enhance the quality of solutions. The RL-GP adopts the ensemble population strategies. Before the population evolution at each generation, the agent selects one from four population search modes according to the information obtained, thus realizing a sound balance of exploration and exploitation. In addition, surrogate models are used in the algorithm to evaluate the formation plans generated by individuals, which speeds up the algorithm learning process. Afterward, a series of comparison experiments are conducted to verify the overall performance of RL-GP and the effectiveness of the improved strategies within the algorithm. The hyper-heuristic rules obtained through efficient learning can be utilized as decision-making aids when forming project teams. This study reveals the advantages of reinforcement learning methods, ensemble strategies, and the surrogate model applied to the GP framework. The diversity and intelligent selection of search patterns along with fast adaptation evaluation, are distinct features that enable RL-GP to be deployed in real-world enterprise environments.

연구 동기 및 목표

  • 인적자원-업무 매칭과 소통 의지 요소를 통합하여 고효율 프로젝트 팀을 구성하는 데 도전한다.
  • 전통적 메타휴리스틱 기법이 TFP-PJM 문제에 대해 탐색 효율성과 파라미터 민감도 측면에서 겪는 한계를 극복한다.
  • 강화학습을 활용해 탐색 전략을 지능적으로 적응시키는 초휴리스틱 GP 프레임워크를 개발한다.
  • 집합 인구 전략과 서rogate 모델 기반 평가를 통해 해 품질과 수렴 속도를 향상시킨다.
  • 학습된 일반화 가능한 규칙을 활용해 기업 환경에서의 실질적 팀 구성 의사결정 지원 힌트를 제공한다.

제안 방법

  • 인적자원-업무 매칭 점수를 정량화하기 위해 이차수 퍼지 수를 사용하는 0-1 정수계획모델로 TFP-PJM을 수립한다.
  • 강화학습 에이전트가 상태 정보를 기반으로 네 가지 인구 탐색 모드(예: 탐색, 이용) 중 하나를 선택하는 RL-GP 알고리즘을 설계한다.
  • 강화학습 에이전트가 세대 간에 탐색과 이용의 균형을 동적으로 조절하는 집합 인구 전략을 구현한다.
  • 팀 효율을 전체 계산 없이 예측하기 위해 K-최근접 이웃(K-NN) 서rogate 모델을 통합한다.
  • 진화 과정 중에 실시간으로 서rogate 모델을 업데이트하여 예측 정확도를 향상시키고 탐색을 더 효과적으로 이끈다.
  • 저수준 규칙을 고수준 히어리스틱으로 조합하는 GP 개체를 진화시켜 팀 구성에 활용하며, 문제 규모에 따라 구조 복잡도를 적응적으로 조정한다.

실험 결과

연구 질문

  • RQ1강화학습이 팀 구성에 대한 유전적 프로그래밍 프레임워크 내 탐색 모드 선택을 효과적으로 이끌 수 있는가?
  • RQ2서rogate 모델의 통합이 TFP-PJM 문제 해결 시 수렴 속도와 해 품질에 어떤 영향을 미치는가?
  • RQ3집합 인구 전략이 GP 기반 팀 구성에서 탐색과 이용의 균형을 어느 정도 향상시키는가?
  • RQ4학습된 히어리스틱 규칙은 다양한 팀 규모와 기술-위치 비율에서 얼마나 일반화되는가?
  • RQ5RL-GP 알고리즘이 해 품질과 계산 효율성 측면에서 기존 GP, 유전 알고리즘, 가변 이웃 탐색보다 뛰어나게 성능을 발휘할 수 있는가?

주요 결과

  • RL-GP 알고리즘은 다른 GP 방법에 비해 학습 시간을 1/5에서 1/10 수준으로 단축시켜 규칙 탐색 과정을 크게 가속화한다.
  • RL-GP가 생성한 히어리스틱은 구성된 히어리스틱과 기준 메타휴리스틱(예: 유전 알고리즘, 가변 이웃 탐색)보다 더 높은 팀 효율성을 달성한다.
  • 팀 규모가 100명과 200명인 다양한 조건에서도 알고리즘이 안정적으로 성능을 발휘하며, 잘 작동하는 히어리스틱은 구조적 유사성을 보여 안정적인 학습 행동을 나타낸다.
  • 서rogate 모델은 평가를 효과적으로 가속화하여 더 빠른 적응과 향상된 수렴을 가능하게 하되, 해 품질을 손상시키지 않는다.
  • 중간 깊이의 히어리스틱은 더 뛰어난 일반화 성능를 보이며, 더 깊은 히어리스틱은 특정 인스턴스에서는 잘 작동하지만 광범위한 적용성은 떨어진다.
  • 강화학습 에이전트는 문제 인스턴스 간 유사한 탐색 패턴을 선호하는 경향을 보이며, 상태 정보에 기반한 일관된 전략 선택을 학습한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.