Skip to main content

Hyung-Joon Cho

Korea University · Computer Science

About the Lab

Professor Hyung-Joon Cho's research lab specializes in statistical learning and data mining, with a strong focus on developing and evaluating advanced classification and clustering methods for diverse data types. The lab investigates robust statistical models for mixed-type data—particularly combining continuous and categorical variables—by proposing innovative distance measures and variable transformation techniques such as CRIMCOORD. Research also emphasizes practical applications in credit risk modeling, using both binary and ordinal response variables, and improving the interpretability and performance of machine learning algorithms like SVM, decision trees, and logistic regression. The lab integrates methodological innovation with real-world data applications, especially in finance and credit scoring.

data miningclassificationclusteringcredit risk modelingvariable transformation

Research Overview

Papers
44
Total Citations
98
Papers (5y)
9
Primary Field
Computer Science

Research Output Trend

Figures are computed from collected data and may differ slightly.

Publications per year (5y)
9total
2022
2023
2024
2025
2026
Citations per year (5y)
9total
20222023202420252026

Selected Papers

15
1
Article|12 citations·2018
연속형과 범주형 변수가 혼합된 데이터의 군집분석 연구
한지수, 조형준

연속형 변수와 범주형 변수가 함께 존재하는 혼합형 데이터의 군집분석에서 연속형 변수의 경우에 유클리디안 거리처럼 자연스럽게 거리를 정의할 수 있지만, 범주형 변수, 특히 순서가 없는 명목형 변수의 경우에 개체 간 거리 측정이 모호하여 종종 배제되었다. 개체 간 거리를 기반으로 하는 군집분석 방법에서 개체 간 거리의 정의는 매우 핵심적인 문제이므로 명목형 변수의 합리적 정의는 신뢰할 수 있는 군집분석 위해서는 중요한 요소이다. 따라서 두 가지 형태의 변수가 함께 존재하는 경우에 범주형 변수의 거리 측정을 위해 모형화를 위해 종종 이용되는 가변수 변환 방법, 범주의 일치 여부에 따라 0-1로 거리를 부여하는 Gower의 방법, 그리고 변수의 수준 개수 정보를 활용하는 Eskin의 방법 도입하여 혼합형 데이터에 거리를 측정할 수 있도록 군집 분석 결과를 비교하였다. 거리 정의 방법에 의존하지 않는 공정한 비교를 위해 세 가지 평가 측도를 이용하였다. 그 결과, 군집의 퍼짐 정도 및 군집

2
Article|8 citations·2010
앙상블기법을 이용한 다양한 데이터마이닝 성능향상 연구
정연해, 어수행, 문호석, 조형준

본 논문은 8가지 방법의 데이터 마이닝 알고리즘(CART, QUEST, CRUISE, 로지스틱 회귀분석, 선형판별분석, 이차판별분석, 신경망분석, 서포트 벡터 머신) 기법과 단일 알고리즘에 2가지 앙상블기법(배깅, 부스팅)을 적용한 16가지 방법을 바탕으로 총 24가지의 방법을 비교하였다. 알고리즘의 성능 비교를 위하여 13개의 이항반응변수로 구성된 데이터를 사용하였다. 비교 기준은 민감도, 특이도 및 오분류율을 사용하여 데이터 마이닝 기법의 성능향상에 대해 평가하였다.

3
Article|7 citations·2009
혼합효과모형을 이용한 데이터마이닝 알고리즘 비교연구
장지연, 문호석, 이종호, 조형준

본 논문에서는 SAS E-Miner, R 패키지 및 FORTRAN/95로 만들어진 세 가지 프로그램 상에서 데이터마이닝 알고리즘 기법인 로지스틱 회귀분석, 의사결정나무, 신경망분석, 선형판별분석, 이차판별분석, 서포트 벡터 머신 등을 이용, 이항반응변수를 갖는 8개의 데이터에 대해서 각 알고리즘의 성능을 비교분석하였다. 각 알고리즘의 사용 프로그램과 분류 옵션을 기준으로 총 17가지 방법에 대해 오분류율, 민감도 그리고 특이도를 비교기준으로 하여 분석하였다. 최종적으로 각 알고리즘의 순위를 정하기 위해서 17가지 방법을 고정효과로, 8개의 데이터를 랜덤효과로 간주하여 오분류율을 기준으로 혼합효과모형을 적용하였다. 본 논문에서의 실험 결과 radial 분류옵션을 갖는 R의 서포트 벡터머신 경우 가장 낮은 오분류율을 갖는 모형이었고, 또한 R의 선형판별모형 및 로지스틱 회귀분석 모형 또한 근소한 차이로 뒤를 잇는 것으로 분석되었다.

4
Article|6 citations·2013
목표변수의 형태에 따른 신용평점 모형 구축
우현석, 이석형, 조형준

금융시장의 규모가 점점 더 커짐에 따라 고객정보 관리 미숙 또는 부실한 의사결정, 즉 신용 리스크 관리 실패로 인한 손실이 막대하게 증가하고 있다. 따라서 신용 리스크 관리가 점차 더 중요해지고, 이런 신용 리스크를 최소화하는 기본적인 도구인 신용 평점 모형이 절실히 요구된다. 신용평점 모형은 주로 이항형 목표변수만 이용하여 개발 연구되었다. 본 논문에서는 순서형 다항 자료 또는 경시적 이항 자료 같은 다른 형태의 목표 변수를 고려한 신용평점 모형구축 방법을 제시한다. 그 개발된 모형을 실제 자료와 랜덤화한 자료에 적용하여 Kolmogorov-Smirnov 통계량으로 비교 분석한다.

5
Article|6 citations·2012
계수 자료 분석을 위한 의사결정나무에서의 변수선택
이석형, 조형준

의사결정나무는 데이터마이닝에서 사용되는 대표적인 방법으로 모형의 결과가 도식적으로 표현되어 해석과 예측이 쉬운 장점이 있다. 의사결정나무는 대부분 반응변수의 형태가 연속형 또는 범주형 중에 이항 또는 다항일 때 흔히 사용되었다. 또한, 대부분 알고리즘은 CART처럼 전체탐색 방법을 이용하여 분리 변수를 선택하기 때문에 계산 시간이 많이 소요되고, 분류 가능 경우의 수가 많은 변수를 선호하는 경향이 있다. 본 논문에서는 반응변수가 계수인 경우에 의사결정나무 알고리즘을 제안한다. 계수형 자료에 적합한 포아송 모형과 과분산 문제가 있을 경우에 적합한 음이항 모형을 기본으로 이용하고, 잔차 분석을 통한 빠르고 부당한 선호 현상이 없는 분류 선택 방법을 제안한다. 본 논문에서 전체탐색 방법의 문제점과 우리가 제안한 방법의 우수성을 모의실험을 통해 검증한다. 마지막으로 실제 자료를 이용하여 실용성을 보인다.

6
Article|6 citations·2021
분류 분석을 위한 명목형 예측변수 변환 방법
김지우, 조형준

로지스틱회귀모형, 선형판별분류분석, 의사결정나무, 지지벡터기계 같은 다양한 방법으로 수행할 수 있는 분류 분석은 반응변수와 예측변수의 정보를 이용하여 개체를 특정 집단으로 분류하는 것이다. 일반적으로 분류 분석의 모형 추정은 예측변수가 연속형일 때 주로 정의 되어져 있다. 명목형 예측변수를 이용하기 위해 가변수 변환 후에 사용하고 있지만, 이는 반응변수 또는 명목형 예측변수의 범주가 많은 경우에 차원의 기하급수적 증가로 인하여 필요 모수 추정이 불안하여 비정칙 같은 문제점이 종종 발생한다. 적용 가능한 예측변수가 많아지고 다양해지면서 가변수 변환을 적용할 수 없는 경우도 발생한다. 따라서, 분류 분석에서 명목형 예측변수를 효과적으로 사용하기 위해 다른 변환 방법이 필요하다. 대안으로 반응변수의 정보를 반영하여 명목형 범주에 순서를 적절히 부여하는 CRIMCOORD 변환 방법을 소개한다. 이를 분류 분석에서 예측력을 가변수 변환과 비교 분석한다. 실제 자료를 훈령용와 검증용으로 분할하

7
Article|5 citations·2006
최소 침습적 금속판 고정술을 이용한 대퇴골 원위부 골절의 치료
한승범, 채인정, 이순혁, 서동훈, 조형준
8
Article|5 citations·2020
머신러닝을 활용한 계절 시계열 예측
진세종, 조형준

시계열 자료로부터 예측을 수행하기 위해 널리 사용되는 통계적 방법으로 ARIMA모형이 있다. 그러나 ARIMA 모형은 현대에 와서 크고 다양한 형태를 가지는 시계열 자료에서 좋은 예측 성능을 발휘하지 못한다는 단점을 가지고 있다. 본 논문에서는 주기의 특성을 반영하여 ARIMA 모형보다 성능이 좋은 머신러닝 기법을 제안한다. 이에 대한 방법론으로 STL 분해와 Fourier 변수를 사용한다. STL 분해는 데이터를 추세, 계절, 나머지 변수로 나누기 때문에 좀 더 주기의 특성을 반영할 수 있다. 또한, Fourier 변수는 시점에 따라 사인/코사인 형태의 값을 부여하여 서로 비슷한 시점끼리의 자료를 모형에 잘 반영할 수 있다는 장점이 있다. 이처럼 생성된 데이터 중 추세 변수는 ARIMA 모형에 적합하고 나머지 변수들을 선형 회귀모형, 서포트 벡터 회귀, 의사결정 나무 모형 등 7개의 알려진 머신러닝 모형에 적합하여 모의실험과 한국전력 데이터를 사용하여 머신러닝 모형끼리 비교하여 가

9
Article|4 citations·2017
다변량 분위수 회귀나무 모형에 대한 연구
김재오, 조형준, 방성완

분위수 회귀모형은 반응변수의 조건부 분포에 대하여 포괄적이고 유용한 통계적 정보를 제공한다. 그러나 많은 실제 자료는 설명변수와 반응변수가 비선형의 관계를 갖고 있어 전통적인 선형 분위수 회귀모형은 왜곡되고 잘못된 결과를 초래할 수 있다. 또한 자료의 복잡성이 증가하여 반응변수가 여러개인 다변량 자료의 분석에 대한 보다 정확한 예측과 더불어 풍부한 해석에 대한 요구가 증가하고 있다. 이러한 이유로 본 연구에서는 다변량 분위수 회귀나무 모형을 제안하였다. 본 연구에서는 기존의 다변량 회귀나무 모형의 분할변수 선택 알고리즘의 문제점을 지적하고 향상된 분할변수 선택 알고리즘을 제안하였다. 제안한 알고리즘은 합리적인 계산시간으로 적용 가능하며 분할변수 선택에서 편향발생의 문제를 갖지 않는 동시에 기존 방법보다 더 정확하게 분할변수를 선택할 수 있있다. 본 연구에서는 모의실험과 실증 예제를 통해 제안한 방법의 우수한 성능과 유용성을 확인하였다.

10
Article|4 citations·2023
Decision Tree for Mode Estimation
The Korean Data Analysis Society, Donggil Kang, WenXing Yu, HyungJun Cho
The Korean Data Analysis Society

Decision trees are one of the data mining techniques that make predictions by recursively partitioning data structures based on split rules. Since the analysis results can be understood through the tree structure, it has the advantage of having high interpretation power as well as predictive power. In addition, it is used in many fields because it is able to identify nonlinear relationships between response and predictor variables. However, if the purpose of it is to predict the mode of the resp

Artificial IntelligenceComputer Science
11
Article|4 citations·2016
생존 자료와 경시적 자료의 결합모형을 이용한 과학화 전투훈련 분석
김재오, 이슬, 조형준

본 연구는 특수한 특성을 갖는 내생변수로 인하여 일반적인 모형을 활용한 분석이 제한될 때 적용하는 생존 자료와 경시적 자료의 결합모형을 이용하여 대대급 공격 군사작전에 관한 자료를 분석한 것이다. 이는 대한민국 육군의 보병대대와 같은 소부대 군사교리를 검증하고 군사작전 계획을 수립함에 있어 적절한 참고자료로서 활용될 수 있다. 특히 본 연구에서는 개별 전투원의 생존성에 대해 해당 부대에서의 군 복무기간, 부대가 부여받은 전술적 임무, 해당 분대원간 평균 거리가 어떠한 영향을 미치는지를 통계적 모형을 이용하여 확인하였다. 특히 분대원간 평균 거리는 내생적 특성을 갖는 시간 종속 변수이며 측정 오차를 수반하고 의미 있는 중도탈락이 있는 점을 통계적 모형을 수립하는데 주목하였다. 이러한 변수를 포함하는 특성으로 인하여 Cox 비례위험모형과 같은 전통적인 생존분석 모형의 적용은 제한된다. 생존 자료와 경시적 자료의 결합모형은 분대원간 평균 거리와 같은 내생적 시간 종속 변수를 포함한 자료를

12
Article|4 citations·2017
영과잉 계수형 자료 분석을 위한 허들 나무모형 구축
백유민, 조형준

영과잉 계수형 자료란 반응변수가 0 이상의 숫자로 이뤄진 자료 중 0이 과도하게 관측되는 형태를 의미한다. 영과잉 계수형 자료를 분석하기 위한 모형으로 영과잉 포아송 모형, 허들 모형 등이 개발되었으며 이를 위한 의사결정나무 방법론으로 영과잉 포아송 나무모형이 제안되었으나 분류변수선택의 편향과 과도한 계산비용의 문제가 발생하였다. 이를 해결하기 위해 영과잉 자료분석을 위한 의사결정나무가 제안되었지만 특정 형태의 영과잉 계수형 자료만 설명할 수 있다는 한계가 있다. 따라서 본 논문에서는 모든 형태의 영과잉 계수형 자료를 아우를 수 있도록 영과잉 포아송 모형이 아닌 허들 모형을 기반으로 한 의사결정나무 모형을 제안하고자 한다. 또한 분류변수 선택과 분류지점 선택을 분리한 잔차분석방법을 통한 알고리즘을 제안하였다. 이를 분류 가능한 모든 경우를 고려하는, 기존의 의사결정나무 알고리즘으로 널리 알려진 전체탐색 방법과 비교하여 변수 선택과 계산시간의 비효율성이 개선됨을 검증하였다. 마지막으로

13
Article|4 citations·2013
혼합 반응 변수를 위한 의사결정나무에서 분류 변수 선택
천재혁, 문호석, 이석형, 조형준

의사결정나무는 데이터마이닝에 쓰이는 대표적인 알고리즘 중 하나로 분류와 해석, 예측의 장점을 가지고 있다. 일변량 반응변수의 의사결정나무와 동일한 유형의 다변량 반응변수의 의사결정나무는 많은 연구가 되고 있다. 하지만 반응변수가 연속형과 범주형이 혼합된 자료 분석을 위한 의사결정나무는 연구가 제대로 이루어지고 있지 않다. 두 개 이상의 반응 변수를 일변량으로 따로 분석하는 것에 비해 동시에 분석할 경우에 더 간략한 모형으로 두 유형의 반응 변수를 함께 설명하고 해석할 수 있다는 장점이 있다. 기존의 알고리즘은 CART 알고리즘을 확장했기 때문에 분류변수 선택 편의와 과도한 계산비용의 문제가 존재한다. 본 논문에서는 혼합 반응변수 자료 분석을 위한 의사결정나무에서 분류 변수 선택에 대해 연구하였다. 연구 결과로 전체 탐색 알고리즘은 변수의 중요도보다 분할 가능한 수가 많은 변수를 선호하는 경향이 있음을 알 수 있었다. 반면에 잔차 분석 알고리즘은 변수의 분포와 상관없이 변수의 중요도에

14
Article|3 citations·2010
유의한 유전자 탐색 방법의 비교 : EBAM과 SAM 등을 중심으로
정형철, 조형준

본 연구에서는 두 집단 실험 microarray 자료에서, 유의한 발현 증거가 있는 유전자를 탐색 할 때 자주 사용되는 조정유의확률(ADP), Tusher 등(2001)의 SAM, Efron 등(2001)의 EBAM을 사용하여, 각 방법들의 추정량과 검정통계량의 특징을 비교하는 문제를 다루었다. 조정유의확률 방법은 FWER을 주로 통제하기에 가장 보수적인 유전자 탐색 방법이다. 이에 반해 SAM은 전통적인 통계량에 약간의 벌점을 부여한 s-통계량을 사용함으로 조정유의확률 방법에 비해 많은 수의 유전자를 유의하게 탐색하는 경향이 있으며, EBAM은 SAM의 통계량에 비해 상대적으로 벌점 수준이 커서 SAM 보다는 다소 보수적인 선택을 하는 경향이 있었다.

15
Article|3 citations·2015
전술제대 공격작전간 전투원 생존성에 관한 연구
김재오, 조형준, 김각규

본 연구에서는 증강된 보병대대의 과학화 전투훈련 데이터 중 공격작전에 관한 장병들의 생존분석을 실시하였다. 과학화 전투훈련은 KCTC(Korea Combat Training Center)로 불리는 전투훈련장에서 MILES(Multiple Integrated Lazer Engagement System)와 중앙통제장비체계 등 과학화된 훈련장비와 체계 운용하 훈련부대가 적 전술 및 무기체계를 사용하는 전문 대항군과 실시하는 쌍방 자유기동훈련이다. 이는 훈련기간 동안 훈련지역의 모든 데이터가 저장되어 훈련통제 뿐 아니라 분석 및 사후검토를 할 수 있는 첨단화된 군사 훈련으로 통계적 분석이 가능한 데이터를 제공한다. 분석방법은 모수적 분포 가정이 필요하지 않은 Cox의 비례위험모형을 적용하였으며, 보다 풍부하고 용이한 해석을 위해 의사결정나무모형(CART(Classification and Regression Trees), GUIDE(Generalized, Unbiased, Interactio

Research Areas

Information SystemsArtificial Intelligence

Dive deeper into Hyung-Joon Cho's research on Nubint

Open this lab's papers in the app to read with AI, summarize, and cite in your writing.