Woo-Ju Kim
Yonsei University · Physics and Astronomy
About the Lab
Professor Woo-Ju Kim's research lab specializes in natural language processing, big data analytics, and intelligent information retrieval systems. The lab focuses on advancing text mining and sentiment analysis using deep learning techniques, particularly for Korean text, while exploring personalized recommendation systems in social media and collaborative tagging environments. The lab also investigates the integration of emerging technologies such as 3D depth sensing and IoT for intuitive human-device interaction, aiming to enhance user experience in smart environments.
Research Overview
Research Output Trend
Figures are computed from collected data and may differ slightly.
Selected Papers
15기존의 문서 검색 방법론은 TF-IDF와 같은 벡터공간모델을 활용한 키워드 기반 방법론을 사용한다. 키워드 기반의 문서검색방법론으로는 문제가 몇몇 문제점이 나타날 수 있다. 먼저 몇 개의 키워드로 전체의 의미를 나타내기 힘들 수 있다. 또 기존의 키워드 기반의 방법론을 사용하면 의미상으로 비슷하지만 모양이 다른 동의어를 사용한 문서의 경우 두 문서 간에 일치하는 단어들의 특성치만 고려하여 관련이 있는 문서를 제대로 검색하지 못하거나 그 유사도를 낮게 평가할 수 있다. 본 연구는 문서를 기반으로 한 검색방법을 제안한다. Centrality를 사용해 쿼리 문서의 특성 벡터를 구하고 Word2vec알고리즘을 사용하여 단어의 모양이 아닌 단어의 의미를 고려할 수 있는 특성 벡터를 만들어 검색 성능의 향상과 더불어 유사한 단어를 사용한 문서를 찾을 수 있다.
오늘날 인터넷의 보편화와 소셜 미디어 및 스마트 기기의 발전으로 인해 정보의 양이 급격히 증가함에 따라 비즈니스 영역에 있어서 새로운 기회와 도전의 시기를 맞고 있다. 빅 데이터라 불리는 이러한 수많은 정보들은 기업이 효율적인 의사결정을 지원할 수 있도록 도와줄 수 있으며, 또한 다른 기업과의 비즈니스 경쟁에서 경쟁우위를 차지하는 데 아주 중요한 역할을 한다. 이러한 의사결정을 지원하기 위해서는 빅 데이터를 효과적으로 분석할 수 있는 방법론이 필요할 뿐 아니라 이를 지원할 수 있는 다양한 인프라를 필요로 한다. 따라서 본 논문에서는 빅 데이터를 분석하기 위한 고급분석 기법과 이를 지원하기 위한 기술 요소들을 도출하고, 향후의 발전 방향에 대해 논하고자 한다. 이러한 분석 기법과 기술을 통한 정확하고 신뢰성 높으며 신속한 의사결정은 기업이 고객의 요구를 신속히 수용하고 반영함으로써 기업의 수익 창출 및 시장을 선점하는 중요한 요인으로 작용할 수 있다.
웹 2.0을 이끌어가는 원동력이라고 할 수 있는 일반 개인 사용자의 참여와 공유는 블로그,소셜 네트워크(Social Network), 집단지성, 소셜 북마크(Social Bookmark), 태깅(Tagging)등의 다양한 형태로 나타나고 있다. 이 중에서 소셜 북마크는 개인이 사용하는 북마크를 웹에 추가하여 공유함으로써, 다수의 사람들이 유용하다고 생각하는 북마크에 대한 정보를 기반으로 한 다양한 서비스를 제공하는 개념이다. 딜리셔스(Delicious.com)는 소셜 북마크 서비스의 대표적인 사례라고 할 수 있으며, 북마크에 사용자들이 붙인 태그를 이용하여 검색서비스를 제공한다. 본 논문은 북마크 검색에 대해 개인화된 검색결과를 추천하기 위하여사용자 태그를 기반으로 하여 딜리셔스가 제공하는 북마크들의 순위를 재순위화 하는 방법론을 제안하였다. 또한 태그유사도를 기반으로 한 태그 네트워크를 이용하여 사용자의 검색어에 의미적으로 유사한 다른 태그들도 순위에 반영될 수 있도록 하였다. 그
정보통신 기기들의 가격하락과 인터넷의 발전은 사물인터넷이라는 새로운 분야를 탄생시켰다. 일상에 접하는 모든 사물들이 인터넷으로 연결되어 새로운 서비스를 창출하는 사물인터넷은 빅데이터와 결합되어 기존에 볼 수 없었던 새로운 형태의 비즈니스 영역을 개척해 나가고 있다. 이에 사물인터넷의 전망은 그 활용도에 있어서 무궁무진 하다고 말할 수 있다. 또한 이러한 사물인터넷 장비들의 원활한 연결을 위한 표준화 기관들의 연구도 활발한 편이다. 그러나 이러한 연구 중에 우리가 간과하는 부분이 있다. 사물인터넷 장비를 제어하거나 정보를 획득하기 위해서 장비와의 연동문제(IP주소, Wi-Fi, Bluetooth, NFC 등) 및 관련 애플리케이션 소프트웨어 또는 앱을 별도로 개발을 해야 한다. 이러한 문제를 해결하기 위해 기존의 연구방식들은 GPS 또는 마커를 이용한 증강현실 연구가 이루어져 왔다. 하지만 별도의 마커가 필요하고 마커의 경우 가까운 곳만 인식하는 단점을 갖는다. 또한 2D 기반의 카메
감성분석은 텍스트 문서의 감성을 분류하는 문서 분류의 한 분야이다. 딥러닝을 이용한 감성분석 방법론은 문서를 토큰화 후 임베딩을 통해 문장벡터를 얻는 과정과 벡터화된 문서를 분류하는 과정으로 나눌 수 있다. 기존 연구들의 방식들을 리뷰하고 어떤 방식의 임베딩 방법과 딥러닝 모델이 한국어 문서에 적합한지 감성분석에 비교 실험을 통해 한국어에 적합한 방법론을 찾아낸다. 문서 전처리 방법은 문서를 단어, 음절 그리고 음소 단위로 토큰화 하는 방법을 비교하였다. 또한, 모델을 CNN부터 LSTM, Bi-LSTM, Stacked Bi-LSTM, 새롭게 제안하는 Parallel Stacked Bidirectional LSTM 모델까지 네이버영화 리뷰 데이터셋인 NSMC에 대해 비교 실험을 하였다. 제안된 모델의 성능이 기존의 기본 딥러닝 모델에 비해 높은 성능을 보임을 확인하였고, 다른 전처리를 통해 학습된 모델간의 앙상블을 통해 보다 최고 성능인 88.95%의 분류 정확도를 달성하였다.
정보를 전달하고 여론을 형성하는 전통적인 매스미디어의 기능이 ICT 기술의 발전으로 소셜미디어를 통해 정보와 의견을 공유하는 환경으로 급격하게 변해 왔으며, 그 영향력을 더욱 강화시키고 있다. 즉, 일반 대중들이 소셜미디어를 통해 정치·사회· 경제 변화에 대한 여론을 생산하고 공유하는 여론의 영향력이 갈수록 커지고 있는 것이 확인되고 있으며, 그 변화는 선거활동과같은 정치 분야에서 활용되고 있다. 소셜미디어를 활용해서 대중들의 의사를 파악하고, 반영하기 위한 노력은 정치 영역뿐만 아니라 공공 영역에서도 활발하게 이루어지고 있다. 본 논문은 교육분야 정책과정에서 소셜미디어 기반 여론을 활용하기 위한 가능성을 탐색하는 것을 목적으로 한다. 이를 위해 교육정책 중 소프트웨어교육에 관한 키워드를 중심으로 데이터를 수집하고, 문서의 주요 토픽과 토픽별 출현 확률, 토픽 트렌드를 분석하였다. 그 결과 ‘국내 컴퓨터 교육 시간’토픽이 전체의 43.99%를 차지하였으며, ‘프라임 사업 선정’토픽이
RSS는 향후 IT와 관련된 전 분야의 변화를 주도할 것으로 기대되는 웹 2.0의 핵심적인 요소이다. 뉴스, 블로그, 멀티미디어, 의학, 학술 등 다양한 분야에서 웹 콘텐츠의 지속적인 배포를 위해 활발히 사용되고 있으며, 전자상거래에서도 향후 효과적인 마케팅 수단이 될 것으로 예측되고 있다. 본 논문에서는 현재 국내 쇼핑몰에서 활용되고 있는 RSS의 문제점들을 분석하고, 이로부터 RSS의 효과적인 전자상거래 적용을 위한 요구사항들을 제안하였다. 그리고, 요구사항의 구현과 관련된 다양한 이슈들과 해결책을 제시한 후, 이를 기반으로 전자상거래를 위한 지능형 RSS 프레임워크를 제안하였다. 제시된 프레임워크에서 RSS 정보의 의미 해석을 위해서는 RSS 기반의 정보 제공자와 RSS 리더기 사이에 형식적 상호운용성과 의미적 상호운용성이 보장되어야 한다. 본 논문에서는 시맨틱 웹을 이용해 이와 같은 상호운용성을 구현하는 방안을 제시하였다.
Semantic Web society initially focused only on data but has gradually moved toward knowledge. Recently rule beyond ontology has emerged as a key element of the Semantic Web. All of these activities are obviously aiming at making data and knowledge on the Web sharable and reusable between various entities around the world. If one of ultimate visions of the Semantic Web is to increase human’s decision making quality assisted by machines, there is a missing but important part to be shared and reuse
웹 3.0으로 진화중인 웹 환경 하에서 블로그는 사용자 주도적인 웹의 특성을 가장 잘 표현하는 집합체 중 하나로, 기존의 웹 정보자원과 구분되는 새로운 형태의 지식베이스로써의역할을 담당하고 있다. 기존의 웹 정보자원들이 사이트 단위로 광범위한 주제를 다루었던것에 반해, 블로그의 정보자원은 사용자의 관심사에 따라 특정 정보들이 블로그 단위로 밀집되어 있으며 또한 사용자 태깅에 의해 게시된 정보자원에 대한 분류기준을 가지고 있다. 본 연구에서는 이러한 블로그의 특징들을 이용하여 보다 좀 더 효과적인 정보검색에 활용하기 위하여 블로그의 제목 키워드나 태그를 활용하여 태그 계층구조를 만들고 그 계층구조를적용한 포스트군집화 방법론을 개발하여 기존의 블로그 검색과는 다른 특성을 가진 검색결과를 제시하였다. 이를 위하여 블로그 태그간의 관계성이 반영된 태그 계층구조를 생성하고,태그 유사도에 따른 태그군집화 방법을 개발하였다. 본 논문은 제안된 방법론을 구현한 프로토타입 시스템을 통해 실제사례에서
인터넷 환경에서 월드 와이드 웹이 등장한 이후 웹을 통해 수많은 웹 페이지들이 생산됨에 따라 사용자가 원하는 정보를 검색하기 위한 다양한 형태의 검색 서비스가 여러 분야에서 개발되어 활용되고 있다. 특히 법령 검색은 사용자가 현재 자신이 처한 상황에 필요한 법령을 검색하여 법령에 대한 지식을 얻기 위한 창구로써 국민의 편의를 제공하기 위해 반드시 필요한 서비스 중 하나이다. 이에 법제처는 2009년부터 국민 누구나 편리하게 법령에 관련된 정보를 검색할 수 있도록 국가의 법령뿐만 아니라 행정규칙이나 판례 등 모든 법령정보를 검색할 수 있는 검색 서비스를 제공하고 있다. 하지만 현재까지의 검색엔진 기술은 기본적으로 사용자가 입력한 질의어를 문서에 포함하고 있는지의 여부에 따라 해당 문서를 검색 결과로 제시한다. 법령 검색 서비스 또한 해당 법령에 등장하는 키워드를 활용하여 사용자에게 검색 결과를 제공해주고 있다. 따라서 법제처의 이런 노력에도 불구하고 법령이 전문가의 시각에서 작성되었기
The Semantic Web technology, purporting to share, to reuse and to process by machines data stored in the Web environment, incessantly evolves to help human decision making; in particular, decision making based on data, or quantitative decision making. This trend drives researchers to fill the gap with strenuous efforts between the current state of the technology and the terminus of this evolution. The Semantic Web Constraint Language (SWCL) together with SWRL is one of these endeavors to achieve
The analysis of foreign aircraft appearing suddenly in air defense identification zones requires a lot of cost and time. This study aims to develop a pre-trained model that can identify neighboring military aircraft based on aircraft photographs available on the web and present a model that can determine which aircraft corresponds to based on aerial photographs taken by allies. The advantages of this model are to reduce the cost and time required for model classification by proposing a pre-train
Since media articles, which have a great influence on public opinion, are transmitted to the public through various media, it is very difficult to analyze them manually. There are many discussions on methods that can collect, process, and analyze documents in the academia, but this is mostly done in the areas related to politics and stocks, and national-defense articles are poorly researched. In this study, we will explain how to build an automatic analysis system of national defense articles th
본 연구는 질의 응답(QA) 시스템에서 사용하는 개체명 인식(NER)의 성능을 향상시키기 위하여 시퀀스 태깅방법론을 적용한 새로운 방법론을 제안한다. 사용자의 질의를 입력 받아 데이터베이스에 저장된 정답을 추출하기 위해서는 사람의 언어를 컴퓨터가 알아들을 수 있도록 구조화 질의어(SQL)와 같은 데이터베이스의 언어로전환하는 과정이 필요한데, 개체명 인식은 사용자의 질의에서 데이터베이스에 포함된 클래스나 데이터 명을 식별하는 과정이다. 기존의 데이터베이스에서 질의에 포함된 단어를 검색하여 개체명을 인식하는 방식은 동음이의어와 문장성분 구를 문맥을 고려하여 식별하지 못한다. 다수의 검색 결과가 존재하면 그들 모두를 결과로 반환하기 때문에 질의에 대한 해석이 여러 가지가 나올 수 있고, 계산을 위한 시간복잡도가 커진다. 본 연구에서는 이러한 단점을 극복하기 위해 신경망 기반의 방법론을 사용하여 질의가 가지는 문맥적 의미를 반영함으로써이러한 문제를 해결하고자 했고 신경망 기반의 방법론의 문
철도교통 분야의 연구개발사업은 여러 법령과 긴밀하게 관련되어 있기 때문에, 연구개발을성공적으로 수행했더라도 법령에 의해 제약되어 연구개발 결과의 실질적인 사업화 또는 실용화를이루어내지 못하는 사례가 발생하고 있다. 본 논문에서는 이러한 사례를 방지하기 위한 방편으로철도교통 분야에서 진행되는 연구개발사업과 관련된 법령을 검색할 수 있는 법령검색시스템의모델을 제시하였다. 사업 내용을 설명하는 연구개발계획서가 시스템에 입력되면 요약서의내용을 대상으로 형태소 분석을 수행하여 명사들만을 남긴다. 국가법령정보센터에서 제공하는법령정보공동활용서비스를 사용하여 명사들 중 법령용어를 분류하고, 법령용어와 해당 법령용어를 정의하는 법령과의 관계를 지능형 지식 베이스인 온톨로지에 저장한다. 온톨로지에저장된 법령들은 본 연구에서 개발한 추가적인 지표 계산과정을 거쳐 연구개발사업과 관련된정도를 기준으로 순위가 매겨진 후, 시스템 사용자에게 제공된다. 사용자는 연구개발에 영향을미칠 수 있는 법령을 검색할 수
Research Areas
Dive deeper into Woo-Ju Kim's research on Nubint
Open this lab's papers in the app to read with AI, summarize, and cite in your writing.