이윤수 교수
Yoonsoo Lee
서울대학교 · 컴퓨터과학
연구실 소개
이 교수의 연구실은 인공지능 기반 창의적 예술 생성, 특히 컬라주 스타일의 이미지 생성을 위한 강화학습 기반 기법 개발에 주력하고 있습니다. 또한 다중 에이전트 강화학습을 활용한 실시간 환경 적응 기술과 손실 함수 지형의 물리적 특성(예: 사이클로이드)과의 유사성 분석을 통해 학습의 안정성과 수렴 속도 향상을 연구하고 있습니다. 로봇의 대화 기반 실시간 라벨링 기술을 통해 인간-로봇 상호작용을 통한 효율적이고 지능적인 물체 인식 학습도 진행 중입니다. 특히 실제 응용에 적합한 데이터 없는 학습, 비지도 학습, 실시간 상호작용 기반 학습 기법에 초점을 맞추고 있습니다.
연구 현황
연구 성과 추이
표시된 성과는 수집된 데이터 기준으로 산출되며, 일부 차이가 있을 수 있습니다.
주요 논문
12Collage is a creative art form that uses diverse material scraps as a base unit to compose a single image. Although pixel-wise generation techniques can reproduce a target image in collage style, it is not a suitable method due to the solid stroke-by-stroke nature of the collage form. While some previous works for stroke-based rendering produced decent sketches and paintings, collages have received much less attention in research despite their popularity as a style. In this paper, we propose a m
Collage is a creative art form that uses diverse material scraps as a base unit to compose a single image. Although pixel-wise generation techniques can reproduce a target image in collage style, it is not a suitable method due to the solid stroke-by-stroke nature of the collage form. While some previous works for stroke-based rendering produced decent sketches and paintings, collages have received much less attention in research despite their popularity as a style. In this paper, we propose a m
한계효용 체감의 법칙은 재화를 추가로 소비함에 따라 그로 인해 얻는 효용이 점차 적어진다는 경제학 이론이다. 본 연구는 한정된 자원을 분배하는 다중 에이전트 강화학습의 보상에 한계효용 체감의 법칙을 적용하여 상호 간의 소통 없이 최적의 분배가 이루어질 수 있음을 보인다. 이는 각자의 이기적 행동이 총효용을 극대화한다는 시장 원리를 다중 에이전트 학습에 적용한 것이다. 실험 결과, 그리드 월드에서 두 에이전트가 두 자원을 각자 획득하는 환경에서 한계효용 체감의 법칙을 적용하면 더욱 자원을 평등하고, 파레토 최적에 가깝게 분배한다.
생성 모델은 이미지를 생성하는 데 탁월한 성능을 보이지만, 소리, 특히 영상의 후편집 작업에 삽입되는 효과음인 폴리 사운드(foley-sound)를 생성하는 데에는 충분한 성능을 내지 못하고 있다. 우리는 이를 보완하기 위해 폴리 사운드 생성을 위한 비디오 데이터셋을 재구축했다. VGG-Sound는 유튜브 영상의 ID와 라벨을 제공하는 비디오 데이터셋이다. 하지만 이 데이터셋의 클래스는 폴리 사운드에 적합하지 않다. 본 연구는 먼저, VGG-Sound의 유튜브 ID로 섬네일 이미지를 추출하고 이를 대형 멀티모달 모델인 LLaVA에 입력해 해당 영상의 주요 재질을 예측했다. 또한 CLAP을 이용해, 오디오의 재질을 예측했다. 그리고 두 예측을 결합하여 폴리 사운드 생성에 적합한 데이터셋을 만들었다. 평가 결과, 시각 정보와 청각 정보를 모두 사용했을 때, 더욱 오디오와 유사도가 높은 라벨이 생성되었다. 또한 이 데이터셋으로 소리 생성 모델을 미세 조정할 시 일부 정량 평가 척도에서 성
생성 모델은 이미지를 생성하는 데 탁월한 성능을 보이지만, 소리, 특히 영상의 후편집 작업에 삽입되는 효과음인 폴리 사운드(foley-sound)를 생성하는 데에는 충분한 성능을 내지 못하고 있다. 우리는 이를 보완하기 위해 폴리 사운드 생성을 위한 비디오 데이터셋을 재구축했다. VGG-Sound는 유튜브 영상의 ID와 라벨을 제공하는 비디오 데이터셋이다. 하지만 이 데이터셋의 클래스는 폴리 사운드에 적합하지 않다. 본 연구는 먼저, VGG-Sound의 유튜브 ID로 섬네일 이미지를 추출하고 이를 대형 멀티모달 모델인 LLaVA에 입력해 해당 영상의 주요 재질을 예측했다. 또한 CLAP을 이용해, 오디오의 재질을 예측했다. 그리고 두 예측을 결합하여 폴리 사운드 생성에 적합한 데이터셋을 만들었다. 평가 결과, 시각 정보와 청각 정보를 모두 사용했을 때, 더욱 오디오와 유사도가 높은 라벨이 생성되었다. 또한 이 데이터셋으로 소리 생성 모델을 미세 조정할 시 일부 정량 평가 척도에서 성
한계효용 체감의 법칙은 재화를 추가로 소비함에 따라 그로 인해 얻는 효용이 점차 적어진다는 경제학 이론이다. 본 연구는 한정된 자원을 분배하는 다중 에이전트 강화학습의 보상에 한계효용 체감의 법칙을 적용하여 상호 간의 소통 없이 최적의 분배가 이루어질 수 있음을 보인다. 이는 각자의 이기적 행동이 총효용을 극대화한다는 시장 원리를 다중 에이전트 학습에 적용한 것이다. 실험 결과, 그리드 월드에서 두 에이전트가 두 자원을 각자 획득하는 환경에서 한계효용 체감의 법칙을 적용하면 더욱 자원을 평등하고, 파레토 최적에 가깝게 분배한다.
사이클로이드(Cycloid)는 원을 직선과 접한 상태로 회전시켰을 때 원 위의 한 점이 그리는 궤도이다. 사이클로이드는 두 가지 물리학적 특징을 가지는데, 첫 번째 특징은 최단 강하 곡선(Brachistochrone curve)으로, 중력장 내에서 물체를 굴렸을 때, 시작점과 끝점이 같은 모든 궤도 중 사이클로이드에서 가장 빨리 물체가 떨어진다는 점이다. 두 번째 특징은 등시곡선(Isochrone curve)으로, 사이클로이드의 어느 지점에서 물체를 떨어뜨려도 끝점에 도달하는 시간이 동일하다는 점이다. 본 연구는 이러한 사이클로이드의 특징을 손실함수 지형(Loss landscape)에 적용하여 분석한다. 본 연구는 이러한 사이클로이드의 특징을 이용해, 학습 손실함수의 지형이 사이클로이드와 유사할 때 손실이 빠르고 일정하게 수렴할 것이라고 주장한다. 이를 증명하기 위해, 평균제곱오차를 이용한 1,000번의 회귀분석 학습을 진행한 뒤 각 학습의 손실함수 지형이 사이클로이드와 얼마나 유사
로봇의 지도학습은 실세계에서 이루어지기 때문에 많은 시간이 소요되며 데이터 수집 후 훈련데이터에 대한 라벨링을 추가로 요구한다. 대화를 통한 지도학습은 이와 같은 비용 소모를 줄이는 방법으로, 사람에게 익숙한 대화 기반 소통 방식을 사용해 접근성을 강화한다. 본 연구에서는 로봇이 사람과 대화하며 실시간으로 물체 분류를 학습하는 대화 기반 라벨링을 제시한다. 먼저, 모바일 조작 로봇은 Unseen Object Detection을 통해 학습할 물체를 검출한다. 그리고 목표 물체를 파지한 뒤 사람에게 이 물체가 무엇인지 질문한다. 사람은 물체군이 무엇인지 대답하고, 로봇은 해당 음성을 인식하여 텍스트로 전환해 물체의 라벨을 결정한다. 그 후 물체를 전방위적으로 스캔하고, 동시에 로봇 카메라를 통해 입력된 RGB 이미지와 대화를 통해 얻은 라벨로 실시간 이미지 분류 학습을 진행한다. 학습 후, 설계한 검증 실험을 통해 테스트 데이터에 대한 분류 정확도를 평가한 결과, 이미지는 71.86%,
Applying multi-agent reinforcement learning (MARL) to real-world scenarios is challenging because agents often need to adapt quickly to unexpected situations, including those rarely or never encountered in training. Recent methods for out-of-distribution generalization are unsuitable for applications on out-of-distribution tasks with limited communication, because they are typically restricted to centralized training or some specialized instances of distribution shifts. To address this limitatio
Abstract Background: EGFR tyrosine kinase inhibitors (TKIs) are current standard treatments for non-small cell lung cancers (NSCLCs) with EGFR mutation. Current diagnostic tests for EGFR mutation include direct sequencing, pyrosequencing or real-time PCR based technology. We have developed a digital droplet PCR based analysis, GenesWell™ ddEGFR Mutation Test (IUO version 5.2. Gencurix Inc., Seoul, Korea). Methods: We have analyzed a total of 325 archived tissue from 233 lung cancer patients trea
저자들은 갑상선에서 발생한 소세포암의 증례 2예를 경험하여 문헌과 함께 고찰하는 바이다.
대표 연구 분야
이윤수 교수의 연구를 Nubint에서 더 깊이 살펴보세요
이 연구실의 논문을 앱에서 열어 AI와 함께 읽고, 핵심을 요약하고, 내 글에 인용하세요.