[논문 리뷰] How to Do Things with Deep Learning Code
이 논문은 GPT-2의 딥러닝 코드에 비판적 코드 연구(Critical Code Studies)를 적용하여 모델 수준과 응용 수준의 코드 두 가지 유형을 분석한다. 코드, 특히 AI Dungeon과 This Word Does Not Exist와 같은 응용 프로그램에서와 같이 출력을 필터링하고 구조화함으로써 모델의 행동을 설계하는 방식을 드러내며, 이는 인공지능을 해석 가능하게 하고, 비판적이고 창의적이며 책임감 있는 대화형 접근을 가능하게 한다.
The premise of this article is that a basic understanding of the composition and functioning of large language models is critically urgent. To that end, we extract a representational map of OpenAI's GPT-2 with what we articulate as two classes of deep learning code, that which pertains to the model and that which underwrites applications built around the model. We then verify this map through case studies of two popular GPT-2 applications: the text adventure game, AI Dungeon, and the language art project, This Word Does Not Exist. Such an exercise allows us to test the potential of Critical Code Studies when the object of study is deep learning code and to demonstrate the validity of code as an analytical focus for researchers in the subfields of Critical Artificial Intelligence and Critical Machine Learning Studies. More broadly, however, our work draws attention to the means by which ordinary users might interact with, and even direct, the behavior of deep learning systems, and by extension works toward demystifying some of the auratic mystery of "AI." What is at stake is the possibility of achieving an informed sociotechnical consensus about the responsible applications of large language models, as well as a more expansive sense of their creative capabilities-indeed, understanding how and where engagement occurs allows all of us to become more active participants in the development of machine learning systems.
연구 동기 및 목표
- 비판적 코드 연구(CCS)가 심리적 및 수학적 구성 요소를 포함하는 딥러닝 시스템, 특히 기호적 코드를 초월한 시스템에 효과적으로 적용될 수 있는지 조사하기 위해.
- 특히 응용 수준의 코드가 GPT-2와 같은 대규모 언어 모델의 행동과 출력을 중심적으로 형상화하는 방식을 입증하기 위해.
- 오픈소스 코드를 통해 심층 분석, 수정 및 공동 책임을 가능하게 하여, 인공지능을 투명하지 못한 '블랙박스'로 보는 인식을 도전하기 위해.
- 비판적 인공지능 연구(CAIS)의 범위를 확장하기 위해, 코드를 분석의 장소로 삼고, 모델 아키텍처나 데이터만이 아니라 코드 자체를 중심에 두기 위해.
- 사용자와 개발자가 코드를 통해 모델 행동을 능동적으로 형상화하고 이끌 수 있도록 하는 더 포괄적이고 참여적인 인공지능 개발 모델을 주장하기 위해.
제안 방법
- 저자들은 GPT-2 코드베이스의 대표적 맵을 추출하여, 모델 수준 코드(아키텍처 및 추론 정의)와 사용자 인터랙션을 구조화하는 응용 수준 코드(ADLC)를 구분한다.
- AI Dungeon(텍스트 어드벤처 게임)과 This Word Does Not Exist(TWDNE, 언어 예술 프로젝트)라는 두 가지 GPT-2 기반 응용 프로그램의 사례 연구를 수행하여, ADLC가 모델 출력을 어떻게 형상화하는지 분석한다.
- 분석은 ADLC가 패턴 매칭, 정규표현식, 필터링 메커니즘 등을 사용하여 모델의 생성 행동을 어떻게 규제하고 구조화하는지에 집중한다.
- 이 연구는 GPT-2를 단일 시스템으로 보지 않고, 오픈소스 코드, 훈련 데이터, 개발자가 부여한 제약 조건으로 구성된 분산된 자료로 본다.
- 비판적 코드 연구 원칙을 기호적 코드뿐 아니라 수학적 연산에도 적용하여, 딥러닝 시스템의 코드가 문법 외에도 功能적 및 윤리적 함의를 분석할 수 있음을 주장한다.
- 스크린 샷과 코드 검사를 통해 출력이 어떻게 설계되었는지 추적한다. 예를 들어, TWDNE의 '창작된' 단어들은 생성되는 것이 아니라 구조화된 데이터 처리 방식을 통해 기능적으로 반환된다.
실험 결과
연구 질문
- RQ1심리적 및 수학적 구성 요소를 포함하는 딥러닝 시스템에 대해 비판적 코드 연구(CCS)를 의미 있게 적용할 수 있는 정도는 어느 정도인가?
- RQ2GPT-2 기반 시스템에서 응용 수준 코드(ADLC)가 대규모 언어 모델의 행동을 어떻게 능동적으로 형상화하고 규제하며 구조화하는가?
- RQ3개발자들은 코드를 어떻게 사용하여 언어 모델 출력의 표현 가능성과 위험(예: 혐오 발언 또는 비논리적 문장)을 조율하는가?
- RQ4GPT-2 코드의 오픈소스 성격이 AI 개발에서 공동 책임, 심층 검토 및 창의적 참여를 가능하게 하는 방식은 무엇인가?
- RQ5코드는 비판적이고 창의적인 간섭의 장소가 될 수 있는가? 이를 통해 사용자는 수동적 소비를 넘어 능동적인 참여로 이동할 수 있는가?
주요 결과
- AI Dungeon과 This Word Does Not Exist와 같은 시스템에서 응용 수준 코드(ADLC)는 수동적 인터페이스가 아니라, 모델의 출력을 필터링하고 구조화하며 형상화하는 능동적 메커니즘이며, 때로는 모델 자체의 생성 과정보다 더 큰 영향을 미친다.
- This Word Does Not Exist 프로젝트는 GPT-2가 새로운 단어를 생성하는 것이 아니라, 구조화된 데이터 처리를 통해 기능적으로 반환한다는 점을 드러내며, 이는 모델가 유능한 존재가 아니라 기능적 실체임을 폭 드러낸다.
- GPT-2 코드의 오픈소스 가용성 덕분에 개발자들이 패턴 매칭과 정규표현식을 통해 혐오 발언과 같은 유해 출력을 차단하는 보안 조치를 식별하고 구현할 수 있었다.
- GPT-2의 개발은 오픈소스가 아닌, 아마추어, 학술계, 전문 개발자들이 공동으로 참여하는 분산된 노력이며, 이들이 함께 모델의 행동을 형상화하고 있다.
- 이 연구는 모델의 '야생적인 표현력'이 코드를 통해 유도될 수 있음을 드러내며, 책임감 있는 인공지능 개발이 공동체 기반의 코드 간섭을 통해 이미 가능하고 실제로 진행 중임을 보여준다.
- 코드를 비판적 탐구의 장소로 삼음으로써, 이 논문은 딥러닝 시스템이 단일한 블랙박스가 아니라, 다듬을 수 있고 분석할 수 있으며 수정할 수 있는 자료로 이해될 수 있음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.