[논문 리뷰] Rank One Approximation as a Strategy for Wordle
이 논문은 잔차 제곱합 최소화 기법과 잠재의미인덱싱을 사용하여 남은 해답 풀에서 가장 대표적인 단어를 선택하는 수학적 전략을 제안한다. 단어를 벡터로 변환하고 주요 고유벡터를 계산함으로써, 다음 추측으로 가장 가까운 실제 영어 단어를 선택한다. 'SLATE'로 시작할 경우 평균 4.04번의 추측과 98.7%의 승리 비율을 기록한다.
This paper presents a mathematical method of playing the puzzle game Wordle. In Wordle, the player has six tries to guess a secret word. After each guess the player is told how their guess compares to the secret word. With the available information the player makes their next guess. This paper proposes combining a rank one approximation and latent semantic indexing to a matrix representing the list of all possible solutions. Rank one approximation finds the dominant eigenvector of a matrix of words, and latent semantic indexing reveals which word is closest to the dominant eigenvector. The word whose column vector is closest to the dominant eigenvector is chosen as the next guess. With this method the most representative word of the set of all possible solutions is selected. This paper describes how a word can be converted to a vector and the theory behind a rank one approximation and latent semantic indexing. This paper presents results demonstrating that with an initial guess of "SLATE" the method solves the puzzle in 4.04 guesses on average, with a success rate of 98.7%
연구 동기 및 목표
- 히우리스틱 또는 빈도 기반 접근 방식을 초월하여 워들에서 최적의 추측을 선택하기 위한 수학적으로 엄밀한 전략을 개발한다.
- 각 턴에서 가능한 해답 집합에서 가장 대표적인 단어를 식별하기 위해 랭크 일치 근사와 잠재의미인덱싱을 적용한다.
- 이 방법의 성능을 평균 추측 수와 승리 비율 측면에서 평가하며, 특히 최적의 시작 단어와 조합했을 때의 성능을 분석한다.
- 체계적이고 벡터 기반의 접근 방식이 워들에서 무작위나 직관 기반 추측보다 뛰어나다는 것을 입증한다.
제안 방법
- 모든 가능한 해답의 행렬을 형성하기 위해 각 5글자 단어를 각 위치에서의 문자 존재 여부를 나타내는 이진 벡터로 변환한다.
- 주어진 행렬의 랭크 일치 근사를 계산하기 위해 특이값 분해(SVD)를 적용하여 주요 고유벡터(가장 대표적인 단어를 나타냄)를 추출한다.
- 유사도 기반으로 유클리드 공간에서 주요 고유벡터와 가장 가까운 실제 영어 단어를 찾기 위해 잠재의미인덱싱을 활용한다.
- 각 추측 이후 피드백(녹색, 노란색, GRAY 문자)에 따라 가능한 해답 집합을 업데이트하고, 이 과정을 반복한다.
- 업데이트된 가능한 해답 집합 내에서 가장 가까운 단어를 다음 추측으로 선택한다.
- 공식 워들 해답 2,315개 전부에 대해 이 방법을 테스트하며, 성능 평가를 위해 'SLATE'를 초기 추측으로 사용한다.
실험 결과
연구 질문
- RQ1단어 행렬의 랭크 일치 근사가 워들 성능 향상에 기여하는 대표적인 단어를 식별할 수 있는가?
- RQ2랭크 일치 근사와 잠재의미인덱싱을 조합하면 무작위나 히우리스틱 방법보다 더 나은 추측 선택이 가능한가?
- RQ3이 수학적 전략을 사용할 경우 최적의 시작 단어는 무엇인가?
- RQ4이 방법의 성능는 인간의 직관과 다른 알고리즘적 접근 방식과 비교해 평균 추측 수와 승리 비율 측면에서 어떻게 다른가?
주요 결과
- 'SLATE'로 시작할 경우 평균 4.04번의 추측으로 게임을 클리어하며, 이는 무작위 플레이의 평균 4.59번보다 유의미하게 감소한 것이다.
- 'SLATE'를 초기 추측으로 사용할 경우 승리 비율이 98.7%에 도달하며, 이는 무작위 선택의 88.2% 승리 비율을 뛰어넘는 성과이다.
- 벡터 변환 과정에서 문자 위치를 고려한 전략이 위치 忽시 전략보다 성능이 뛰어나 평균 추측 수와 승리 비율을 모두 향상시켰다.
- 시험한 시작 단어들 중 'SLATE'가 가장 뛰어난 성능을 보였으며, 98.7%의 승리 비율과 평균 4.04번의 추측을 기록하여 다른 대안들보다 최대 5.6%포인트 높은 승리 비율을 확보했다.
- 모든 지표에서 이 방법은 무작위 추측을 뛰어넘었으며, 평균 추측 수는 최대 0.55회 감소하고, 승리 비율은 최대 10.5%포인트 향상되었다.
- 성능 면에서 뛰어나지만, 모델이 덜 흔한 단어(예: 'TROPE' 대신 'THROE')를 제안할 수 있어, 수학적 최적성과 인간의 직관 사이의 격차를 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.