Queen은 4B 파라미터로 그랜드마스터급 체스 실력과 수 설명을 함께 달성한다

Language Models that Play Chess and Explain Their Moves

arXiv2610.03695v1

Adithya Bhaskar2026-10-02조회 4

무엇인가

체스 엔진과 언어모델은 서로 반대쪽에 있다. 현대 체스 엔진은 초인적 수준으로 두지만 왜 그 수를 두는지 자연어로 말하지 않는 '침묵하는 전문가'이고, 언어모델은 그럴듯한 설명을 만들지만 실력이 약해 설명의 가치가 떨어진다. 논문은 설명의 품질이 설명 대상인 수의 품질에 달려 있다는 전제에서 출발한다. 즉 좋은 수를 찾는 능력이 좋은 설명의 전제조건이라는 것이다. 저자들은 이 간극을 메우기 위해 4B 파라미터 체스-언어모델 Queen(QUality Explanation and Evaluation Network)을 제안한다. Queen의 출력은 세 부분으로 구성된다. 최선의 다음 수 추천, 그 수의 결과를 보여주는 예상 주 변화(principal variation, PV), 그리고 두 가지를 풀어 쓰는 자연어 산문이다.

어떻게 동작하나

구조는 인코더-디코더다. 인코더는 Lc0 계열의 BT5 네트워크로, 논문은 이를 Leela라 부른다. 240M 파라미터, 15층, 은닉 차원 1024이며 항상 체스판의 64개 칸에 대응하는 64토큰 시퀀스를 입력받고 탐색 없이도 초인적 수준으로 둔다. 디코더는 지시 튜닝된 SmolLM3-3B(36층, 은닉 차원 2048)로 체스 특화 학습은 거의 없는 범용 모델이다. 둘을 잇는 것은 Flamingo에서 착안한 게이트 크로스어텐션이다. 키와 밸류는 인코더 은닉 상태에서, 쿼리는 디코더 은닉 상태에서 온다. 원본 Flamingo가 인코더의 마지막 은닉 상태만 쓰는 것과 달리, 이 논문은 i번째 인코더 층 출력을 2i번째 디코더 층과 짝지어 2i번째 디코더 블록 앞에 크로스어텐션을 삽입한다. 디코더가 인코더의 최종 표현뿐 아니라 중간 단계 표현에도 접근할 수 있게 하려는 선택이다. 또한 토크나이저가 칸 이름을 일관되게 다루지 못하고 'bishop', 'knight' 같은 단어가 체스와 무관한 언어적 사전 지식을 끌어올 수 있어, 64개 칸과 12개 기물 종류에 전용 토큰을 추가했다.

무엇과 다른가

첫 번째 학습 단계는 도메인 적응이다. Leela의 표현에 담긴 체스 개념을 디코더가 안정적으로 추출하도록 질의응답 데이터셋을 만든다. 질문은 네 갈래다. 현재 위치의 기물 배치를 묻는 Static-Current, 현재 위치의 합법 수·캡처·체크를 묻는 Dynamic-Current, 주어진 1~8수 이후의 보드를 재구성해 묻는 Static-Future, 미래 위치에서의 합법 수와 공격자를 묻는 Dynamic-Future다. 각 유형은 세 가지 질문·답변 형식을 갖고 답은 프로그램으로 생성·검증한다. 학습은 Static-Current → Dynamic-Current → Static-Future → Dynamic-Future 순으로 진행하며, 앞 단계 질문을 낮은 비율로 섞어 망각을 막는다. 모든 단계에서 인코더와 디코더는 동결되고 크로스어텐션 브리지 파라미터와 새 토큰 임베딩만 학습한다. AdamW와 코사인 학습률 스케줄, 검증셋 기반 조기 종료를 쓰고 각 단계 최적 체크포인트를 다음 단계 초기값으로 쓴다. 이 단계의 결과물을 Pawn(Position AWare Network)이라 부른다.

어떻게 쓰나

두 번째 단계가 핵심인 반복 탐색 증류다. 먼저 Lichess 게임과 퍼즐에서 뽑은 15,000개 위치에 대해 GPT-5.6-Sol(low)이 최선 수, PV, 산문, 그리고 세 개의 유망한 수와 위치 평가를 생성하고, 불법 수나 실수가 포함된 응답을 걸러낸 뒤 SFT를 해 Pawn-1을 얻는다. 그러나 이 시드 모델의 설명은 형편없는 수를 추천한다. 저자들은 AlphaZero가 MCTS로 개선한 평가를 네트워크에 증류하는 패러다임을 자연어로 옮긴다. 각 반복은 다섯 단계다. (1) Sample: 현재 체크포인트와 Stockfish의 대국, Lichess 인간 대국, Lichess 퍼즐에서 약 40만 개 루트 위치를 뽑는다. (2) Generate: Pawn-k가 세 개의 유망한 수를 담은 설명을 만들고, 세 수 모두 Stockfish 기준 실수(기대 승률 10%p 이상 하락)면 최악의 수를 Stockfish 정답 수로 교체한 뒤, 세 결과 위치 각각에 대해 독립적으로 설명을 생성한다. (3) Recurse: 자식 설명의 최선 수 예측 중 실수가 있으면 루트와 다른 자식을 버리고 그 자식에서 다시 반복하며, 세 자식 모두 실수가 없거나 최대 깊이에 도달할 때까지 재귀한다. (4) Consolidate: Qwen3.8-27B에게 새 내용을 도입하지 말라고 지시한 채 세 자식 설명을 루트 위치에 대한 하나의 설명으로 통합시킨다. (5) Train: 통합 설명과 원래 설명의 PV가 처음 갈라지는 지점을 비교해, 통합 쪽 수가 더 나쁘거나 불법이면 버리고 남은 것으로 SFT를 한다. 이 과정을 일곱 번 반복하고 Pawn-8을 Queen으로 승격한다.

전제와 한계

실험은 정확성·입증·일관성 세 축으로 이뤄진다. 정확성은 8개 체스 엔진과 각 모델당 32국을 두는 전게임 시뮬레이션으로 측정하고 Leela 네트워크의 알려진 강도를 Lichess Elo 척도에 고정해 환산한다. Queen의 Elo는 1782 → 2024 → 2187 → 2346 → 2539 → 2434 → 2559 → 2697로 일곱 반복 동안 915점 올랐다. 이는 GPT-5.6-Sol(2071)을 600점 이상, Gemini-3.1-Pro(2201)를 450점 이상 앞선 것으로, 기대 승률 97.4%와 94.6%에 해당한다. 중위 그랜드마스터의 Lichess 블리츠 레이팅 2730에 근접한다. 입증 지표는 예측 PV에 실수가 없는 비율(NMR)과 첫 수가 실수가 아닌 비율(FNMR)이며, Lichess 난이도 609~2905의 전술 퍼즐 1,000개와 인간 대국에서 뽑은 일반 위치 1,000개에서 평가한다. Queen이 모든 지표에서 1위로, Gemini를 NMR에서 2점, FNMR에서 9점 앞섰고 시드 교사였던 Sol과 비슷한 크기 모델 C1-4B는 훨씬 뒤처졌다. 일관성은 GPT-5.6-Sol(high) 판정자가 1~5 리커트 척도로 평가했는데, Queen은 구조적 일관성 3.51로 Sol과 동률이며 Gemini에 근접했다. 다만 Queen이 분석에서 평균 30.0플라이를 다루는 반면 Sol은 23.8플라이만 다뤄 판정자가 감점할 기회가 더 많았다는 점을 저자들은 덧붙인다.

분석 실험도 눈에 띈다. Leela 인코더를 FEN과 같은 정보를 담은 사전 형태 표현으로 바꾸고 크로스어텐션을 제거한 절제 실험, 그리고 도메인 적응 커리큘럼을 건너뛴 절제 실험 모두 Elo와 FNMR이 크게 떨어져 두 요소가 강한 초기화에 중요함을 보였다. 또 모델이 Leela의 정책 헤드를 그대로 재현하고 설명을 사후에 붙이는 것 아닌지 확인하기 위해, Stockfish 최적 수와 기대 승률 3% 이내인 수가 5개 이상인 위치 1,000개를 조사했더니 538개 위치에서 Queen이 Leela와 다른 수를 골랐다. 마지막으로 GPT-5.6-Sol 시드 없이 Stockfish의 수작업 평가(HCE)에서 뽑은 템플릿 설명으로 대체해도 Elo 개선 궤적이 비슷해, 프런티어 모델 증류가 반드시 필요한 것은 아니라는 점을 보였다.

개발자 관점에서 이 논문의 값은 체스 성능 자체보다 파이프라인의 일반성에 있다. 정답을 잘 맞히지만 자연어를 못 내는 도메인 전문 인코더가 이미 있고, 그 환경이 트리 탐색(알파-베타, MCTS)의 이득을 볼 수 있는 상태라면 같은 레시피를 적용할 수 있다는 것이 저자들의 주장이다. 실무에서 확인할 지점은 세 가지다. 첫째, 브리지 학습 단계에서 인코더와 디코더를 동결하고 크로스어텐션 파라미터만 학습하는 것이 핵심이며, 어느 인코더 층을 어느 디코더 층에 짝지을지가 설계 변수다. 둘째, 자연어 벨만 업데이트는 자식 노드의 설명을 통합해 루트 설명으로 만들고 다시 증류하는 루프인데, 통합 모델과 필터링 기준(여기서는 Stockfish 평가와 불법 수 여부)이 품질을 좌우한다. 셋째, 평가를 정확성·입증·일관성으로 분리해 측정해야 한다는 점이다.

한계는 저자들이 직접 밝힌다. Queen의 개념적 일관성 점수는 2.76으로 낮다. 반복 자기개선이 분석 트리를 가중치로 증류해 구조적 일관성은 끌어올리지만, 전술 모티프에 대한 환각이 통합 과정을 타고 전파될 수 있다는 것이다. 또한 Queen과 Leela 사이의 Elo 격차는 잠재된 전문 지식을 언어로 표현할 때 생기는 손실, 즉 'verbalization debt'로 설명되며, 이는 언어로 옮기면서 성능이 깎인다는 구조적 전제를 남긴다. 비교 대상 중 유사 아키텍처의 동시 연구 LLAMIA는 집필 시점에 모델이 공개되지 않아 비교하지 못했다. 논문에 제시된 수치 외에 별도의 코드 저장소나 프로젝트 페이지 URL은 본문에 명시되지 않았다.