GPT-6·Opus 5.5로 1941년 에니그마와 존 디의 암호문서를 파고든 기록
프런티어 LLM을 역사 연구의 보조 도구가 아니라 실제 문제 해결자로 쓸 수 있는지 실험한 결과가 공개됐다. GPT-6 Astra와 Opus 5.5를 동원해 2차 세계대전 암호 전문 해독, 17세기 연금술·천사 언어 문서 분석, 아이작 뉴턴의 라틴어 번역 출처 추적 같은 과제를 시도했고, 일부에서는 기존 연구자가 찾지 못한 연결을 확인했다는 내용이다.
글쓴이는 LLM이 잘 푸는 역사 문제의 조건을 다섯 가지로 정리한다. 전문가 집단이 이미 문제 목록을 만들어 뒀는지, 필요한 데이터가 완전히 디지털화되어 접근 가능한지, 다국어 추론·고급 수학·대규모 데이터 자율 탐색 같은 '뾰족한' 능력이 요구되는지, 해법에 맞춤 코드 작성이 포함되는지, 그리고 끝으로 해답을 명확히 증명하거나 반증할 수 있는지다. 마지막 조건이 수학에서는 추론 모델이 폭발적으로 쓰이고 인문학에서는 그렇지 않은 이유라는 설명이다.
가장 눈에 띄는 사례는 1941년 7월 10일자 에니그마 전문이다. 그동안 해독되지 않았던 이 메시지를 Astra가 풀었는데, 결정적 돌파구는 암호 해독 자체가 아니라 당시 존재하던 정보의 전체 범위를 찾아낸 것이었다. 독일 연방기록보관소(Bundesarchiv)에 새로 추가된 무선 전문 수집본에 대한 안내문을 모델이 발견했고, 그 안에는 SS-Totenkopf 사단 보급 사령부(Nachschubführer) 관련 전문들이 Ib(Quartiermeister) 무선국으로 전달된 기록이라는 설명이 붙어 있었다.
암호학 연구자 Frode Weierud는 모델이 언급한 파일 번호(RS 3-3/20a, RS 3-3/63b)가 실제로 존재하지만 Crypto Cellar Research 웹사이트에는 없다는 점을 짚었다. 모델이 접근했다는 비공개 컬렉션이 무엇인지, 연방기록보관소의 디지털 컬렉션에 들어간 것인지 다른 경로로 찾은 것인지 사람이 따라가기 어렵다는 것이다. 저자는 이를 허깅페이스 사건과 겹쳐 보며, 모델이 '풀 만하다'고 판단한 문제에서는 사람이 추적하기 힘든 방식으로 탐색을 밀어붙인다고 표현한다.
17세기 사례도 있다. 엘리자베스 시대의 오컬티스트 존 디가 '천사 언어'로 받아 적었다고 주장한 Liber Loagaeth를 Astra가 분석했는데, 결론은 이 문서가 애초에 암호가 아니라 대부분 의미 없는 음절의 나열이라는 것이었다. 다만 디의 일기와 문자 반복 빈도 분석을 교차 검증해 특정 시점 이후 필경자 에드워드 켈리의 반복이 늘어났다는 패턴을 찾아냈고, 무의미해 보이는 구절 하나가 디의 신화 체계에 등장하는 천사 'Bornogo'를 가리킨다는 점도 확인했다. 또 뉴턴이 프랑스 연금술 문헌을 라틴어로 옮긴 구절의 원출처를 특정했다고 한다.
이 글은 GPT-6 Sol과 Opus 5.5가 나란히 공개된 시점에 쓰였다. 저자는 2024~2025년과 상황이 달라졌다고 본다. 수학 분야에서 추론 모델이 빠르게 성과를 낸 것처럼, 역사학에도 '증명 가능한 문제'를 중심으로 모델을 투입하면 의미 있는 진전이 나올 수 있다는 것이다. 번역·각색을 거친 텍스트 계보 추적, 서로 단절된 하위 분야의 발견을 연결하는 작업이 특히 유망하다고 꼽는다.
개발자 관점에서 읽을 부분은 모델의 행동 방식이다. 여기서 모델은 문서 전사 같은 보조 작업이 아니라, 대규모 데이터셋을 자율적으로 훑고 필요하면 맞춤 코드를 작성하며 여러 출처를 조합해 가설을 세우는 에이전트로 쓰였다. 검색 범위를 스스로 넓히고 검증 가능한 형태의 답을 요구하는 문제에서 성능이 나온다는 점은 사내 데이터 조사나 코드베이스 분석 같은 실무 과제 설계에도 그대로 적용된다.
한계도 분명하다. 저자는 이런 성과가 존 디 연구의 획기적 돌파구는 아니며 나비에-스토크스 방정식을 푸는 것과 같지 않다고 선을 긋는다. 2차·1차 세계대전 암호 전문을 더 찾아보라고 Astra와 Opus 5.5에 맡겼지만 이미 쉬운 건 다 나온 뒤라 성과가 없었다고도 적었다. 모델이 낸 결론을 사람이 완전히 재현·추적하기 어렵다는 점은 검증 체계 없이는 연구에 쓰기 어렵다는 뜻이다.
현재는 찰스 다윈의 저작을 훑으며 자연선택 관련 정보를 어디서 얻었는지 참조를 추적하는 작업이 진행 중이라고 한다. 저자의 제안은 명확하다. AI 연구소와 역사 연구자, 연구비 지원 기관이 협업을 적극적으로 시작해야 한다는 것이다.