LLM은 순차 구조를 복원하지 못하고 표면 빈도만 맞춘다
Do LLMs Understand Sequential Structure? A Controlled Study of Inference and Generation
무엇인가
LLM을 상호작용 에이전트나 행동 시뮬레이터로 쓰는 일이 늘었지만, 관찰된 행동이 그것을 만들어낸 과정을 유일하게 결정하지는 않는다. 같은 표면 통계를 보이는 두 행동 궤적이 서로 다른 잠재 메커니즘에서 나올 수 있다. 어떤 궤적은 고정 분포에서 독립적으로 샘플링된 것이고, 다른 궤적은 직전 이력에 조건화된 것일 수 있다. 이 논문은 LLM이 표면적 행동 빈도를 넘어 잠재적 순차 구조를 복원하는지, 즉 주변 분포 맞추기와 조건부 규칙 따르기를 분리해서 평가한다.
어떻게 동작하나
실험 환경은 두 명이 하는 록-페이퍼-시저스(RPS) 게임이다. 각 라운드에서 두 플레이어가 {R,P,S} 중 하나를 고르고, 길이 T의 궤적은 라운드별 행동 쌍의 나열로 정의된다. 플레이어는 두 부류다. 통계적 플레이어는 이전 라운드에 조건화하지 않으며, 항상 같은 행동을 내는 정적 플레이어와 록·페이퍼·시저스 위의 16개 고정 범주분포 중 하나에서 독립적으로 샘플링하는 분포적 플레이어로 나뉜다. 마르코프 플레이어는 최근 이력에 대한 결정론적 규칙을 따르며, 상대의 직전 행동, 직전 공동 상태(두 플레이어의 직전 행동 쌍), 또는 2차 이력 τ_{t-2:t-1}을 조건으로 쓸 수 있다. 실험은 세 단계로 진행된다. 실험 1은 전략 식별로, T ∈ {100, 200, 500, 1000} 각각에 대해 통계 대 통계 50쌍, 마르코프를 플레이어 1로 둔 50쌍, 마르코프를 플레이어 2로 둔 50쌍을 쓴다. 실험 2는 플레이어 정체 없이 1차 상대-전용 규칙을 추론하고 1000라운드를 생성하는 추론-시뮬레이션이며 쌍 유형당 60샘플을 쓴다. 실험 3은 같은 틀을 공동 상태와 2차 이력까지 확장한다. 모델은 DeepSeek-V4-Flash를 deepseek-chat과 deepseek-reasoner로, 그리고 GPT-5와 GPT-5-mini를 핵심으로 삼고, 실험 1에서는 GPT-4.1, Gemini 3 Flash, Qwen3-8B를 추가해 제공자·세대·규모·공개/비공개 가중치를 넓힌다.
무엇과 다른가
평가 지표는 능력을 분리하도록 설계됐다. 식별은 예측한 전략 쌍과 정답 쌍의 정확 일치로 재고, 마르코프와 비마르코프를 나눠 보고해 이력 의존 전략이 더 어려운지 정량화한다. 생성에서는 생성된 이력으로 계산한 참 규칙 f_i(h_t)와 생성 행동이 일치하는 비율(Overlap), 창 안의 모든 평가 가능 행동이 규칙을 만족해야 하는 엄격 규칙 일치, 시간에 따라 규칙 준수가 지속되는지 보는 누적 엄격 일치를 쓴다. 통계적 플레이어는 생성 분포와 목표 분포의 MSE로 비교하고, 마르코프와 비마르코프의 상대 MSE 격차 ΔMSE(%)를 함께 보고한다. 1인 n-gram 실험은 목표 과정이 확률적이라 정확 일치가 부적절하므로, 유니그램 기준선 대비 개선을 재는 문맥 조건부 우도 이득(CCLG)과 상태 빈도 가중 젠슨-섀넌 발산(WJS)을 쓴다.
어떻게 쓰나
식별 결과는 일관되게 부정적이다. 일곱 개 모델 구성 모두에서 마르코프 식별 정확도가 비마르코프보다 낮았고, 일곱 중 여섯에서 유의했다(p<.001). 유일한 예외는 GPT-5(p=.095)였다. 더 긴 문맥은 도움이 되지 않고 오히려 해를 끼친다. 상호작용 이력을 100라운드에서 1000라운드로 늘려도 식별이 개선되지 않았고, 일곱 모델 모두 비마르코프에서 하락했으며 마르코프에서도 거의 모두 하락했다. 이는 증거 부족이 아니다. 같은 닫힌 후보 풀에서 최대우도 식별 기준선은 모든 문맥 길이에서 100% 정확도를 달성했다. 저자들은 실패 원인을 정보 부족이 아니라 잠재 결정 규칙을 추출하고 유지하는 능력의 한계로 지목한다.
전제와 한계
시뮬레이션 결과는 식별과 실행이 별개임을 보여준다. 정답 정체성을 맞힌 경우 규칙 따르기가 더 좋았고, 특히 엄격 규칙 일치에서 그랬다. 그러나 정체성을 틀린 경우도 무작위로 무너지지 않았다. 여러 모델에서 예측 정체성이 틀려도 규칙 중첩이 무작위 기준선 위에 남았는데, 이는 정체성 오류가 구조적이며 행동 규칙이 비슷한 다른 플레이어를 고르는 것일 수 있음을 뜻한다. 분포 충실도에서는 마르코프 플레이어의 MSE가 비마르코프보다 약 8~9% 높았고, 정답 정체성 부분집합에서는 그 격차가 100%를 넘었다. 반대로 잘못된 정체성 부분집합에서는 오히려 반대 패턴이 나타났다. 잘못 복원된 전략 282개 중 41.8%가 목표 주변분포와의 총변동거리 TV ≤ 0.02 안에, 62.1%가 TV ≤ 0.10 안에 머물렀다. 표면적 분포 유사성이 잘못된 순차 메커니즘을 가릴 수 있다는 뜻이다. 누적 엄격 규칙 일치는 일부 모델에서 정체성 정확도에 필적하거나 넘어섰고, 긴 생성에서의 추가 하락은 제한적이어서 규칙 준수 품질은 생성 후반이 아니라 초반에 대부분 결정됐다. 교사 강제(teacher forcing) 실험은 실패 원인을 둘로 갈랐다. DeepSeek Reasoner와 GPT-5는 교사 강제에서 강해 자유 생성 오류의 일부가 규칙을 길게 유지하는 어려움에서 온 반면, DeepSeek Chat과 GPT-5-mini는 정답 이력을 줘도 여전히 어려워 국소적 규칙 적용 자체가 병목이었다. 생성이 식별을 체계적으로 바꾸는 효과는 없었다(이중비율 z검정에서 유의한 차이 없음).
어떤 구조가 규칙 실행을 어렵게 하는지도 분리했다. 실험 1~3에서 가장 강한 성능을 낸 deepseek-reasoner로 구조 요인만 통제한 결과, 공동 상태 정보를 추가하는 것은 규칙 따르기 성능을 떨어뜨리지 않았다. 1차·2차 설정 모두에서 공동 상태 조건은 강하게 유지됐다. 큰 하락은 2차 의존성에서 왔다. 2차 설정은 규칙 중첩이 비교적 높게 남아 있어도 엄격 규칙 일치가 1차 설정보다 낮았고, 이때 정체성 정확도는 여전히 높았다. 모델이 국소 규칙 요소는 복원하지만 그것을 일관된 2차 전이 규칙으로 조합하지 못한다는 해석이다. 병목은 공동 상태 표현이 아니라 더 긴 이력 의존성을 유지하고 적용하는 것이다.
플레이어 귀속과 RPS 의미를 제거한 1인 확률 과정 실험도 같은 결론을 지지한다. 어휘 {A,B,C} 위의 n-gram 마르코프 과정에서 n ∈ {1,2,4,8}로 의존 길이를 늘리고, 접두사만 주는 설정과 전이 확률까지 주는 설정을 비교했다. CCLG는 n=1~4에서 대체로 양수여서 유니그램 빈도 맞추기를 넘어선 문맥 사용이 있었지만, n=8에서 대부분 모델의 CCLG가 급락하고 WJS가 증가했다. 접두사만 쓰는 n-gram 최대우도 기준선은 고차에서도 안정적이어서 고차 조건부 정보는 복원 가능했다. 접두사 길이를 256에서 2048로 늘리거나 전이 규칙을 명시적으로 제공해도 고차 성능 하락은 일관되게 사라지지 않았다.
실무적으로 이 논문이 주는 교훈은 명확하다. 에이전트나 사용자 시뮬레이터를 평가할 때 출력 분포의 그럴듯함이나 전략 이름 맞히기 정확도만 보면, 모델이 조건부 규칙을 실제로 실행하는지 알 수 없다. 정확히 식별해도 실행이 무너질 수 있고, 반대로 잘못 식별해도 주변분포는 그럴듯하게 나올 수 있다. 조건부 규칙 준수를 온라인으로, 생성된 이력 위에서, 시간에 따라 지속되는지 측정해야 하며, 특히 2차 이상 의존성과 고차 n-gram 상태가 있는 과제에서는 별도의 스트레스 테스트가 필요하다. 저자들이 밝힌 한계도 분명하다. 플레이어를 미리 정의된 후보 집합 Π에서 샘플링하므로 닫힌 후보 풀에서의 전략 복원만 평가하며 개방형 전략 발견은 다루지 않는다. 궤적을 기호적으로 표현하고 출력을 제약된 형식과 파싱 규칙으로 평가했는데, 이는 모호성을 줄이는 대신 선택한 프롬프트·표현·출력 스키마·디코딩 설정이 최적임을 보장하지 못한다.