Kimi KDA와 DeepSeek DSA가 GLM-5.3-Flash에 함께 들어갔다

雷锋网11일 전조회 6

GLM-5.3-Flash의 프로젝트 설정 파일에 드러난 45개 층 구성이 화제다. 34개 층은 Kimi가 밀어온 KDA 선형 어텐션을, 나머지 11개 층은 DeepSeek 계열의 KPool-DSA 희소 어텐션을 쓴다. 서로 다른 회사가 각자 주력으로 내세운 어텐션 기법이 한 모델 안에 나란히 들어간 셈이다. 최근 하이브리드 어텐션 구조에서는 전체 문맥을 직접 읽던 전역 어텐션 자리를 희소 어텐션이 대신 채우는 변화가 뚜렷해지고 있다.

어텐션은 크게 세 갈래로 나뉜다. 전역 어텐션은 토큰 이력을 전부 읽어 정보 손실이 가장 적지만 연산량과 KV 캐시가 문맥 길이에 따라 빠르게 늘어난다. 선형 어텐션은 이력을 압축된 상태로 유지해 긴 시퀀스 비용을 낮춘다. 희소 어텐션은 토큰 단위 이력을 남기되 일부만 골라 계산에 넣는다. 지난 몇 년간의 효율적 어텐션 연구는 대부분 뒤의 두 방향을 다듬는 작업이었다.

실제 교체 사례도 나오고 있다. 8월 공개된 Qwen3.8-Flash-Next는 3개 층의 Gated DeltaNet에 1개 층 어텐션을 붙이는 구성을 유지하면서, 정확한 검색을 담당하던 그 한 층을 Qwen Sparse Attention(QSA)으로 바꿨다. 2026년 2월 나온 MiniCPM-SALA는 Lightning Attention과 희소 어텐션을 처음부터 나란히 배치했다. 층 구성 자체는 그대로 두고 '받쳐주는' 층의 성격만 바뀐 점이 눈에 띈다.

MiniMax의 아키텍처 변경 이력은 이 흐름을 압축해서 보여준다. 2023년 말 선형 어텐션을 대규모로 검증하는 쪽으로 방향을 잡은 뒤, 7개 층의 Lightning Attention마다 1개 층의 전통적인 SoftMax 어텐션을 넣는 7:1 하이브리드 구조를 택했다. 4560억 파라미터 규모의 MiniMax-01을 학습하기 전까지 약 3700회의 사전학습 실험을 돌렸고, 2025년 1월 공개된 모델은 400만 토큰 문맥을 지원했다. 이후 여러 단계를 거쳐야 하는 다중 홉 추론에서 하이브리드 구조가 전역 어텐션보다 뒤처지는 문제가 드러나자 M2에서는 전역 어텐션으로 돌아갔다. 2026년 6월 공개된 M3는 다시 전역 어텐션을 떠나 자체 개발한 MiniMax Sparse Attention(MSA)을 채택했고, 회사 측은 100만 토큰 문맥에서 토큰당 연산량이 이전 세대의 약 20분의 1이라고 밝혔다.

선형과 희소가 한 모델에 같이 들어갈 수 있는 이유는 두 기법이 푸는 문제가 다르기 때문이다. 선형 어텐션은 긴 이력을 낮은 비용으로 유지하는 데 강하지만, 그 안에서 특정 세부 정보를 다시 꺼내는 데는 약하다. 희소 어텐션은 토큰 단위 이력을 남기되 매번 일부만 읽는다. 하나는 전체 상태를 기억하는 역할, 다른 하나는 필요할 때 구체적인 내용을 찾아오는 역할을 맡는다. 선형 어텐션 오픈소스 커뮤니티인 FLA가 2024년부터 인터페이스와 커널까지 함께 공개하며 기반을 넓혔고, Kimi가 KDA를 추진할 때 이 커뮤니티의 핵심 기여자들을 흡수한 것도 같은 맥락이다.

개발자 입장에서 달라지는 것은 '어느 회사가 어떤 어텐션을 쓴다'는 구분의 수명이 짧아졌다는 점이다. 코드가 공개되고 인력이 이동하면서 검증된 기법은 빠르게 다른 회사 모델로 옮겨 간다. 모델을 고르거나 자체 모델을 설계할 때 중요한 것은 특정 기법의 채택 여부가 아니라, 어느 층에 어떤 메커니즘을 배치하고 어떤 작업에서 어떤 비용을 감수할지다. 에이전트처럼 문맥이 계속 누적되는 워크로드에서는 이 선택이 KV 캐시와 추론 비용에 바로 반영된다.

다만 이번 내용의 상당 부분은 프로젝트 설정 파일과 각 사의 발표 자료에 근거한 것이다. M3의 연산량 20분의 1 같은 수치는 회사 측이 공개한 값으로, 독립적인 검증 결과는 아니다. MiniMax가 전역 어텐션으로 돌아갔다가 다시 희소 어텐션으로 방향을 바꾼 이유에 대해서도 회사가 밝힌 설명 이상의 해석은 확인되지 않았다.