센스타임, 이기종 칩으로 추론 자원 재배치…일일 토큰 0.46조→4.5조

量子位 QbitAI17일 전조회 9

센스타임의 AI 인프라 조직인 '센스타임 대장치'가 이기종(heterogeneous) 연산 자원을 묶어 대규모 추론을 처리하는 이른바 '토큰 팩토리' 아키텍처를 공개했다. 소속 기술 전문가 뤄웨이는 최근 열린 '2026 글로벌 AI 칩 서밋'의 토큰 팩토리 이기종 혼합 학습·추론 기술 세미나에서 이 구조를 주제로 발표했다. 핵심은 특정 칩을 Prefill 노드나 Decode 노드로 영구히 고정하지 않고, 부하 상황에 따라 역할을 바꿔 쓰는 데 있다.

규모 지표도 함께 제시됐다. 회사 측 발표에 따르면 센스타임 대장치의 일일 토큰 서비스량은 올해 2월 0.46조에서 8월 4.5조로 늘었다. 약 8개월 만에 10배 가까이 증가한 수치로, 회사는 이를 추론 수요가 학습 수요를 대체하며 연산 성장을 이끄는 흐름과 연결해 설명했다. 이 수치는 외부에서 검증된 값이 아니라 회사가 밝힌 자체 집계다.

아키텍처는 크게 두 축으로 정리된다. 첫째는 '가로 방향 오케스트레이션'이다. 서로 다른 브랜드와 규격의 칩을 연산 처리량, KV 캐시 용량, 유효 대역폭, 모델 호환성 같은 항목으로 프로파일링해 하나의 스케줄링 시야에 넣는다. 이후 요청이 들어오면 승인·페어링, Prefill 실행, KV 캐시 상태 핸드오프, Decode 인계까지 전 과정을 표준화된 절차로 관리한다. 발표자는 모델·배치 크기·컨텍스트 길이에 따라 병목이 달라지는 만큼 칩의 역할 분담을 동적으로 조정한다고 설명했다.

둘째는 '세로 방향 최적화'다. 모델·엔진·칩 세 계층을 나눠 손본다. 모델 계층에서는 가중치 양자화와 메모리 예산을 조정해 정밀도와 처리량의 균형을 맞추고, 엔진 계층에서는 Attention과 GEMM 같은 핵심 연산자를 병렬화한다. 칩 계층에서는 컴파일, 메모리 접근 스케줄링, 메모리 관리를 건드린다. 회사는 이 최적화 결과를 실제 트래픽으로 검증해 단일 지점의 병목이 전체를 막지 않도록 한다고 덧붙였다.

다음 단계로 제시된 것은 자원 풀링의 세분화다. 고정된 Prefill/Decode 비율 대신 Prefill Pool과 Decode Pool을 따로 두고, 실시간 부하와 KV 캐시 상태, 노드 상태를 반영해 요청을 라우팅한다. 긴 입력으로 Prefill 압력이 커지면 P 노드를 늘리고, 긴 출력으로 Decode 부하가 오르면 D 노드를 늘리는 식이다. 나아가 Encoder, Attention, FFN, 비전 인코더 같은 모듈을 각각 독립 자원 풀로 쪼개 부하 특성에 맞춰 탄력적으로 확장하는 방향이 언급됐다. 다만 이 모듈 단위 풀링은 배포된 기능이 아니라 향후 아키텍처 진화 방향으로 제시된 것이다.

배경에는 에이전트형 워크로드의 특성이 있다. 단일 턴 대화와 달리 긴 컨텍스트가 입력 연산과 KV 캐시 점유를 계속 키우고, 여러 턴이 이어지면서 프리픽스 재사용 패턴과 핫스팟이 계속 바뀐다. 트래픽과 길이 분포가 요동치는 버스트·롱테일 수요도 흔하다. 회사는 이 변화에 맞춰 설계 기준을 토큰, 상태, 지연 예산 중심으로 옮겼다고 밝혔다.

추론 서버를 직접 운영하는 개발자에게 이 사례가 주는 시사점은 스케줄링 계층의 추상화 수준이다. Prefill과 Decode를 분리 서빙하고 KV 캐시를 노드 간에 넘기는 구조는 이미 여러 오픈소스 추론 엔진이 다루는 주제지만, 여기서는 하드웨어 종류를 스케줄러가 런타임에 바꿀 수 있는 변수로 취급한다는 점이 다르다. 모델·엔진·칩을 각각 최적화 대상으로 분리해 검증하는 방식도 참고할 만하다.

다만 공개된 내용에는 구체성이 부족한 부분이 있다. 어떤 칩 조합을 실제로 쓰는지, SLO를 어느 수준으로 잡았는지, 단위 비용이 얼마나 줄었는지는 제시되지 않았다. 토큰 처리량 증가폭 역시 회사 자체 발표이며, 이기종 혼합 추론이 단일 칩 구성보다 실제로 얼마나 유리한지를 보여주는 독립적인 비교 데이터는 원문에 포함되지 않았다.

관련 글