StepFun, Step 5 Preview 공개…에이전트 성능에 무게 둔 92층 모델
중국 AI 기업 StepFun(阶跃星辰)이 새 플래그십 기반 모델 Step 5 Preview를 예고 없이 공개했다. 이번 버전에서 회사가 전면에 내세운 것은 에이전트 수행 능력이다. 회사 측이 인용한 Artificial Analysis 최신 평가에서 Step 5 Preview는 44점을 받아 오픈소스 모델 가운데 2위에 올랐다고 한다. 같은 평가에서 작업 하나를 처리하는 비용은 Opus 5의 12.5% 수준으로 제시됐다. 지능 지수와 작업당 비용을 함께 놓고 보면 '파레토 프런티어'에 위치한다는 것이 회사 측 설명이다.
구조는 'Narrow but Deep'으로 요약된다. 92층 Transformer를 쓰면서 활성화 규모는 억제하고, 정보가 더 많은 층을 연속으로 통과하도록 설계했다는 것이다. 에이전트 작업은 여러 단계를 거쳐 앞서 찾은 정보를 한참 뒤에야 쓰는 multi-hop 의존성이 많고, 도구 호출이 수십 번 반복되면 컨텍스트가 수백만 토큰까지 불어난다. Sparse MoE, Hybrid Sparse, Sparse GQA 같은 기법이 이 컨텍스트 문제를 다루기 위한 선택이라는 설명이다. StepFun은 인덱싱과 메모리 접근, 스케줄링을 제대로 처리하지 못하면 이론적으로 아낀 연산이 실제 처리량으로 이어지지 않는다며, 저수준 연산자와 데이터 접근 최적화를 함께 적용했다고 밝혔다.
학습 쪽에서는 Long-horizon RL과 Context Compaction 같은 방법을 통해, 도구를 수십 차례 호출한 뒤에도 모델이 자신이 무엇을 하려 했는지 유지하도록 만들었다고 한다. 회사는 모델의 기본 단위가 '답변'에서 '루프'로 바뀌었다는 표현으로 이를 요약했다. 성능과 비용이 맞물리는 지점을 겨냥해, 한정된 연산 예산을 에이전트 능력에 실제로 영향을 주는 곳에 쓰는 전략이라는 것이다.
계보를 보면 Step 3.5 Flash, Step 3.7 Flash에 이어 이번 Step 5 Preview로 이어진다. 앞선 두 세대가 Flash 등급에 집중했다면 이번에는 에이전트 축으로 무게가 옮겨간 셈이다. 원문은 2026년 3월 기준으로 Anthropic, xAI, Google, OpenAI의 최상위 모델들이 Arena에서 25 Elo 이내로 좁혀졌다는 Stanford 2026 AI Index 수치도 함께 인용하며, 프런티어의 문턱은 높아지는 동시에 그 안쪽은 더 빽빽해지고 있다는 맥락을 전한다.
개발자 입장에서 눈에 띄는 지점은 비용 대비 처리량이다. 도구 호출이 길게 이어지는 에이전트 파이프라인에서는 컨텍스트가 커질수록 비용이 급격히 늘어나는데, 작업당 단가를 낮추면서 긴 루프를 유지하는 것을 목표로 삼았다는 서술은 실무 워크로드 설계와 직접 맞닿는다. 다만 이 수치는 회사가 인용한 평가 결과이며, 독립적인 재현 검증이 이뤄졌다는 언급은 원문에 없다.
한계도 함께 제시됐다. 원문 작성자가 직접 Blender로 공간을 만들게 하고, 1999년 LEGO Racers를 참고한 레이싱 게임과 2D 러닝 게임을 만들게 하는 방식으로 시험한 결과, 첫 시도에서는 세부가 빠지는 경우가 많았고 모듈 오버플로 같은 버그도 나타나 검토와 수정이 필요했다고 한다. 다른 모델(Astra) 수준의 완성도에는 아직 못 미친다는 평가도 덧붙였다. 이는 어디까지나 개인적인 실사용 후기이며, 벤치마크 점수와 실제 복잡한 장기 작업에서의 성능이 항상 일치하지는 않는다는 점을 함께 보여준다.