전략 게임 두는 초소형 신경망 순위전이 8 KiB 체급부터 시작해 공개됐다
전략 게임을 두는 초소형 신경망을 위한 순위 사다리, 즉 랭킹 시스템이 공개됐다. 참가 절차는 세 단계로 요약된다. 모델을 학습시키고, 대회가 정한 방식에 맞는 어댑터를 작성한 뒤, 파일 두 개를 업로드하면 된다. 업로드된 모델은 크기에 따라 체급이 매겨져 순위 경쟁에 들어간다.
가장 눈에 띄는 규칙은 체급의 하한이다. 최소 체급이 8 KiB에서 출발한다. 한 자릿수 킬로바이트에서 경쟁이 시작된다는 것은 모델 파라미터 수와 저장 형식이 극단적으로 제한된다는 뜻이다. 참가자는 자신의 모델이 어느 체급에 배정되는지를 기준으로 경쟁 상대가 정해지는 구조를 받아들이게 된다.
최근 신경망 경쟁은 대체로 규모를 키우는 방향으로 흘러왔다. 이 대회는 반대로 크기 자체를 규칙으로 못 박는다. 성능을 끌어올리는 것만큼이나 주어진 바이트 안에 얼마나 효율적으로 담아내는지가 승부를 가르는 셈이다. 게다가 전략 게임이라는 과제는 단순 분류와 달리 국면을 읽고 수를 선택하는 의사결정을 요구한다.
실무 관점에서 이 대회는 경량 모델 설계와 압축 감각을 시험하는 실험대가 된다. 학습 파이프라인을 돌리고, 정해진 규격에 맞춰 어댑터를 붙이고, 결과물을 파일 형태로 제출하는 흐름은 실제 배포 과정과 크게 다르지 않다. 특히 바이트 예산이 고정된 환경에서 무엇이 어디까지 버티는지 확인하려는 개발자에게 참고할 만한 지표가 된다.
다만 확인되는 정보는 제한적이다. 어떤 전략 게임을 대상으로 하는지, 어댑터 규격은 무엇인지, 체급이 몇 단계로 나뉘는지, 평가와 순위 산정이 어떻게 이뤄지는지는 드러나지 않는다. 참가를 검토한다면 대회 페이지에서 규칙과 제출 형식을 직접 확인해야 한다.
관련 글
- 8~29MB 초소형 온디바이스 모델 'Needle 3' 공개…레이어 깊이별 성능 사다리로 도구 호출·구조화 추출 노린다캑터스가 8~29MB 크기의 온디바이스 파운데이션 모델 Needle 3를 공개했다. 하나의 가중치에서 2~20레이어 서브네트워크를 골라 쓰는 구조로, 4레이어를 튜닝하면 DeepSeek V4 Flash에 맞먹는다고 주장한다.
- Qwen3.5 기반 초소형 의사결정 모델 'Kev'가 공개됐다.Qwen3.5를 베이스로 한 초소형 의사결정 모델 Kev가 공개됐다. 0.8B·4B·9B 세 크기로 제공되며 예/아니오·객관식·평점 질문을 한 요청에 처리하고 확률과 신뢰도를 함께 돌려준다. 학습 코드와 평가 데이터, 로컬 서빙까지 포함된다.
- a16z가 투자한 Vals, '문항 비공개' 산업별 평가로 AI 벤치마크 판을 뒤집으려 한다AI 벤치마킹 스타트업 Vals가 앤드리슨 호로위츠가 이끄는 시리즈 A에서 4천만 달러를 유치했다. 시험 문항을 공개하지 않고 법률·금융·코딩 등 산업별 실무 과제로 모델을 평가해 기존 벤치마크의 한계를 겨냥한다.
- CUA-S1은 컴퓨터 사용 에이전트의 판단만 전담하는 소형 모델로 공개됐다.trycua/cua가 컴퓨터 사용 에이전트의 빠른 판단을 전담하는 소형 모델 계열 CUA-S1을 공개했다. 오픈소스 드라이버와 클라우드 데스크톱 플릿, 평가용 벤치마크까지 함께 묶여 나왔고 소스는 MIT 라이선스다.